Olostep icon

Olostep

Olostep 是面向 AI agents 和开发者的 Web 数据基础设施 API,可搜索、抓取、爬取、结构化和监控网页内容,支持多种端点并输出适用于研究、增强和实时工作流的 LLM-ready 结果。

Olostep

面向 AI agents 的 Web 数据基础设施

Olostep 是面向 AI agents 和开发团队的 Web 数据基础设施平台,可通过一个 API 搜索、抓取、爬取、结构化和监控网页内容。该网站将其定位为一种以结构化、LLM-ready 输出来支持研究、增强、RAG 和实时数据工作流的方式。

其公开 API 按不同任务划分为多个聚焦端点:Scrapes 用于已知 URL,Maps 用于域名 URL 发现,Crawls 用于多页面站点遍历,Batches 用于大型任意 URL 列表,Searches 用于语义发现,Answers 用于带来源依据的回复,Monitors 用于定期检查。主页还展示了原生 Python 和 NodeJS SDK 客户端,以及 cURL 示例,因此团队可以通过代码或直接通过 HTTP 使用该服务。

核心能力

语义搜索与排序发现

使用自然语言查询搜索网络,并接收带标题和描述的排序链接;当你需要在提取前先进行发现时,这很有用。

单 URL 抓取

从你已知的 URL 中提取内容,并可请求 markdown、HTML、文本、JSON、截图和解析器输出等格式。

带页面检索的网站爬取

从起始 URL 开始,结合深度和页面限制遍历网站,然后分别列出页面并检索每个页面的内容。

域名 URL 映射

通过筛选和 cursor 分页发现某个域名下的 URL,有助于在不维护自有发现管道的情况下构建来源列表。

大规模 URL 批处理

在一个任务中处理大型任意 URL 列表,并支持解析器、元数据、webhook 和基于 cursor 的条目访问。

网页监控与提醒

设置定期监控以跟踪网页,并通过 email、Slack、SMS 或 webhook 发送变更提醒。

常见工作流

  • 为研究任务寻找候选来源

    当你需要从自然语言问题中获得排序后的链接,并希望在不自行维护搜索抓取器的情况下从发现过渡到提取时,使用 Search。

  • 从单个页面提取内容

    当你已经知道 URL,并且需要以特定格式(如 markdown、HTML、JSON 或截图)获取页面内容用于下游处理时,使用 Scrapes。

  • 从网站遍历中收集内容

    当内容分布在网站中,例如文档、博客或其他多页面结构,并且你需要从起始 URL 逐页检索时,使用 Crawls。

  • 构建域名 URL 列表

    当你需要先盘点某个域名上的 URL,再决定要抓取或进一步处理哪些页面时,使用 Maps。

  • 大规模处理 URL 列表

    当你有一份大型任意 URL 列表,并希望在一个任务中以可预测的完成方式以及 webhooks 等运维工具进行处理时,使用 Batches。

Pros and Cons

Pros

  • 在一个平台中覆盖了多种常见的 Web 数据工作流,包括搜索、抓取、爬取、映射、批处理、答案和监控。
  • 支持多种输出形式,在适用情况下包括 markdown、HTML、文本、JSON、截图和解析器输出。
  • 提供 Python、NodeJS 和 cURL 的代码示例,便于在不同技术栈中采用。
  • 定价页面包含 500 次成功请求的免费试用,以及付费方案、加购额度和企业选项。
  • 端点页面描述了适用于规模化工作流的 webhooks、元数据和 cursor 分页等运维功能。

Cons

  • 产品分散在多个端点中,因此选择正确的端点取决于工作流,而不是使用一个通用的单一调用。
  • 来源未提供每个端点能力的完整文档,因此一些高级行为、限制和集成仅凭公开页面无法完全看清。

FAQ

我应该为特定工作流使用哪个端点?

Olostep 为不同的 Web 数据任务提供了聚焦的端点。源页面说明,Scrapes 用于已知的单个 URL,Maps 用于发现某个域名上的 URL,Crawls 用于从起始 URL 遍历网站,Batches 用于大型任意 URL 列表,Searches 用于排序后的网页结果,Answers 用于带来源依据的自然语言回复,Monitors 用于定期检查。

Olostep 提供的是 SDK 还是只有原始 HTTP API?

源信息显示了原生 Python 和 NodeJS SDK 客户端,以及 cURL 示例。公开页面还展示了针对 Scrapes、Crawls、Maps 和 Batches 的按端点 HTTP 请求与代码示例。

有免费方案或试用吗?

定价页面说明免费试用包含 500 次成功请求,付费方案从每月 9 美元起。同一页面还提到可加购的额度包以及自定义定价的企业方案。

Olostep 返回什么类型的输出?

主页显示 Scrapes 可返回 markdown、HTML、截图和 JSON,而端点页面还提到 text 和 parser output。Crawls 会返回每页的 retrieve ID,之后可从 /v1/retrieve 获取内容。

Olostep 可以用于持续监控吗?

端点页面将 Monitors 描述为可检测页面变更并通过 email、Slack、SMS 或 webhook 发送提醒的定期检查。主页和定价页更侧重 Web 数据 API,而 monitors 的详细信息出现在端点概览页。

Quick Facts

类别
Web 数据基础设施
主要用户
AI agents、开发者和研究团队
接口
带 SDK 客户端和 cURL 示例的 HTTP API
关键端点
Scrapes、Crawls、Maps、Batches、Searches、Answers、Monitors
定价入口
提供免费试用;定价页上有付费方案和加购额度
网站
olostep.com
Olostep - AI Tool, Features, Use Cases & Alternatives | UStack