把网页转换成 AI 可用内容的 Crawl API
无需维护自己的爬虫和 HTML 清洗管线,即可从 URL 提取可读正文和结构化结果。
接口Copy codePOST https://api.search1api.com/crawl
把混乱网页转换成干净、可阅读的内容,方便索引、总结、保存或交给 AI 使用。
提取页面主体正文。
保留标题、URL 和元数据。
适合 RAG、摘要和 agent。
适合用于
agent / RAG / 页面清洗
面向 agent 和数据管线的内容提取
Crawl endpoint 接收单个 URL 或 URL 批量数组,返回解析后的正文、标题、链接和元数据,适合把嘈杂 HTML 转换成 LLM 可用上下文。
快速提取
从简单网页中大约在3秒内获取结果。快速内容检索使您的AI应用程序保持响应。
结构化内容
以Markdown格式接收干净、解析的内容。非常适合AI处理,没有混乱的HTML或格式问题。
高级爬取
通过智能爬取规则绕过常见访问限制。访问阻止基本爬取的网站的内容。
多样化文档
从PDF和其他文档格式中提取内容,而不仅仅是HTML。扩展您的AI知识库到所有内容类型。
典型流程
无需维护自己的爬虫和 HTML 清洗管线,即可从 URL 提取可读正文和结构化结果。
向 Crawl endpoint 提交一个 URL 或 URL 数组。
接收适合索引或作为 LLM 上下文的正文和元数据。
根据吞吐需求组合批量请求和重试策略。
适合场景
使用我们的智能爬取从任何网页提取内容
需要干净文章正文的 RAG 入库流程。
从多个站点统一抽取内容的聚合系统。
执行动作前需要阅读指定 URL 的 AI agent。
自建爬虫经常遇到风控封锁?
如果你自己跑爬虫,经常被限流或被反爬机制拦截,可以通过我们的动态住宅代理转发请求,获得全新 IP 和地区定位。
常见问题
Crawl API 能处理多个 URL 吗?
可以。发送 URL 对象数组即可在一次请求中进行批量处理。
Crawl API 消耗多少积分?
Crawl API 每次请求消耗 1 积分。只要抓取完整执行就会计费——包括目标服务器确认 URL 不存在的情况(经验证的 404/410 死链是一次完整的回答,与搜索确认无结果的计费口径一致)。如果是我们侧的故障(超时、上游错误)导致失败,则不扣积分。