把网站转换成知识库的 DeepCrawl API
启动后台爬取任务,追踪任务状态,并为 RAG 系统和 agent 记忆流程收集站点内容。
接口POST https://api.search1api.com/deepcrawl
在后台采集较大网站的内容,让产品不用等待单次请求,也能构建完整知识库。
抓取文档、博客和帮助中心。
后台追踪长任务进度。
页面可用于 RAG 和搜索。
适合用于
文档知识库 / 搜索索引 / AI 工作流
面向较大网站的异步爬取
DeepCrawl 会启动任务并返回 task ID,应用可以在爬取运行时轮询状态。你可以使用 sitemap 模式做受控爬取,也可以使用 all 模式做更广泛的链接发现。
把整个网站快速变成文档
只需输入一个链接,即可实现快速爬取站内所有链接内容,保存到本地。
Markdown 输出
以整洁的 Markdown 文件格式输出,可直接用于大模型的知识库检索。
异步处理
任务在后台运行,可随时查询任务状态。
递归链接跟随
可自由选择是按照 sitemap 抓取,还是抓取站内所有链接内容。
DeepCrawl 定价
DeepCrawl 按任务固定计费:启动一次爬取消耗 20 积分($0.06),与该站点返回多少页面无关。通过 GET /deepcrawl/status/:taskId 轮询任务状态始终免费。新账号自带 100 免费积分,足够爬取五个完整站点;后续可通过积分订阅或按量充值扩展用量。
每任务固定 20 积分($0.06)——站点规模不影响价格。
状态查询免费——按需轮询 /deepcrawl/status/:taskId。
注册即送 100 免费积分——无需信用卡即可爬五个站点。
通过积分订阅或按量充值扩展。
典型流程
启动后台爬取任务,追踪任务状态,并为 RAG 系统和 agent 记忆流程收集站点内容。
用 URL 和发现模式启动 DeepCrawl 任务。
保存返回的 task ID,并轮询 status endpoint。
把完成结果处理进知识库或文档存储。
适合场景
从文档、帮助中心和博客构建 RAG 知识库。
基于整站内容刷新内部搜索索引。
在不阻塞用户请求的情况下打包大站内容。
自建爬虫经常遇到风控封锁?
如果你自己跑爬虫,经常被限流或被反爬机制拦截,可以通过我们的动态住宅代理转发请求,获得全新 IP 和地区定位。
常见问题
DeepCrawl 为什么是异步的?
整站爬取通常比普通请求耗时更久。DeepCrawl 返回 task ID,让任务在后台运行,应用按需查询状态。
DeepCrawl API 消耗多少积分?
启动一次 DeepCrawl 任务按站点固定消耗 20 积分($0.06),与返回页数无关。/deepcrawl/status/:taskId 状态查询免费,注册赠送的 100 积分可以爬五个完整站点。