非同期サイトクロール

Web サイトをナレッジベースに変換する DeepCrawl API

バックグラウンドクロールを開始し、タスク状態を追跡し、RAG やエージェント記憶用のサイトコンテンツを収集できます。

エンドポイント
POST https://api.search1api.com/deepcrawl
この API で得られるもの

大きなサイトをバックグラウンドで収集し、ユーザーを待たせずナレッジベースを作れます。

1
サイト全体のコンテンツ収集

docs、ブログ、ヘルプを収集。

2
バックグラウンド進捗

長時間ジョブを追跡。

3
ナレッジベース素材

RAG や検索に使えるページ。

活用例

docs KB / 検索索引 / AI ワークフロー

大きなサイト向けの非同期クロール

DeepCrawl はタスクを開始して task ID を返すため、クロール中にアプリ側で status を確認できます。制御された sitemap モードと、より広い all モードを選べます。

ウェブサイト全体を素早くドキュメント化

リンクを入力するだけで、サイト内のすべてのリンクコンテンツを迅速にクロールし、ローカルに保存します。

Markdown出力

クリーンなMarkdownファイル形式で出力し、LLMの知識ベース検索に直接使用できます。

非同期処理

タスクはバックグラウンドで実行され、いつでもステータスを確認できます。

再帰的なリンク追跡

サイトマップに基づいてクロールするか、サイト内のすべてのリンクコンテンツをクロールするかを自由に選択できます。

DeepCrawl とは?

DeepCrawl は、Web サイト内の全ページのコンテンツをバックグラウンドで収集する非同期のサイト全体クロール API です。1 URL ずつ処理する単一ページのクロール API とは異なり、サイト内の全ページを検出し、その内容を取得して構造化データセットとして返します。個別ページではなくサイト全体のコーパスが必要な、ドキュメントサイト・ヘルプセンター・ブログからの RAG ナレッジベース構築に最適です。ディープクロールとは、エントリーページだけでなく Web サイト全体を、リンクを再帰的にたどってマッピングしコンテンツを抽出するプロセスです。

実装の流れ

基本フロー

バックグラウンドクロールを開始し、タスク状態を追跡し、RAG やエージェント記憶用のサイトコンテンツを収集できます。

1

URL と検出モードを指定して DeepCrawl タスクを開始します。

2

返された task ID を保存し、status endpoint をポーリングします。

3

完了結果をナレッジベースやドキュメントストアに取り込みます。

主な用途

サイト内のすべてのリンクコンテンツを迅速にクロールし、ローカルに保存します。

ドキュメント、ヘルプセンター、ブログから RAG ナレッジベースを作成。

Web サイト全体から内部検索インデックスを更新。

ユーザーリクエストをブロックせず大規模サイト内容を収集。

自作クローラーで anti-bot ブロックにお困りですか?

自前のスクレイパーがレート制限やボット検知でブロックされる場合は、ローテーション住宅用プロキシ経由でリクエストを送り、新しい IP と地域指定を活用できます。

FAQ

DeepCrawl はなぜ非同期ですか?

サイト全体のクロールは通常リクエストより時間がかかるためです。task ID を返し、バックグラウンドで実行しながら status を確認できます。

DeepCrawl API のクレジット消費は?

DeepCrawl タスクの開始は 20 クレジットです。

DeepCrawl とは何ですか?

DeepCrawl は、Web サイト内の全ページを検出・取得し、構造化データセットとして返す非同期のサイト全体クロール API です。RAG ナレッジベースの構築、検索インデックスの更新、ユーザーリクエストをブロックしない大規模サイトコンテンツの収集向けに設計されています。

ディープクロール(deep crawling)とは何ですか?

ディープクロールとは、エントリーページだけでなく Web サイト全体を対象に、リンクを再帰的にたどってページをマッピングし、コンテンツを抽出することです。DeepCrawl はこの処理を自動化し、sitemap またはリンク探索でページを発見し、各ページを取得してナレッジベースや RAG パイプライン向けのクリーンな本文を返します。

DeepCrawl と Crawl API の違いは?

Crawl API は 1 つまたは少数の URL を同期的に処理し、すぐにクリーンな本文を返します。DeepCrawl はサイト全体をバックグラウンドで非同期クロールし、全ページを検出してサイト全体のコーパスを返します。個別ページには Crawl、サイト全体には DeepCrawl を使います。