免费在线工具

站点地图 提取

输入一个域名,拿到网站在 sitemap 里发布的全部 URL:按栏目分组、可搜索,一键导出或转成 Markdown。

试试
读取来源
  1. robots.txt
  2. sitemap.xml
  3. sitemap_index.xml
  4. .xml.gz
  5. 页面链接兜底
工作原理

读网站自己发布的 sitemap,而不是猜

  1. 输入域名

    只填 example.com 就够了,填站内任意网址效果相同。结果只保留同一主机名下的 URL。

  2. 自动发现 sitemap

    优先使用 robots.txt 里的 Sitemap: 声明,再尝试常见的 sitemap 路径;sitemap 索引和 gzip 文件会自动展开。

  3. 浏览、筛选、导出

    URL 按一级栏目分组。可以按关键词筛选、导出 TXT 或 CSV,或把任意页面送去转 Markdown。

使用场景

一份完整的 URL 清单能做什么

SEO 审计

核对你实际提交给搜索引擎的页面:混进来的测试页、缺失的栏目、不该被收录的 URL。

网站迁移

把旧站的 URL 清单导出为 CSV,切换前用它做 301 重定向映射的源列表。

爬取与 RAG

拿到确切的待爬页面列表,而不是盲目跟随链接;再把每个页面转成 Markdown 存入索引。

内容调研

看清竞品如何组织文档、博客和落地页,以及每个栏目各有多少页面。

常见问题

URL 列表从哪里来?

来自网站发布的 XML sitemap。先读取 robots.txt 里的 Sitemap: 声明,再依次尝试 /sitemap.xml、/sitemap_index.xml、/sitemap-index.xml 和 /sitemap.xml.gz。sitemap 索引会展开一层。

网站没有 sitemap 怎么办?

会退回到你输入的页面上的链接,并按同一主机名过滤。这份列表通常比真正的 sitemap 短很多。

URL 数量有上限吗?

单次提取最多返回 5,000 个 URL,按 sitemap 中的顺序。docs.example.com 这类子域名有自己的 sitemap,可以单独提取。

免费吗?

免费。未登录每天可提取 10 次;注册免费账号后,每次提取从你自己的 API 密钥扣 1 积分,新账号赠送 100 积分。

可以导出结果吗?

可以。一键复制全部 URL,或下载 .txt 清单,或下载包含 URL、路径和栏目的 .csv 文件。

能在代码里调用吗?

这个页面基于 Search1API 的 /sitemap 接口,同样的请求可以通过 REST API、SDK 和 MCP 服务调用。

在你自己的代码里提取站点地图

同样的站点地图提取只需要一个 POST 请求,再配合 /crawl 把每个页面转成 Markdown。