用 arXiv 搜索 API 检索论文与预印本
通过 HTTP 检索 arXiv,在一个字段里拿到作者、投稿日期和摘要,不需要解析官方接口返回的 Atom feed。
接口POST https://api.search1api.com/search
结果的 JSON 结构与其他引擎一致,现有的解析逻辑不需要改动。
链接指向 arxiv.org 上的论文页面。
摘要以作者列表和 ISO 格式日期开头。
摘要的其余部分是论文的 abstract。
适用于
文献综述 / 研究型 agent / 趋势追踪
拿到的是 JSON 而不是 Atom
把 `search_service` 设为 `arxiv`,结果就来自 arXiv。接口地址、鉴权方式和响应结构与其他引擎完全一致,不需要单独写一套 feed 解析。
摘要里自带引用字段
`snippet` 字段的格式为「作者 | 日期 | abstract」,不用再发一次请求就能拼出一条引用。
ISO 格式的投稿日期
日期以 `YYYY-MM-DD` 返回,不用归一化就能排序和过滤。
不只有标题,还有 abstract
abstract 就在摘要里,模型可以在决定要不要抓全文之前先判断相关性。
标准 Search 参数
`max_results` 最大 50,以及 `include_sites`、`exclude_sites`、`time_range`。
什么是 arXiv 搜索 API?
arXiv 搜索 API 是一种 HTTP 接口,把 arXiv 上的论文以结构化结果返回。arXiv 自己也提供查询接口,但返回的是需要解析和重整的 Atom feed,并要求调用方自行控制请求频率。Search1API 把 arXiv 作为 Search 接口的一个搜索服务提供,返回论文标题、arxiv.org 链接,以及带作者列表、投稿日期和 abstract 的摘要,JSON 结构与其他引擎一致。这个顺序对研究型 agent 很重要:abstract 跟着搜索结果一起到,可以在花掉一次全文抓取之前先判断相关性。
典型流程
通过 HTTP 检索 arXiv,在一个字段里拿到作者、投稿日期和摘要,不需要解析官方接口返回的 Atom feed。
把 `search_service` 设为 `arxiv` 后发送查询。
按竖线切分 `snippet`,分离出作者、日期和 abstract。
当流程需要论文页面而不只是 abstract 时,设置 `crawl_results`。
一次请求,带引用字段的论文
一次调用即可检索 arXiv,每条结果带上作者、投稿日期和 abstract,一遍就能同时完成拼引用和判相关性。
bashcurl -X POST https://api.search1api.com/search \-H "Authorization: Bearer $SEARCH1API_KEY" \-H "Content-Type: application/json" \-d '{"query": "retrieval augmented generation","search_service": "arxiv","max_results": 5}'
适合场景
需要先看 abstract 再决定读全文的文献综述。
需要带作者和日期引用论文的研究型 agent。
按投稿日期追踪某个方向进展的调研。
把 abstract 作为一级检索层索引的 RAG 管道。
常见问题
和 arXiv 官方 API 有什么区别?
arXiv 自己的接口返回的是需要解析和重整的 Atom feed,并要求调用方自行限流。Search1API 返回的是与其他引擎同一套结构的 JSON,作者、日期和 abstract 已经拼好在摘要里。
可以拿到论文全文吗?
把 `crawl_results` 设为需要抓取的结果数量,成功抓取的页面会包含 `content` 字段,内容是 markdown 格式的正文。抓取失败的结果不返回 `content`,也不计费。
返回的只有预印本吗?
结果来自 arXiv,上面既有预印本,也有作者自行存档的已发表论文版本。摘要里的日期是 arXiv 的投稿日期,不是期刊的发表日期。
arXiv 搜索的费用是多少?
每次搜索消耗 1 积分,通过 `crawl_results` 每成功抓取一个页面追加 1 积分。按 $1 = 1,000 积分的充值基础价计算,1,000 次搜索为 $1。注册即送 100 个免费积分,无需信用卡。
可以按时间范围筛选吗?
按天、周、月、年可以用 `time_range`。需要具体区间时,投稿日期会在摘要里返回,可以在拿到结果之后再过滤。
还支持哪些研究类来源?
同一个 Search 接口还支持参考条目的 `wikipedia`、实现代码的 `github` 和讨论的 `reddit`,加上通用网页引擎和中文引擎,一套契约共 17 个引擎。