arXiv 论文搜索

用 arXiv 搜索 API 检索论文与预印本

通过 HTTP 检索 arXiv,在一个字段里拿到作者、投稿日期和摘要,不需要解析官方接口返回的 Atom feed。

接口
POST https://api.search1api.com/search
arXiv 搜索结果包含什么

结果的 JSON 结构与其他引擎一致,现有的解析逻辑不需要改动。

1
论文标题与链接

链接指向 arxiv.org 上的论文页面。

2
作者与投稿日期

摘要以作者列表和 ISO 格式日期开头。

3
论文摘要

摘要的其余部分是论文的 abstract。

适用于

文献综述 / 研究型 agent / 趋势追踪

拿到的是 JSON 而不是 Atom

把 `search_service` 设为 `arxiv`,结果就来自 arXiv。接口地址、鉴权方式和响应结构与其他引擎完全一致,不需要单独写一套 feed 解析。

摘要里自带引用字段

`snippet` 字段的格式为「作者 | 日期 | abstract」,不用再发一次请求就能拼出一条引用。

ISO 格式的投稿日期

日期以 `YYYY-MM-DD` 返回,不用归一化就能排序和过滤。

不只有标题,还有 abstract

abstract 就在摘要里,模型可以在决定要不要抓全文之前先判断相关性。

标准 Search 参数

`max_results` 最大 50,以及 `include_sites`、`exclude_sites`、`time_range`。

什么是 arXiv 搜索 API?

arXiv 搜索 API 是一种 HTTP 接口,把 arXiv 上的论文以结构化结果返回。arXiv 自己也提供查询接口,但返回的是需要解析和重整的 Atom feed,并要求调用方自行控制请求频率。Search1API 把 arXiv 作为 Search 接口的一个搜索服务提供,返回论文标题、arxiv.org 链接,以及带作者列表、投稿日期和 abstract 的摘要,JSON 结构与其他引擎一致。这个顺序对研究型 agent 很重要:abstract 跟着搜索结果一起到,可以在花掉一次全文抓取之前先判断相关性。

接入路径

典型流程

通过 HTTP 检索 arXiv,在一个字段里拿到作者、投稿日期和摘要,不需要解析官方接口返回的 Atom feed。

1

把 `search_service` 设为 `arxiv` 后发送查询。

2

按竖线切分 `snippet`,分离出作者、日期和 abstract。

3

当流程需要论文页面而不只是 abstract 时,设置 `crawl_results`。

一次请求,带引用字段的论文

一次调用即可检索 arXiv,每条结果带上作者、投稿日期和 abstract,一遍就能同时完成拼引用和判相关性。

bash
curl -X POST https://api.search1api.com/search \
-H "Authorization: Bearer $SEARCH1API_KEY" \
-H "Content-Type: application/json" \
-d '{
"query": "retrieval augmented generation",
"search_service": "arxiv",
"max_results": 5
}'

适合场景

需要先看 abstract 再决定读全文的文献综述。

需要带作者和日期引用论文的研究型 agent。

按投稿日期追踪某个方向进展的调研。

把 abstract 作为一级检索层索引的 RAG 管道。

常见问题

和 arXiv 官方 API 有什么区别?

arXiv 自己的接口返回的是需要解析和重整的 Atom feed,并要求调用方自行限流。Search1API 返回的是与其他引擎同一套结构的 JSON,作者、日期和 abstract 已经拼好在摘要里。

可以拿到论文全文吗?

把 `crawl_results` 设为需要抓取的结果数量,成功抓取的页面会包含 `content` 字段,内容是 markdown 格式的正文。抓取失败的结果不返回 `content`,也不计费。

返回的只有预印本吗?

结果来自 arXiv,上面既有预印本,也有作者自行存档的已发表论文版本。摘要里的日期是 arXiv 的投稿日期,不是期刊的发表日期。

arXiv 搜索的费用是多少?

每次搜索消耗 1 积分,通过 `crawl_results` 每成功抓取一个页面追加 1 积分。按 $1 = 1,000 积分的充值基础价计算,1,000 次搜索为 $1。注册即送 100 个免费积分,无需信用卡。

可以按时间范围筛选吗?

按天、周、月、年可以用 `time_range`。需要具体区间时,投稿日期会在摘要里返回,可以在拿到结果之后再过滤。

还支持哪些研究类来源?

同一个 Search 接口还支持参考条目的 `wikipedia`、实现代码的 `github` 和讨论的 `reddit`,加上通用网页引擎和中文引擎,一套契约共 17 个引擎。