用维基百科搜索 API 检索词条
通过 HTTP 检索维基百科,每条结果直接带上词条正文的摘录,为模型的回答提供一个稳定的定义作为依据。
接口POST https://api.search1api.com/search
结果的 JSON 结构与其他引擎一致,现有的解析逻辑不需要改动。
规范化后的词条名,例如 Transformer (deep learning)。
链接指向 wikipedia.org 上的词条页面。
摘要是词条正文里的文字,而不是对词条的描述。
适用于
答案接地 / 取定义 / 实体消歧
一个可以拿来接地的稳定定义
把 `search_service` 设为 `wikipedia`,结果就来自维基百科词条。接口地址、鉴权方式和响应结构与其他引擎完全一致。
给的是正文摘录,不是简介
`snippet` 字段是词条正文里的文字,可以直接引用,而不只是当作引导性摘要。
规范标题可用于实体消歧
词条标题已经做过消歧,查询会落到一个具体实体上,而不是一个含糊的名字。
漂移小,适合做锚点
参考类词条的变化速度远低于公开网页,在其他来源互相矛盾时可以作为稳定基准。
标准 Search 参数
`max_results` 最大 50,以及 `include_sites`、`exclude_sites`、`time_range`。
什么是维基百科搜索 API?
维基百科搜索 API 是一种 HTTP 接口,把维基百科词条以结构化结果返回。维基媒体基金会也提供自己的 API,功能强大,但它是围绕 MediaWiki 的概念设计的 —— page ID、修订版本、continuation token —— 需要单独写一套客户端代码。Search1API 把维基百科作为 Search 接口的一个搜索服务提供,返回词条标题、词条链接和作为摘要的正文摘录,JSON 结构与其他引擎一致。给模型接地时,这通常正是需要的形状:一次调用,拿到一个规范标题和足够支撑定义的文字,然后再决定要不要继续读。
典型流程
通过 HTTP 检索维基百科,每条结果直接带上词条正文的摘录,为模型的回答提供一个稳定的定义作为依据。
把 `search_service` 设为 `wikipedia` 后发送查询。
把词条标题当作已解析的实体,把摘要当作接地用的文本。
当流程需要词条全文而不只是摘录时,设置 `crawl_results`。
一次请求,拿到可引用的定义
一次调用即可检索维基百科,每条结果带上正文摘录,不用再抓一次就能给回答提供依据。
bashcurl -X POST https://api.search1api.com/search \-H "Authorization: Bearer $SEARCH1API_KEY" \-H "Content-Type: application/json" \-d '{"query": "transformer model","search_service": "wikipedia","max_results": 5}'
适合场景
在继续推理之前先用定义给助手接地。
把含糊名称解析成规范标题的实体消歧。
需要在实时网页结果之外再有一层稳定参考的 RAG 管道。
把某个说法与参考词条对照的事实核查。
常见问题
和维基媒体官方 API 有什么区别?
维基媒体的 API 围绕 MediaWiki 的 page ID、修订版本、continuation token 等概念设计,需要单独写客户端代码。Search1API 返回的是与其他引擎同一套结构的 JSON,可以用和网页搜索完全相同的代码路径查询维基百科。
可以拿到词条全文吗?
可以。把 `crawl_results` 设为需要抓取的结果数量,成功抓取的页面会包含 `content` 字段,内容是 markdown 格式的词条正文。抓取失败的结果不返回 `content`,也不计费。
覆盖哪些语言版本?
结果跟随查询语言,也可以用 `language` 参数显式指定。中文参考资料方面,`baidu` 还会返回百度百科的词条。
维基百科搜索的费用是多少?
每次搜索消耗 1 积分,通过 `crawl_results` 每成功抓取一个页面追加 1 积分。按 $1 = 1,000 积分的充值基础价计算,1,000 次搜索为 $1。注册即送 100 个免费积分,无需信用卡。
把维基百科当作 AI 回答的来源可靠吗?
它是参考层,不是一手来源。用于定义、实体消歧和稳定背景很合适;研究性论断配 `arxiv`,时事配网页引擎。
还支持哪些参考类来源?
同一个 Search 接口还支持论文的 `arxiv` 和影视资料的 `imdb`,加上通用网页引擎和中文引擎,一套契约共 17 个引擎。