Firecrawl Research 是一个专为科学与工程研究代理构建的专用索引。它提供一套面向研究的工具集,用于搜索论文、查看论文元数据、阅读相关的全文片段,以及通过结构化扩展发现相关论文。
该索引涵盖约 4300 万篇论文摘要。语料库大部分来自生物医学与生命科学领域——PubMed、bioRxiv 和 medRxiv——同时也包含物理学、数学和计算机科学领域的 arXiv。论文可通过其来源 ID 进行寻址,因此 pmid:、pmcid: 和 doi: 引用的使用方式与 arxiv: 相同。
- 按主题、方法、基准、作者或类别查找论文
- 查看规范论文元数据和来源 ID
- 阅读单篇论文中能够回答特定问题的片段
- 从高质量的种子论文扩展到相关论文、引用它们的论文或参考文献
与 /search 的关系#
Firecrawl 中有两个名为“research”的功能,它们并不是同一项功能:
| 研究索引 (本页) | 使用 categories: ["research"] 的 /search | |
|---|---|---|
| 搜索范围 | 包含约 4300 万篇摘要的论文索引——PubMed、bioRxiv、medRxiv、arXiv | 开放网页,但仅限约 14 个学术网站 (arxiv.org、nature.com、pubmed.ncbi.nlm.nih.gov、……) |
| 返回内容 | 排序后的论文记录:规范的 paperId、primaryId、来源 ID、标题、完整摘要、评分 | 普通网页结果:URL、标题、snippet |
| 能否阅读论文内容 | 可以——通过 GET /search/research/papers/{id} 按段落阅读 | 不可以 |
| 能否通过引用扩展 | 可以——GET /search/research/papers/{id}/similar | 不可以 |
| 端点 | GET /search/research/papers | POST /search |
进行文献研究时——查找论文、阅读论文、追踪引用——请使用研究索引。如果您想获取位于学术域名上的普通网页,请使用 categories: ["research"]。
端点#
| 任务 | 端点 |
|---|---|
| 搜索论文 | GET /search/research/papers |
| 查看元数据或阅读内容片段 | GET /search/research/papers/{id} |
| 查找相关论文 | GET /search/research/papers/{id}/similar |
搜索论文#
使用自然语言查询来搜索论文摘要。响应会返回按相关性排序的论文,包含规范 paperId、首选 primaryId、来源 id、标题、摘要、评分,以及可选的排序信号。
可选过滤条件:
authors:按作者子字符串过滤;所有过滤条件都必须匹配categories:按论文类别过滤,例如cs.LGfrom:created/updated 的包含下界,格式为YYYY-MM-DDto:created/updated 的包含上界,格式为YYYY-MM-DD
生物医学示例#
索引中的大多数内容属于生命科学,因此临床和分子生物学查询的使用方式相同:
结果会携带源所用命名空间中的 primaryId,因此生物医学搜索结果会以 pmid:<id>、pmcid:<id> 或 doi:<doi> 的形式返回。将该值直接传入下方的 inspect、read 和 related endpoint。
查看论文#
使用规范 paperId 或来源特定的 primaryId。支持的 primaryId 格式包括 arxiv:<id>、pmid:<id>、pmcid:<id> 和 doi:<doi>;例如,要查询 PubMed 记录,可使用 curl -s ".../v2/search/research/papers/pmid:<id>"。
读取论文片段#
在同一个论文路径中添加 query,即可检索出与某个问题最相关的若干全文片段。这有助于你在纳入候选论文之前,先确认其中是否确实包含某种方法、数据集、约束条件或结果。
以一篇或多篇种子论文为起点,通过语义扩展发现更多论文,并根据自然语言 intent 对候选论文进行排序。
模式:
similar:共被引和书目耦合邻域中的论文citers:引用种子论文的论文references:种子论文引用的论文

