科研 Agent 的第一道坎:不是模型不够强,而是证据拿不稳
而是证据拿不稳
过去一年,科研圈最刺眼的问题之一不是“AI 不会写”,而是“AI 写得太像真的”。
Nature 近期连续讨论了一个现象:AI 生成的幻觉引用正在进入科学文献。一些论文里的参考文献看起来格式完整、作者可信、标题合理,但 DOI 对不上,甚至文献根本不存在。
这件事把科研 Agent 的核心问题暴露得很清楚:
真正危险的不是模型不会总结,而是模型在没有可靠证据链的情况下总结得很流畅。
所以今天再讨论科研 AI,不能只问“哪个模型更聪明”,而要问另一个更底层的问题:
当一个 Agent 要回答科研问题时,它到底从哪里拿证据?能不能回到原文?能不能拿到页码、doc_id、图表和元数据?能不能被复查?
我把 Sciverse、OpenAlex、Semantic Scholar、Crossref、Europe PMC、arXiv 放到同一个框架里看了一遍。结论是:这些工具都能“找论文”,但它们适合的工作流完全不同。
一、先看数据量和定位
| 产品 | 公开数据规模 / 范围 | 更适合做什么 | 对 Agent 的关键限制 |
|---|---|---|---|
| Sciverse | 5.16 亿知识记录,814 种语言,1.3M+ 期刊与会议 | 科研 Agent、科学 RAG、全文证据读取、图表资源获取 | 需要 Token 和账号权限,生态还在扩展 |
| OpenAlex | 2026 roadmap 提到 4.77 亿 works | 开放学术知识图谱、机构/作者/引用/主题分析 | 语义搜索主要基于标题和摘要,不天然返回正文 evidence chunk |
| Semantic Scholar | S2AG 论文描述为 200M+ papers、2.4B+ citation edges | 论文发现、引用关系、作者/论文图谱 | API 更偏 paper metadata / graph,不是全文证据工作流 |
| Crossref | 2026 public data file 约 1.8 亿记录 | DOI 元数据、出版物注册信息、引用关系 | 不抓全文,不适合做语义证据检索 |
| Europe PMC | 3300 万+ publications,生命科学方向强 | 生物医学文献、OA 全文、图表、补充材料 | 学科范围相对集中 |
| arXiv | 2.3M+ 预印本,AI/物理/数学等更新快 | 追踪最新预印本 | 覆盖面窄,主要是预印本,不是全学科知识底座 |
| Google Scholar | 覆盖广,用户认知强 | 人工检索 | 没有稳定官方 API,不适合 Agent 自动化接入 |
如果只是“人搜论文”,Google Scholar 仍然很好用。
但如果目标是让 Claude、Cursor、Codex 或自研 Agent 自动检索、核对、读取、生成 evidence pack,问题就变了。
Agent 不只需要一个论文列表。它需要结构化、可调用、可追溯的科学证据。
二、真正的差异不在“能不能搜”,而在返回颗粒度
普通学术 API 常见返回是:
{
"title": "...",
"authors": [],
"year": 2025,
"doi": "...",
"abstract": "..."
}
这对人有用,但对 Agent 还不够。
Agent 真正需要的是:
{
"title": "...",
"doc_id": "...",
"chunk": "可引用的正文片段",
"page_no": 7,
"offset": 18234,
"score": 0.82
}
因为只有这样,它才能继续做三件事:
拿 doc_id 读原文;
拿 page_no / offset 定位证据;
把 evidence chunk 写进答案,而不是凭空生成引用。
这也是 Sciverse 和 OpenAlex、Crossref、Semantic Scholar 的主要差异点。
OpenAlex 很强,尤其是开放知识图谱和 metadata。它现在也提供 semantic search,但官方文档说明语义搜索主要基于 title + abstract embedding。它非常适合找“相关论文”,但如果你要让 Agent 直接拿“正文证据片段”,还需要额外链路。
Crossref 是 DOI 元数据基础设施,不是全文检索系统。
Semantic Scholar 强在 paper graph、citation graph、作者和论文关系。
Sciverse 的优势在于它把 Agent 常用动作拆成了 5 个接口:
agentic-search:自然语言问题 → 文献 evidence chunks
meta-search:结构化条件 → 论文元数据列表
content:doc_id → 分段读取全文
resource:file_name → 下载图表 / 附件资源
meta-catalog:查看 meta-search 可筛选、可排序字段
这套接口不是为“搜索页面”设计的,更像是为 Agent 工作流设计的。
三、快速对比:同一个问题,各家怎么调
假设问题是:
“perovskite solar cell stability interface engineering”
1. Sciverse:拿 evidence chunk
curl -X POST "https://api.sciverse.space/agentic-search" \
-H "Authorization: Bearer $SCIVERSE_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"query": "perovskite solar cell stability interface engineering",
"top_k": 5
}'
适合:科研问答、RAG evidence、综述 Agent。
预期返回:相关文献片段、标题、doc_id、页码或位置、score。
2. OpenAlex:找相关 works
curl "https://api.openalex.org/works?api_key=$OPENALEX_API_KEY&search.semantic=perovskite%20solar%20cell%20stability%20interface%20engineering&per-page=5&select=id,title,publication_year,doi,relevance_score"
适合:开放学术图谱、论文发现、作者/机构/主题分析。
注意:更偏 work-level 检索,不是直接返回正文证据片段。
3. Semantic Scholar:查论文和引用图谱
curl "https://api.semanticscholar.org/graph/v1/paper/search?query=perovskite%20solar%20cell%20stability%20interface%20engineering&limit=5&fields=title,year,abstract,authors,citationCount,openAccessPdf"
适合:论文检索、引用量、作者、开放 PDF 线索。
注意:很好用,但不是“chunk → content → resource”的证据链结构。
4. Crossref:查 DOI 元数据
curl "https://api.crossref.org/works?query.title=perovskite%20solar%20cell%20stability&rows=5"
适合:查 DOI、出版信息、期刊信息。
注意:不要把 Crossref 当全文搜索。它的价值是元数据可信和 DOI 体系。
5. Europe PMC:生命科学全文与图表
curl "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=CRISPR%20off-target%20detection&format=json&pageSize=5"
适合:生命科学、医学、OA 全文、图表、补充材料。
注意:如果你的场景是生物医学,Europe PMC 很强;如果是跨学科科学 Agent,范围就不够宽。
6. arXiv:追最新预印本
curl "https://export.arxiv.org/api/query?search_query=all:AI%20agent%20scientific%20discovery&start=0&max_results=5&sortBy=submittedDate&sortOrder=descending"
适合:AI、CS、物理、数学等方向追新。
注意:arXiv 不是全学科检索,也不是正式出版物知识库。
四、Sciverse 的实际使用链路
如果你要做一个科研 Agent,不建议一上来就“让模型搜索并回答”。
更稳的链路是:
用户问题
↓
agentic-search 找 evidence chunks
↓
根据 doc_id 去重
↓
content 读取原文上下文
↓
必要时 resource 拉取图表
↓
LLM 只基于 evidence 生成答案
↓
输出 doc_id / 页码 / DOI / 引用线索
下面是一个最小 Python 示例。
import os
import requests
BASE_URL = "https://api.sciverse.space"
TOKEN = os.getenv("SCIVERSE_API_TOKEN")
HEADERS = {
"Authorization": f"Bearer {TOKEN}",
"Content-Type": "application/json",
}
def agentic_search(query: str, top_k: int = 5):
r = requests.post(
f"{BASE_URL}/agentic-search",
headers=HEADERS,
json={"query": query, "top_k": top_k},
timeout=30,
)
r.raise_for_status()
return r.json()
def read_content(doc_id: str, offset: int = 0, limit: int = 1200):
r = requests.get(
f"{BASE_URL}/content",
headers={"Authorization": f"Bearer {TOKEN}"},
params={"doc_id": doc_id, "offset": offset, "limit": limit},
timeout=30,
)
r.raise_for_status()
return r.json()
def build_evidence_pack(query: str):
search_data = agentic_search(query)
hits = search_data.get("hits") or search_data.get("results") or []
pack = []
for hit in hits:
doc_id = hit.get("doc_id")
if not doc_id:
continue
content = read_content(doc_id)
pack.append({
"title": hit.get("title"),
"doc_id": doc_id,
"chunk": hit.get("chunk"),
"page_no": hit.get("page_no") or hit.get("page"),
"offset": hit.get("offset"),
"source_text": content.get("text", "")[:1000],
})
return {
"query": query,
"evidence": pack,
}
if __name__ == "__main__":
result = build_evidence_pack(
"perovskite solar cell stability interface engineering"
)
for i, item in enumerate(result["evidence"], 1):
print(f"\n## Evidence {i}")
print("Title:", item["title"])
print("Doc ID:", item["doc_id"])
print("Page:", item["page_no"])
print("Chunk:", item["chunk"])
print("Source:", item["source_text"][:500])
这个脚本能干什么?
它不是让模型“凭感觉写综述”,而是先生成一个 evidence pack。
Agent 拿到 evidence pack 后,才开始回答。
这一步很重要。因为科研场景里,答案不是第一生产物,证据才是。
五、结构化筛选不要让模型猜字段
如果用户问:
“帮我找 2023 年以后 Nature 上关于 LLM hallucination detection 的论文。”
这时候不应该直接让模型拼字段。
正确做法是先查 meta-catalog:
curl -X GET "https://api.sciverse.space/meta-catalog" \
-H "Authorization: Bearer $SCIVERSE_API_TOKEN"
然后再用 meta-search:
curl -X POST "https://api.sciverse.space/meta-search" \
-H "Authorization: Bearer $SCIVERSE_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"query": "LLM hallucination detection",
"filters": [
{
"field": "publication_published_year",
"operator": "FILTER_OP_GTE",
"value": 2023
}
],
"sort": [
{
"field": "publication_published_year",
"order": "SORT_ORDER_DESC"
}
],
"page": 1,
"page_size": 10
}'
这里的关键不是代码有多复杂,而是产品逻辑:
agentic-search 负责自然语言 evidence;
meta-search 负责结构化论文列表;
content 负责原文核验;
resource 负责图表资源;
meta-catalog 负责告诉 Agent 不要乱猜字段。
六、哪类用户最适合用 Sciverse
我会把用户分成四类。
第一类是科研 Agent 开发者。
他们需要让 Agent 自动找论文、读原文、输出引用。Sciverse 对他们的价值最大,因为它直接解决 evidence chunk 和 doc_id 问题。
第二类是科学 RAG 团队。
如果你的 RAG 数据源不能回到原文,那它只能算“相关文本生成”。Sciverse 的 content/resource 能让 RAG 从检索走向核验。
第三类是做技术情报和专利分析的人。
Sciverse 的知识底座覆盖文献、图书、专利等类型,更适合做跨来源探索。这里要注意,具体字段和权限要以当前账号开放能力为准,不要把所有产品能力混成一句“大而全”。
第四类是 MinerU 用户。
MinerU 把用户手里的 PDF、网页、截图解析成可读内容;Sciverse 则可以在解析后继续查外部科学证据。
这条链路非常自然:
MinerU 解析文档
↓
提取标题 / 摘要 / 表格 / 图注 / 关键词
↓
Sciverse 检索相关科学资料
↓
读取原文 / 获取图表 / 生成 evidence pack
↓
交给 Agent 做总结或比对
注意,这里不建议默认替用户调用 API。更合理的是:引导用户登录 Sciverse、获取自己的 Token,或者跳转官网和 Docs。
七、如果要做评测,别只测“有没有结果”
很多学术搜索评测只看 top 10 有没有相关论文。这个指标太粗了。
面向 Agent,我建议测 7 个指标:
| 维度 | 为什么重要 |
|---|---|
| 覆盖率 | 查询是否能返回结果 |
| 相关性 | 结果是否真的回答问题 |
| 返回颗粒度 | 是论文级、摘要级,还是正文 chunk 级 |
| 可追溯性 | 是否有 doc_id、DOI、页码、offset |
| 可继续读取 | 是否能从结果继续读全文 |
| 多模态资源 | 是否能拿图表、附件、实验图 |
| Agent 接入成本 | 是否有 API、MCP、Skills、SDK、CLI |
按这个标准看,结论会很清楚:
OpenAlex 是很强的开放学术图谱。
Crossref 是 DOI 元数据基础设施。
Semantic Scholar 是优秀的论文发现和引用图谱。
Europe PMC 是生命科学方向的强全文库。
arXiv 是追踪预印本的入口。
Sciverse 更像是给 Agent 用的科学数据调用层。
它不一定要替代所有工具,但它可以成为科研 Agent 工作流里的证据底座。
八、Sciverse 最应该被记住的一句话
如果只用一句话讲 Sciverse,我不会说“科学数据基座”这么抽象。
我会说:
Sciverse 让 Agent 不只是搜索论文,而是拿到可追溯的科学证据。
这句话比“AI-Ready 数据基座”更容易被开发者理解。
因为现在所有做科研 Agent 的人,最终都会遇到同一个问题:
模型能写,但证据在哪?
如果回答里没有 doc_id、没有原文、没有页码、没有图表路径、没有可复查链路,那它再流畅也只是一次漂亮的猜测。
科研 AI 的下一步,不是让模型更会说,而是让模型更会查。
Sciverse 的机会,就在这里。
参考资料:
Sciverse 官网
Sciverse Docs
OpenAlex 2026 Roadmap
OpenAlex Semantic Search Docs
Semantic Scholar Open Data Platform
Crossref Metadata Retrieval
Europe PMC RESTful API
Nature: Hallucinated citations are polluting the scientific literature
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)