而是证据拿不稳

过去一年,科研圈最刺眼的问题之一不是“AI 不会写”,而是“AI 写得太像真的”。

Nature 近期连续讨论了一个现象:AI 生成的幻觉引用正在进入科学文献。一些论文里的参考文献看起来格式完整、作者可信、标题合理,但 DOI 对不上,甚至文献根本不存在。

这件事把科研 Agent 的核心问题暴露得很清楚:

真正危险的不是模型不会总结,而是模型在没有可靠证据链的情况下总结得很流畅。

所以今天再讨论科研 AI,不能只问“哪个模型更聪明”,而要问另一个更底层的问题:

当一个 Agent 要回答科研问题时,它到底从哪里拿证据?能不能回到原文?能不能拿到页码、doc_id、图表和元数据?能不能被复查?

我把 Sciverse、OpenAlex、Semantic Scholar、Crossref、Europe PMC、arXiv 放到同一个框架里看了一遍。结论是:这些工具都能“找论文”,但它们适合的工作流完全不同。

一、先看数据量和定位

产品 公开数据规模 / 范围 更适合做什么 对 Agent 的关键限制
Sciverse 5.16 亿知识记录,814 种语言,1.3M+ 期刊与会议 科研 Agent、科学 RAG、全文证据读取、图表资源获取 需要 Token 和账号权限,生态还在扩展
OpenAlex 2026 roadmap 提到 4.77 亿 works 开放学术知识图谱、机构/作者/引用/主题分析 语义搜索主要基于标题和摘要,不天然返回正文 evidence chunk
Semantic Scholar S2AG 论文描述为 200M+ papers、2.4B+ citation edges 论文发现、引用关系、作者/论文图谱 API 更偏 paper metadata / graph,不是全文证据工作流
Crossref 2026 public data file 约 1.8 亿记录 DOI 元数据、出版物注册信息、引用关系 不抓全文,不适合做语义证据检索
Europe PMC 3300 万+ publications,生命科学方向强 生物医学文献、OA 全文、图表、补充材料 学科范围相对集中
arXiv 2.3M+ 预印本,AI/物理/数学等更新快 追踪最新预印本 覆盖面窄,主要是预印本,不是全学科知识底座
Google Scholar 覆盖广,用户认知强 人工检索 没有稳定官方 API,不适合 Agent 自动化接入

如果只是“人搜论文”,Google Scholar 仍然很好用。

但如果目标是让 Claude、Cursor、Codex 或自研 Agent 自动检索、核对、读取、生成 evidence pack,问题就变了。

Agent 不只需要一个论文列表。它需要结构化、可调用、可追溯的科学证据。

二、真正的差异不在“能不能搜”,而在返回颗粒度

普通学术 API 常见返回是:

{
  "title": "...",
  "authors": [],
  "year": 2025,
  "doi": "...",
  "abstract": "..."
}

这对人有用,但对 Agent 还不够。

Agent 真正需要的是:

{
  "title": "...",
  "doc_id": "...",
  "chunk": "可引用的正文片段",
  "page_no": 7,
  "offset": 18234,
  "score": 0.82
}

因为只有这样,它才能继续做三件事:

doc_id 读原文;

page_no / offset 定位证据;

把 evidence chunk 写进答案,而不是凭空生成引用。

这也是 Sciverse 和 OpenAlex、Crossref、Semantic Scholar 的主要差异点。

OpenAlex 很强,尤其是开放知识图谱和 metadata。它现在也提供 semantic search,但官方文档说明语义搜索主要基于 title + abstract embedding。它非常适合找“相关论文”,但如果你要让 Agent 直接拿“正文证据片段”,还需要额外链路。

Crossref 是 DOI 元数据基础设施,不是全文检索系统。

Semantic Scholar 强在 paper graph、citation graph、作者和论文关系。

Sciverse 的优势在于它把 Agent 常用动作拆成了 5 个接口:

agentic-search:自然语言问题 → 文献 evidence chunks

meta-search:结构化条件 → 论文元数据列表

content:doc_id → 分段读取全文

resource:file_name → 下载图表 / 附件资源

meta-catalog:查看 meta-search 可筛选、可排序字段

这套接口不是为“搜索页面”设计的,更像是为 Agent 工作流设计的。

三、快速对比:同一个问题,各家怎么调

假设问题是:

“perovskite solar cell stability interface engineering”

1. Sciverse:拿 evidence chunk

curl -X POST "https://api.sciverse.space/agentic-search" \
  -H "Authorization: Bearer $SCIVERSE_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "query": "perovskite solar cell stability interface engineering",
    "top_k": 5
  }'

适合:科研问答、RAG evidence、综述 Agent。

预期返回:相关文献片段、标题、doc_id、页码或位置、score。

2. OpenAlex:找相关 works

curl "https://api.openalex.org/works?api_key=$OPENALEX_API_KEY&search.semantic=perovskite%20solar%20cell%20stability%20interface%20engineering&per-page=5&select=id,title,publication_year,doi,relevance_score"

适合:开放学术图谱、论文发现、作者/机构/主题分析。

注意:更偏 work-level 检索,不是直接返回正文证据片段。

3. Semantic Scholar:查论文和引用图谱

curl "https://api.semanticscholar.org/graph/v1/paper/search?query=perovskite%20solar%20cell%20stability%20interface%20engineering&limit=5&fields=title,year,abstract,authors,citationCount,openAccessPdf"

适合:论文检索、引用量、作者、开放 PDF 线索。

注意:很好用,但不是“chunk → content → resource”的证据链结构。

4. Crossref:查 DOI 元数据

curl "https://api.crossref.org/works?query.title=perovskite%20solar%20cell%20stability&rows=5"

适合:查 DOI、出版信息、期刊信息。

注意:不要把 Crossref 当全文搜索。它的价值是元数据可信和 DOI 体系。

5. Europe PMC:生命科学全文与图表

curl "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=CRISPR%20off-target%20detection&format=json&pageSize=5"

适合:生命科学、医学、OA 全文、图表、补充材料。

注意:如果你的场景是生物医学,Europe PMC 很强;如果是跨学科科学 Agent,范围就不够宽。

6. arXiv:追最新预印本

curl "https://export.arxiv.org/api/query?search_query=all:AI%20agent%20scientific%20discovery&start=0&max_results=5&sortBy=submittedDate&sortOrder=descending"

适合:AI、CS、物理、数学等方向追新。

注意:arXiv 不是全学科检索,也不是正式出版物知识库。

四、Sciverse 的实际使用链路

如果你要做一个科研 Agent,不建议一上来就“让模型搜索并回答”。

更稳的链路是:

用户问题
  ↓
agentic-search 找 evidence chunks
  ↓
根据 doc_id 去重
  ↓
content 读取原文上下文
  ↓
必要时 resource 拉取图表
  ↓
LLM 只基于 evidence 生成答案
  ↓
输出 doc_id / 页码 / DOI / 引用线索

下面是一个最小 Python 示例。

import os
import requests

BASE_URL = "https://api.sciverse.space"
TOKEN = os.getenv("SCIVERSE_API_TOKEN")

HEADERS = {
    "Authorization": f"Bearer {TOKEN}",
    "Content-Type": "application/json",
}

def agentic_search(query: str, top_k: int = 5):
    r = requests.post(
        f"{BASE_URL}/agentic-search",
        headers=HEADERS,
        json={"query": query, "top_k": top_k},
        timeout=30,
    )
    r.raise_for_status()
    return r.json()

def read_content(doc_id: str, offset: int = 0, limit: int = 1200):
    r = requests.get(
        f"{BASE_URL}/content",
        headers={"Authorization": f"Bearer {TOKEN}"},
        params={"doc_id": doc_id, "offset": offset, "limit": limit},
        timeout=30,
    )
    r.raise_for_status()
    return r.json()

def build_evidence_pack(query: str):
    search_data = agentic_search(query)
    hits = search_data.get("hits") or search_data.get("results") or []

    pack = []

    for hit in hits:
        doc_id = hit.get("doc_id")
        if not doc_id:
            continue

        content = read_content(doc_id)

        pack.append({
            "title": hit.get("title"),
            "doc_id": doc_id,
            "chunk": hit.get("chunk"),
            "page_no": hit.get("page_no") or hit.get("page"),
            "offset": hit.get("offset"),
            "source_text": content.get("text", "")[:1000],
        })

    return {
        "query": query,
        "evidence": pack,
    }

if __name__ == "__main__":
    result = build_evidence_pack(
        "perovskite solar cell stability interface engineering"
    )

    for i, item in enumerate(result["evidence"], 1):
        print(f"\n## Evidence {i}")
        print("Title:", item["title"])
        print("Doc ID:", item["doc_id"])
        print("Page:", item["page_no"])
        print("Chunk:", item["chunk"])
        print("Source:", item["source_text"][:500])

这个脚本能干什么?

它不是让模型“凭感觉写综述”,而是先生成一个 evidence pack。

Agent 拿到 evidence pack 后,才开始回答。

这一步很重要。因为科研场景里,答案不是第一生产物,证据才是。

五、结构化筛选不要让模型猜字段

如果用户问:

“帮我找 2023 年以后 Nature 上关于 LLM hallucination detection 的论文。”

这时候不应该直接让模型拼字段。

正确做法是先查 meta-catalog

curl -X GET "https://api.sciverse.space/meta-catalog" \
  -H "Authorization: Bearer $SCIVERSE_API_TOKEN"

然后再用 meta-search

curl -X POST "https://api.sciverse.space/meta-search" \
  -H "Authorization: Bearer $SCIVERSE_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "query": "LLM hallucination detection",
    "filters": [
      {
        "field": "publication_published_year",
        "operator": "FILTER_OP_GTE",
        "value": 2023
      }
    ],
    "sort": [
      {
        "field": "publication_published_year",
        "order": "SORT_ORDER_DESC"
      }
    ],
    "page": 1,
    "page_size": 10
  }'

这里的关键不是代码有多复杂,而是产品逻辑:

agentic-search 负责自然语言 evidence;

meta-search 负责结构化论文列表;

content 负责原文核验;

resource 负责图表资源;

meta-catalog 负责告诉 Agent 不要乱猜字段。

六、哪类用户最适合用 Sciverse

我会把用户分成四类。

第一类是科研 Agent 开发者。

他们需要让 Agent 自动找论文、读原文、输出引用。Sciverse 对他们的价值最大,因为它直接解决 evidence chunk 和 doc_id 问题。

第二类是科学 RAG 团队。

如果你的 RAG 数据源不能回到原文,那它只能算“相关文本生成”。Sciverse 的 content/resource 能让 RAG 从检索走向核验。

第三类是做技术情报和专利分析的人。

Sciverse 的知识底座覆盖文献、图书、专利等类型,更适合做跨来源探索。这里要注意,具体字段和权限要以当前账号开放能力为准,不要把所有产品能力混成一句“大而全”。

第四类是 MinerU 用户。

MinerU 把用户手里的 PDF、网页、截图解析成可读内容;Sciverse 则可以在解析后继续查外部科学证据。

这条链路非常自然:

MinerU 解析文档
  ↓
提取标题 / 摘要 / 表格 / 图注 / 关键词
  ↓
Sciverse 检索相关科学资料
  ↓
读取原文 / 获取图表 / 生成 evidence pack
  ↓
交给 Agent 做总结或比对

注意,这里不建议默认替用户调用 API。更合理的是:引导用户登录 Sciverse、获取自己的 Token,或者跳转官网和 Docs。

七、如果要做评测,别只测“有没有结果”

很多学术搜索评测只看 top 10 有没有相关论文。这个指标太粗了。

面向 Agent,我建议测 7 个指标:

维度 为什么重要
覆盖率 查询是否能返回结果
相关性 结果是否真的回答问题
返回颗粒度 是论文级、摘要级,还是正文 chunk 级
可追溯性 是否有 doc_id、DOI、页码、offset
可继续读取 是否能从结果继续读全文
多模态资源 是否能拿图表、附件、实验图
Agent 接入成本 是否有 API、MCP、Skills、SDK、CLI

按这个标准看,结论会很清楚:

OpenAlex 是很强的开放学术图谱。

Crossref 是 DOI 元数据基础设施。

Semantic Scholar 是优秀的论文发现和引用图谱。

Europe PMC 是生命科学方向的强全文库。

arXiv 是追踪预印本的入口。

Sciverse 更像是给 Agent 用的科学数据调用层。

它不一定要替代所有工具,但它可以成为科研 Agent 工作流里的证据底座。

八、Sciverse 最应该被记住的一句话

如果只用一句话讲 Sciverse,我不会说“科学数据基座”这么抽象。

我会说:

Sciverse 让 Agent 不只是搜索论文,而是拿到可追溯的科学证据。

这句话比“AI-Ready 数据基座”更容易被开发者理解。

因为现在所有做科研 Agent 的人,最终都会遇到同一个问题:

模型能写,但证据在哪?

如果回答里没有 doc_id、没有原文、没有页码、没有图表路径、没有可复查链路,那它再流畅也只是一次漂亮的猜测。

科研 AI 的下一步,不是让模型更会说,而是让模型更会查。

Sciverse 的机会,就在这里。


参考资料:
Sciverse 官网
Sciverse Docs
OpenAlex 2026 Roadmap
OpenAlex Semantic Search Docs
Semantic Scholar Open Data Platform
Crossref Metadata Retrieval
Europe PMC RESTful API
Nature: Hallucinated citations are polluting the scientific literature

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐