面向 AI 可读的论文 Markdown 格式

问题:将论文转换为“完美”的 AI 可读 Markdown 时,总会丢失一些内容——结果表格为空、参考文献丢失、图片链接失效(或指向外部),以及残留杂乱的 LaTeXML 标记。

最终方案:获胜的流水线是 arXiv HTML(LaTeXML)→ pandoc(带属性剥离)→ 正则删除内部锚点标签。这样就能免费得到 pandoc 处理源码和 Nougat 都会丢失的两样东西:填充好的表格 + 内联参考文献,再加上干净的 $…$ 数学公式和内嵌图表标题 —— 既紧凑又自包含。

可借鉴的经验:对于任何 arXiv 论文,优先走 HTML 路径 —— 这是现成的答案。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐