目录

1. 环境配置

2. 模型下载

3. 简单使用方法

配置这个过程踩雷不少,故简单写一篇博客作为记录,也供大家参考。 mineru一直都在更新迭代,故教程都是针对当前时间节点的,但基本其他版本要做的工作也是环境配置和模型下载这两步,都可以参考。

        大家一定要仔细阅读官方的readme,我就是觉得已经配环境无数,直接半调子开跑,所以踩坑无数,折腾了很久。可以参考Mineru官方仓库帮助文档

1. 环境配置

        建议大家首先还是创建一个新conda环境,不然会遇到numpy、torch、transforms等库版本冲突的问题,还会把自己以前项目的环境弄成一坨;环境名字就叫mineru吧,官方要求python版本3.10-3.13,现在3.10算是比较稳定的版本,避免很多版本冲突的问题。

conda create -n mineru python=3.10 

        第二步,进入到项目文件夹,比如我这里的RAG_code

cd RAG_code

        第三步,拉取Mineru这个项目

git clone https://github.com/opendatalab/MinerU.git
# 如果速度比较慢,可以在url前添加一个镜像,github上的项目都通用
git clone https://ghfast.top/https://github.com/opendatalab/MinerU.git

        第四步,进入这个文件夹

cd MinerU

        第五步,安装相关依赖,如果没有uv包,直接pip install uv, 再安装相关依赖,以上miner的环境就配置好了

uv pip install -e .[core] -i https://mirrors.aliyun.com/pypi/simple

        测试环境是否配置完成,出现对应的版本即说明环境配置已经完成

mineru --vesion

2. 模型下载

        可以用huggface或者modelscope直接下载到默认路径,参考模型下载,但其默认是下载到c盘用户名目录下,需要10G左右的空间,使用这种方式基本就完整的能跑通miner了,我磁盘空间不够,放到其他路径,修改其默认加载路径折腾了很久,以下直接是用git方式放到空间足够文件夹

# 1. lfs 允许git大文件
git lsf install
# 2. 下载, 也可以在huggface上下载,但太慢了,使用国内的modelscope都很慢,大概10G左右
git clone https://www.modelscope.cn/opendatalab/pdf-extract-kit-1.0.git

        关键的一步,miner框架模型模型保存在

 C:/Users/你的用户名/.cache/modelscope/hub/models/OpenDataLab/PDF-Extract-Kit-1___0

        所以要修改他的默认模型路径,复制MinerU文件夹中的mineru.template.json重命名为mineru.json,找到里面的models_dir, 修改pipeline的路径为你刚刚下载模型权重的绝对路径。 将mineru.json 移动到C:/Users/你的用户名目录下就可以正常使用了,如果是autodl服务器, 将mineru.json文件移动到/root 目录下即可。

3. 简单使用方法

        input_path、output_path是需要处理的文件夹路径,建议用绝对路径。

mineru -p <input_path> -o <output_path>
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐