【保姆级教程】DeepSeek OCR模型本地部署详解,附真实场景测试结果!
近日,deepseek 首次发布了 OCR 模型,本文记录了在本地环境中部署的完整过程,并简单地进行了 OCR 识别的效果测试。
一、环境准备
(1)基础配置信息
如下:
- 操作系统:Windows 11专业版(WSL2)
- Python 版本:3.12.9
- GPU:RTX 4090
(2)构建项目环境
依托 python3.12.9 构建了虚拟环境, 如图 1 所示:

图 1:虚拟环境
安装 torch 库:首先安装 gpu 版本的 torch 库,在安装之前,请先通过 nvidia-smi 命令查看当前 NVIDIA 驱动所支持的最高 CUDA 版本。
如图 2 所示,输出显示 CUDA Version: 12.9,则表示我的驱动最多支持 CUDA 12.9。

图 2:cuda 版本查询
安装 torch 时,应选择 CUDA 版本 ≤ 12.9 的 GPU 构建版本(如 cu121、cu118 等),不可选择高于 12.9 的 CUDA 版本,否则可能导致兼容性问题或无法使用 GPU 加速。
安装模型推荐的torch2.6.0的命令:
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu126
安装相关库:在 torch 库安装成功后,依次安装下述版本的库,往往会比较顺利。
transformers==4.46.3
tokenizers==0.20.3
einops
addict
easydict
安装 flash-attn 库:flash-attn 库也可以不用安装,不影响正常推理,该库主要用于推理的加速。如果直接安装 flash-attn 库往往会报错,我的报错内容如图 3 所示。

图 3:直接安装 flash-attn 报错
为了解决上述问题,应首先安装依赖:
pip install wheel setuptools packaging
然后,重新安装 flash-attn,该库的安装过程非常非常慢,耗时约 3 小时。
pip install flash-attn==2.7.3 --no-build-isolation
二、模型推理
从 hugging face 上下载 deepseek-ocr 相关的模型和代码,具体文件如图 4 所示,我把这些文件放在了本地的 model 目录中。

图 4:下载的模型相关文件
在项目目录中创建了 infer 模块,该模块的推理代码为:
from transformers import AutoModel, AutoTokenizer
import torch
import os
os.environ["CUDA_VISIBLE_DEVICES"] = '0'
model_name = 'model'
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
# 如果安装了flash-attn,通过设置进行加速推理
# model = AutoModel.from_pretrained(model_name, _attn_implementation='flash_attention_2', trust_remote_code=True, use_safetensors=True)
# 如果没有安装flash-attn,无需设置
model = AutoModel.from_pretrained(model_name, trust_remote_code=True, use_safetensors=True)
model = model.eval().cuda().to(torch.bfloat16)
prompt = "<image>\n<|grounding|>Convert the document to markdown. "
image_file = 'test_data/p1.jpg'
output_path = 'output'
res = model.infer(tokenizer, prompt=prompt, image_file=image_file, output_path = output_path, base_size = 1024, image_size = 640, crop_mode=True, save_results = True, test_compress = True)
三、简单测试
(1)论文数据测试
从中国知网上随机下载了一篇论文,并截图作为输入图像对模型进行了测试,结果如图 5-7。

图 5

图 6

图 7
可以看到准确地识别了文本信息、表格、图、公式,甚至文章标题、子标题、图标题、表标题也准确地识别了出来。唯一的缺陷是,页眉和页脚区域没有识别出来。
(2)真实街景数据
对真实的街景数据进行了测试,如图 8-12 所示:

图 8:街景图 1

图 9:街景图 1 识别结果

图 10:街景图 2

图 11:街景图 2 识别结果

图 12:街景图 3
图 8 中小的电话号码也准确地识别出来了,但是文本的位置不对。图 10 出现了漏检。
图 12 运行了多次,模型均无法提取出任何文本信息。相对文档型图片,对真实街景图片的识别精度明显偏低。
最后
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。
我整理出这套 AI 大模型突围资料包:
- ✅AI大模型学习路线图
- ✅Agent行业报告
- ✅100集大模型视频教程
- ✅大模型书籍PDF
- ✅DeepSeek教程
- ✅AI产品经理入门资料
如果你也想通过学大模型技术去帮助自己升职和加薪,可以扫描下方链接👇👇

为什么说现在普通人就业/升职加薪的首选是AI大模型?
人工智能技术的爆发式增长,正以不可逆转之势重塑就业市场版图。从DeepSeek等国产大模型引发的科技圈热议,到全国两会关于AI产业发展的政策聚焦,再到招聘会上排起的长队,AI的热度已从技术领域渗透到就业市场的每一个角落。

智联招聘的最新数据给出了最直观的印证:2025年2月,AI领域求职人数同比增幅突破200% ,远超其他行业平均水平;整个人工智能行业的求职增速达到33.4%,位居各行业榜首,其中人工智能工程师岗位的求职热度更是飙升69.6%。
AI产业的快速扩张,也让人才供需矛盾愈发突出。麦肯锡报告明确预测,到2030年中国AI专业人才需求将达600万人,人才缺口可能高达400万人,这一缺口不仅存在于核心技术领域,更蔓延至产业应用的各个环节。


资料包有什么?
①从入门到精通的全套视频教程
包含提示词工程、RAG、Agent等技术点

② AI大模型学习路线图(还有视频解说)
全过程AI大模型学习路线

③学习电子书籍和技术文档
市面上的大模型书籍确实太多了,这些是我精选出来的

④各大厂大模型面试题目详解

⑤ 这些资料真的有用吗?
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
所有的视频教程由智泊AI老师录制,且资料与智泊AI共享,相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!


如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓**

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)