登录社区云,与社区用户共同成长
邀请您加入社区
PaddleOCR-VL多模态文档解析模型的本地部署与使用。相比传统OCR工具,PaddleOCR-VL不仅能识别文字,还具备理解表格、公式、图表等复杂文档结构的能力。文章提供了整合包下载方式,详细演示了从安装配置到识别印刷体、手写体和数学公式的全过程。该模型支持100+语言识别,参数规模适中(0.9亿),既适合本地部署又可结合cpolar实现远程访问,解决了传统OCR在隐私保护、批量处理和复杂文
本文介绍了将PaddlePaddle模型转换为ONNX格式的方法。指出新版本Paddle2ONNX(2.1.0)使用inference.json文件而非旧版的model.pdmodel文件。文章详细说明了转换命令格式,并提供了三个具体转换示例(文本检测、识别和方向分类模型)。同时给出了官方模型下载链接和转换后的效果展示。注意事项部分强调版本兼容性:PaddlePaddle需≥3.0.0且≤3.1.
本项目基于PaddlePaddle框架开发了一个中文新闻标题分类系统,采用BiLSTM模型实现端到端文本分类。系统亮点包括:字粒度编码降低未登录词影响,引入Dropout等正则化技术防止过拟合,支持财经、房产等10类新闻分类,测试准确率达90.59%。项目提供完整的训练评估流程、混淆矩阵可视化以及Tkinter图形化预测界面,模块化设计便于扩展。实验表明,针对短文本特性,BiLSTM能有效捕捉标题
如果你在做任何涉及文档的 AI 工作流,MinerU 值得试一下。它解决的不是"能不能提取文字"的问题,而是"能不能让 AI 真正读懂文档"的问题。这个区别,在实际项目里会差一个量级的效果。MinerURAGPDF解析AI工作流LangChainOpenClawAgentCSDN。
本项目借助 PaddleOCR 开源引擎,并利用其内置工具 PP-StructureV3 实现了大量PDF的自动化OCR处理和结构化输出,并配合 Python 脚本实现了处理结果的自动化整理。
大模型半监督学习-目标检测产线是飞桨特色的目标检测训练产线,通过大小模型联合训练的方式,使用少量有标签数据和大量无标注数据提升模型的精度,大幅度减少人工迭代模型的成本、标注数据的成本。文档场景信息抽取v4(PP-ChatOCRv4)是飞桨特色的文档和图像智能分析解决方案,结合了 LLM、MLLM 和 OCR 技术,在文档场景信息抽取v3的基础上,优化了版面分析、生僻字、多页 pdf、表格、印章识别
本文记录了使用PaddleX工具进行OCR模型测试时遇到的问题。在星河社区安装PaddleX后,执行命令出现"command not found"错误,后发现需进入特定目录执行。运行OCR管道时出现框架不兼容错误,尝试设置FLAGS_use_onednn=0仍无法解决。在Windows环境下测试时,Python 3.14无法安装飞桨框架。最终问题暂未解决,需进一步排查版本兼容性
Paddle2ONNX 支持将模型格式转化到ONNX模型格式。通过 ONNX 可以完成将 Paddle 模型到多种推理引擎的部署,包括 TensorRT/OpenVINO/MNN/TNN/NCNN,以及其它对 ONNX 开源格式进行支持的推理引擎或硬件。
阶段输入处理输出模型推理图像[3, H, W]Logits[80, 6625]ArgMaxLogits找每列最大值索引序列[80](0~6624)CTC 解码索引序列去 blank + 去重字符串(如"粤B88888"这套流程高效、鲁棒,是工业 OCR 系统的标准实践。
Paddle Inference 是飞桨的原生推理库, 作用于服务器端和云端,提供高性能的推理能力。由于能力直接基于飞桨的训练算子,因此 Paddle Inference 可以通用支持飞桨训练出的所有模型。Paddle Inference 功能特性丰富,性能优异,针对不同平台不同的应用场景进行了深度的适配优化,做到高吞吐、低时延,保证了飞桨模型在服务器端即训即用,快速部署。一些常见的文档链接如下: