如何把扫描件变成结构化文本:PaddleOCR 文档识别从安装到出结果的完整教程

发布时间:2026/8/29 15:20:24
如何把扫描件变成结构化文本:PaddleOCR 文档识别从安装到出结果的完整教程 如何把扫描件变成结构化文本PaddleOCR 文档识别从安装到出结果的完整教程【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCRPaddleOCR 是一款开源 OCR 工具包负责把 PDF、扫描件或照片里的文字识别出来转成 JSON、Markdown 等结构化数据支持 100 多种语言适合想把纸质文档变成可检索、可问答文本的开发者。一、安装 PaddleOCR 前需要准备什么环境PaddleOCR 3.x 依赖飞桨PaddlePaddle框架作为底层推理引擎需要 3.0 及以上版本。如果你的机器没有独立显卡装 CPU 版即可满足日常识别python -m pip install paddlepaddle3.2.0 -i https://www.paddlepaddle.org.cn/packages/stable/cpu/有 NVIDIA 显卡的服务器可以改装 GPU 版以 CUDA 11.8 为例python -m pip install paddlepaddle-gpu3.2.0 -i https://www.paddlepaddle.org.cn/packages/stable/cu118/接着安装 PaddleOCR 本体。[all]表示带齐全部可选能力新手建议直接用它python -m pip install paddleocr[all] 可选能力按依赖组划分doc-parser对应文档解析表格、公式、版面ie对应关键信息抽取trans对应文档翻译doc2md对应 Word/Excel 转 Markdown。只需要通用文字识别时装不带依赖组的paddleocr即可体积更小。各组说明见官方安装文档。二、如何完成首次文字识别一条最小命令 命令行方式安装完成后终端里执行下面这条命令就能对图片做完整识别检测 方向校正 识别paddleocr ocr -i ./general_ocr_002.png \ --use_doc_orientation_classify False \ --use_doc_unwarping False \ --use_textline_orientation False后三个参数分别控制整页方向分类、页面扭曲矫正和文字行方向判断正对拍摄的图片关掉它们可以省时间。命令运行后终端会打印每段文字、置信度和所在位置同时把标注图输出到output目录。上图中一张登机牌被完整拆成航班号、座位号、姓名等独立文本块这正是 OCR 结果的基本形态每段文字都带位置信息方便后续定位和校对。Python 脚本方式如果要集成到自己的程序里核心代码只有几行from paddleocr import PaddleOCR ocr PaddleOCR() result ocr.predict(sample.png) for res in result: res.print() # 终端打印结果 res.save_to_json(output) # 保存为 JSON便于程序处理JSON 里包含识别文本、置信度、文本框坐标可直接作为下游流程的输入。完整可运行的命令与脚本对照见快速上手文档。三、一张图片还是整份文档四条识别入口怎么选PaddleOCR 把能力拆成了独立的模块和串联好的产线命令行子命令一一对应paddleocr text_detection -i xxx.png只做文本检测输出文字在图中的位置不读内容paddleocr text_recognition -i xxx.png只做文本识别输入是一行文字的小图paddleocr ocr -i xxx.png上面两步的组合输入整图输出文字加位置最常用的入口paddleocr pp_structurev3 -i xxx.png整页文档解析除文字外还处理表格、公式和版面结构。架构图展示了 PaddleOCR 的组成PP-OCR 负责文字检测与识别PP-Structure 负责版面分析、表格识别与文档复原PP-ChatOCR 基于大模型做信息抽取。前两者是本地跑通的主力PP-ChatOCR 属于进阶能力。当你的输入是一份含表格和标题层级的完整文档时改用 PP-StructureV3paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png \ --use_doc_orientation_classify False \ --use_doc_unwarping False与ocr子命令不同它能还原表格结构并输出 Markdown/JSON且保留单元格、段落等坐标信息是文档转数据场景的主力产线。四、场景实践把旧扫描件变成大模型可读的文本 扫描件归档给大模型当知识库不少团队的痛点是合同、报告、票据都躺在扫描系统里大模型根本看不见它们。做法是把扫描件批量送入pp_structurev3转成带结构的 Markdown 文本再按段落切分、送入检索库就能基于原始档案做问答。这一路径正是 Dify、RAGFlow 等 RAG 项目集成 PaddleOCR 的原因。图中左侧是一份英文政策文档右侧每段文字都被独立框出并转为纯文本原始版式与内容对应关系一目了然——这就是喂给大模型之前的中间态。工业现场的数字读数识别巡检人员拍一张电表、仪表的照片值班系统需要自动读出时间和读数。PaddleOCR 对数字显示屏、点阵字这类场景做了专门优化paddleocr ocr命令即可直接处理无需额外配置五、结果去哪里看之后往哪深入跑通之后有三个产出物值得检查终端打印的文本与置信度res.print()、output目录里的标注图可视化核对位置框、JSON 文件程序化消费。发现某段识别偏差时先看它的置信度再对照标注图确认是检测漏检还是识别错字。想继续深入时仓库内有几个明确入口模型与产线的完整清单见 docs/version3.x/model_list.md训练、ONNX 导出、多卡并行推理等主题都放在 docs/version3.x/ 目录社区基于 PaddleOCR 做过的应用汇总在 awesome_projects.md。从一条命令出发按自己的场景挑产线、调参数这套工具链足够覆盖从单张票据到整库文档的识别需求。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考