PaddleOCR Agent Skills 安装指南:在 AI 应用中一句话触发文字识别与文档解析

发布时间:2026/9/17 2:20:48
PaddleOCR Agent Skills 安装指南:在 AI 应用中一句话触发文字识别与文档解析 PaddleOCR Agent Skills 安装指南在 AI 应用中一句话触发文字识别与文档解析【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR这是面向支持 Skills 的 AI 应用如 Claude Code、OpenClaw的实操教程把 PaddleOCR 官方提供的paddleocr-text-recognition与paddleocr-doc-parsing两个 Agent Skills 装进应用并配好 token之后你用一句自然语言就能拿到文件识别文本或解析后的结构化结果。前提环境设备装有 Python 3.9用 CLI 方式安装时需要 Node.js并已准备好百度 AI Studio 的 access token。环境自检三个前置条件Skill 只依赖paddleocr命令行不需要本地显卡。paddleocr api是把文件 URL 或本地文件提交到官方托管服务、等待任务完成并输出结果的子命令推理在服务端完成因此安装后无需 GPU 或额外依赖组。逐项检查python --version输出需为 3.9 或更高。然后安装 CLI 本体pip install paddleocr3.7.0执行后系统会多出paddleocr命令含api子命令命令行不再提示找不到命令即算成功。第三步是拿 token登录百度 AI Studio在账户设置的 accessToken 入口复制 access token留到下一步使用。选 Skill按任务形态二选一两条 Skill 的分界规则很简单只要纯文本就选识别要保留版面结构就选解析。paddleocr-text-recognition输出行级文本及对应边界框、置信度分数适合截图、照片、扫描件这类只要字的输入。paddleocr-doc-parsing输出 Markdown / 结构化结果保留标题、段落、表格、公式。文档一旦含表格、公式、图表或复杂版面就只能用它——文字识别 Skill 的 SKILL.md 明确把这类输入排除在外。两个 Skill 的完整触发规则分别见 skills/paddleocr-text-recognition/SKILL.md 和 skills/paddleocr-doc-parsing/SKILL.md安装与用法总览见 docs/version3.x/integrations/skills.md。安装到 AI 应用的三种方式三种任选其一效果相同只装其中一个 Skill 时保留对应的那条命令即可。方式一skills CLI前提已装 Node.js。该命令把 Skill 全局安装到设备装完各 AI 应用均可加载npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y执行成功后Skill 被写入设备的公共 Skill 位置在 AI 应用的 Skill 列表里能看到新条目即算装好。PaddleOCR 仓库较大网络慢时此命令可能超时失败改为先克隆仓库再从本地路径安装git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing克隆完成后当前目录会多出PaddleOCR文件夹随后两条 add 命令即从本地路径完成安装无需再走网络拉取大仓库。方式二clawhubOpenClaw 用户clawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing执行后 Skill 由 OpenClaw 接管注册安装位置与加载规则以 OpenClaw 官方 Skills 文档为准。方式三手动拷贝克隆仓库后把PaddleOCR/skills下对应的 Skill 目录拷贝到 AI 应用指定的 Skill 位置即可。拷到哪里参考所用应用的安装文档——Claude Code、claude.ai、OpenClaw 各自有 Skills 安装说明。配置 token怎么配、配错会怎样token 是唯一必选项两个 SKILL.md 的 frontmatter 都把PADDLEOCR_ACCESS_TOKEN声明为必需环境变量primaryEnv缺失时 Skill 不会正确工作PADDLEOCR_BASE_URL可选缺省时使用官方服务地址。两种常见应用的配法如下。Claude Code在项目根目录的.claude/settings.local.json里加env字段把ACCESS_TOKEN换成 AI Studio 拿到的值{ env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }OpenClaw在~/.openclaw/openclaw.json里为每个 Skill 建条目enabled置为truetoken 填在各自动的env中{ skills: { entries: { paddleocr-text-recognition: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }, paddleocr-doc-parsing: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } } } } }CLI 默认读取该环境变量配好后每次调用自动鉴权不必再手动带 token。AI 应用不在上述名单内时直接把 token 以PADDLEOCR_ACCESS_TOKEN环境变量提供给该应用即可单次调用也可以用--token参数显式传入。配错的后果很直观所有调用都会返回认证错误排查见下文表格。首次调用触发方式与成功判据配置完成后不用记命令用自然语言描述任务并附上文件 URL 或本地路径这张发票图片 https://example.com/invoice.jpg把里面的文字全部取出来对本机 C:\docs\invoice.pdf 里的 PDF 做一次 OCR逐行输出全文把 https://example.com/report.pdf 这份报告转成 Markdown正文和所有表格都要本地 C:\docs\report.pdf 跑一下文档解析给我完整结构化结果前两条对应文字识别后两条对应文档解析URL 与路径替换成你自己的文件。Skill 内部实际执行的是paddleocr api命令两种常用形态如下可用来理解其行为或手动验证paddleocr api \ --model_type ocr \ --file_url https://example.com/image.pngpaddleocr api \ --model_type doc_parsing \ --file_path ./document.pdf--model_type必填取ocr或doc_parsing二选一--file_url与--file_path二选一。完整参数以paddleocr api --help的输出为准。成功后 CLI 打印格式化 JSON。文字识别的结果含jobId和每页的prunedResult内有rec_texts行级文本与rec_scores置信度及ocrImageUrl{ jobId: job-xxx, pages: [ { prunedResult: { rec_texts: [Line 1, Line 2], rec_scores: [0.98, 0.95] }, ocrImageUrl: https://... } ] }文档解析的结果则是每页的markdownText、markdownImages、outputImages。判据两条pages覆盖目标页码rec_texts或markdownText与文档实际内容一致。用--output指定文件时CLI 写入该文件并打印保存位置不指定则直接打到标准输出。结果异常时按表排查命令失败时信息输出到标准错误流并返回非零退出码凭这两点即可确认调用未成功。常见情形与处理现象原因与处理提示 token 缺失或无效检查PADDLEOCR_ACCESS_TOKEN是否已配置、值是否来自 AI Studio 且未过期配额或限流报错API 限流或配额超出稍后重试或检查账户配额提示未检测到内容输入可能是空白页或不含文字换一张文件再试另有一条硬性要求CLI 返回错误时把具体问题如实告知用户不要静默失败更不要回退到应用自身的视觉能力去凑结果。进阶开关、使用边界与验收清单API 默认开启两个预处理开关扭曲矫正use_doc_unwarping与方向分类use_doc_orientation_classify。输入平整、方向正确截图、扫描规范的文档时可关闭以加快返回paddleocr api --model_type ocr --file_path ./document.pdf \ --use_doc_unwarping False --use_doc_orientation_classify False但若输入是弯曲或折叠文档的照片、有明显透视变形、或方向不确定旋转 90/180/270 度这两个开关必须保留。两条使用边界也一并记住paddleocr-text-recognition不处理含表格、公式、图表或复杂版面的文档这类任务换paddleocr-doc-parsing向用户展示结果时给出完整提取内容超过 10,000 字符才允许省略。全部做完后对照清单验收用一篇手头的真实 PDF 或图片跑完一次完整流程输出 JSON 无报错pages覆盖目标页码rec_texts或markdownText与文档实际内容一致——两条同时满足即算链路打通分别以--output写文件和默认 stdout 各跑一次确认两种出口都有结果。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询