Qwen-Agent 文档解析指南:把 PDF 和 Word 变成可检索的知识块

发布时间:2026/9/10 7:53:07
Qwen-Agent 文档解析指南:把 PDF 和 Word 变成可检索的知识块 Qwen-Agent 文档解析指南把 PDF 和 Word 变成可检索的知识块【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-AgentQwen-Agent 的文档解析能力基于 DocParser 工具实现它能把 PDF、Word 等 9 种格式的文件提取出文本与表格再切分成带元数据的语义块。配合框架自带的 RAG 问答 Agent一份厚文档可以直接接进问答系统。本文面向第一次接触该项目的开发者讲清楚如何用它解析文档、解析链路里发生了什么以及有哪些可调整的参数。 场景切入行业研报的文档问答策略团队做周报时通常要对着 120 页的 PDF 研报外加几份 Word 和 Excel 格式的季度数据。传统做法是人工CtrlF 定位段落把关键数据复制粘贴到新文档里做横向对比表格一多就容易串行漏行。更底层的卡点是LLM 的上下文再大也装不下几百页原文必须先把文档切成可检索的片段模型才能读得完、找得到。DocParser 解决的正是这个切的动作。它把各种格式的文档统一转换成同一种块结构每个块都带正文、token 数和来源文件、标题等元数据可以直接喂给下游的检索与问答模块不需要为每种格式单独写一套处理逻辑。图Qwen-Agent 解析 PDF 后针对论文内容直接提问这篇论文的结论是什么并给出回答⚡ Qwen-Agent 文档解析快速上手安装依赖与首次解析先装依赖。文档解析属于 rag 可选依赖一条命令即可pip install -U qwen-agent[gui,rag]如果还需要跑 WebUI 或改源码可以看 README.md 里的完整安装说明。解析本身不依赖模型服务只有后面接 RAG 问答时才需要配置 DASHSCOPE_API_KEY 或自建模型端点。最小示例是直接调用 DocParser 工具from qwen_agent.tools.doc_parser import DocParser parser DocParser() record parser.call({url: ./docs/2025_q3_report.pdf}) print(record[title]) # 文档中提取出的标题 print(len(record[raw])) # 切分出的块数 print(record[raw][0][metadata]) print(record[raw][0][content][:100])返回值是一个 dicturl、title以及 raw 分块列表每块含 content、token、metadata 三个字段。想跳过手工调用、直接得到一个可问答的 bot参考 examples/assistant_rag.py 和 examples/parallel_doc_qa.py后者还带一个 Gradio WebUI。 文档解析流程拆解从文件到可检索知识块整条解析链路在 qwen_agent/tools/doc_parser.py 与 qwen_agent/tools/simple_doc_parser.py 中可以拆成四步格式识别按扩展名判断文件类型支持 pdf/docx/pptx/txt/html/csv/tsv/xlsx/xls 共 9 种传入 http(s) 链接时会先下载到本地工作区再解析。内容提取与清洗Word 中的表格被转成 markdown 管道符文本PDF 文本里的 CID、十六进制占位等噪声被清理掉输出页 → 段落的统一结构。语义分块先统计全文 token 数。若不超过 max_ref_token默认 20000整篇文档就是一个块否则按段落逐个累加累到 parser_page_size默认 500就切一刀。超长的段落先按句子边界. 或。拆开相邻块之间还保留最多 150 字符的重复内容避免切点处语义被截断。元数据标注与缓存每个块标注 source、title、chunk_id整条记录写入本地缓存。缓存键由 sha256(url) 与分块大小组成同一文件第二次读取直接命中缓存。⚙️ Qwen-Agent 文档解析进阶用法块大小、缓存、批量块大小、缓存、批量参数速查与自定义分块参数通过构造器传入也可以用环境变量 QWEN_AGENT_DEFAULT_MAX_REF_TOKEN、QWEN_AGENT_DEFAULT_PARSER_PAGE_SIZE 全局覆盖参数默认值作用max_ref_token20000全文 token 数不超过它时整篇作为一个块parser_page_size500每个块的目标 token 数url—本地路径或可下载的 http(s) 链接缓存目录默认在工作区下的 tools/doc_parser构造器里传 path 可以改到自定义位置。自定义分块split_doc_to_chunk 是公开方法。如果文档结构固定比如研报固定有摘要 / 行业综述 / 公司分析可以继承 DocParser先按章节标题切段再对每段调用父类逻辑做 token 累加这样每个块就对应一个完整章节。批量处理框架提供了 parallel_exec见 qwen_agent/utils/parallel_executor.pyfrom qwen_agent.tools.doc_parser import DocParser from qwen_agent.utils.parallel_executor import parallel_exec parser DocParser({parser_page_size: 1000}) def parse(path): return parser.call({url: path}) results parallel_exec(parse, [./a.pdf, ./b.docx], max_workers2)❓ Qwen-Agent 文档解析常见问题同一份文档二次解析没有变快→ 原因缓存键由 sha256(url) 与分块大小组成路径写法或参数一变缓存就失效 → 处理调用时保持 url 与 parser_page_size 一致。提取出的表格不是结构化表格对象→ 原因Word、Excel 的表格统一被转成 markdown 管道符文本存放 → 处理需要列语义时自行按行、列拆字段或直接把表格文本送问答。中文文档的块切分点生硬→ 原因超长段落只按 . 和。两个句子分隔符切分 → 处理继承 DocParser 重写 split_doc_to_chunk按自己的章节规则分块。写在最后Qwen-Agent 的文档解析做的事并不复杂把各种格式的文件统一成块 元数据让长文档第一次变得可定位、可检索。分块策略与重叠机制都暴露在公开方法里按自己文档的结构去调通常比堆更多模型参数更见效。你手边哪类长文档是最想先接进这套链路的【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询