ChatGPT讲解——MinerU.Chem

发布时间:2026/10/6 8:02:40
ChatGPT讲解——MinerU.Chem MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction RecognitionAbstract:摘要想表达什么这篇论文介绍了MinerU.Chem,一个面向有机化学论文和专利的高精度文档解析系统。它要解决的核心问题是:有机化学文献中的大量关键信息不是普通文字,而是嵌在分子结构图、反应路线图、表格和图片中;通用文档解析系统通常无法理解这些图像中的化学含义。1. 为什么普通文档解析不够用有机化学论文里经常包含:分子结构式;反应路线;反应物和产物;反应条件;化合物编号;复杂的图表和示意图。这些内容对化学家来说非常重要,但普通 PDF 或 Markdown 解析工具通常只会把它们当成图片,无法识别:原子之间如何连接;哪些分子是反应物;哪些分子是产物;反应条件是什么;分子结构在原图中的位置;化学结构中包含的立体化学、重复单元或特殊键。因此,许多有机化学知识无法自动转成机器可读的数据。2. MinerU.Chem 的目标MinerU.Chem 是建立在 MinerU 通用文档解析系统之上的化学专用扩展。MinerU 负责先把论文转换为:Markdown;JSON;页面布局;文本;公式;表格;图片区域。MinerU.Chem 再对其中与化学相关的图像区域进行进一步分析,把它们转换成结构化的化学信息。3. 系统包含五个化学模块MinerU.Chem 主要增加了五个模块:化学相关性筛选判断页面中的图表区域是否与化学有关。分子结构检测找出图像中哪些区域包含分子结构。分子标识符提取识别结构旁边的化合物编号或标签,如 1、2、1a、2a。分子结构识别把分子结构图转换为机器可读的化学结构。反应路线解析从反应图中提取反应物、产物和反应条件。这些模块共同把化学论文中的视觉信息转换成两类输出:Molecule Summary List:分子摘要列表;Reaction Summary List:反应摘要列表。4. 两种主要输出是什么Molecule Summary List它记录论文中检测到和识别出的分子,包括:分子所在页码;图像中的位置;化合物编号;MolFile;SMILES;与原始图像的关联。Reaction Summary List它把一个反应组织成:反应物;产物;反应条件;对应的分子结构记录。如果反应物或产物带有化合物编号,系统还会将它们链接回 Molecule Summary List 中对应的分子。这样,用户可以从一个反应追溯到原论文中的具体分子图像。5. 为什么采用 CARBON 表示法分子结构识别的核心表示不是只输出 SMILES,而是使用CARBON:Complex Atomic Representation and Bonding Object Notation作者认为,SMILES 虽然适合表示基本的原子连接关系,但对一些复杂信息表达能力有限,例如:分子图像中的二维布局;非标准化学键;原子价态;自由基;连接点;重复结构;Markush 结构;特殊立体化学信息。CARBON 以原子为中心表示分子图,可以同时保留:原子;键;化学语义;特殊结构;原图中的二维坐标。在系统内部,CARBON 作为主要预测格式;为了兼容现有化学软件,系统还可以进一步导出:MolFile;SMILES。6. 分子识别效果很强作者在修订后的 MolRecBench-Wild 数据集上测试了分子结构识别模块。在可以用 SMILES 评价的 2,392 个样本上:SMILESexact-match = 93.02 % \text{SMILES exact-match}=93.02\%SMILESexact-match=93.02%作为对比,论文测试的最佳比较系统 GPT-5.6-Sol 达到:74.87 % 74.87\%74.87%MinerU.Chem 高出:18.15 18.1518.15个百分点。在全部 5,024 个带图结构标注的样本上,MinerU.Chem 的图结构准确率达到:79.66 % 79.66\%79.66%相比之下,比较系统中的最好结果约为:36.41 % 36.41\%36.41%高出 43.25 个百分点。7. 系统的实际用途MinerU.Chem 的目标不是只做单张图片识别,而是服务于整篇化学文献的结构化数据生产。它可以帮助构建:有机化学知识库;反应数据库;分子数据库;AI for Chemistry 训练数据;反应预测数据;逆合成数据;反应条件推荐数据;分子性质预测数据;药物分子设计数据。同时,系统保留原始页面位置,使识别结果能够:回溯原文;人工检查;修正识别错误;确认模型是否误读了化学结构。摘要一句话总结这篇论文提出 MinerU.Chem,将通用文档解析与化学专用模块结合,把有机化学论文中的分子结构、化合物编号和反应路线转换为可追溯的结构化数据,并通过 CARBON 保留复杂化学语义和图像布局,在分子结构识别准确率上明显超过现有比较系统。第 1 章:Introduction(引言)这一章主要说明论文为什么需要 MinerU.Chem,以及它要解决什么问题、采用什么结构表示,并总结系统的主要贡献。1. 有机化学文献中的关键信息往往不是普通文字在有机化学论文和专利中,大量核心知识被放在:分子结构图;反应路线图;表格;图片;实验流程示意图。分子结构图中包含的不只是“有哪些原子”,还包括:原子之间的连接关系;原子和基团标签;二维布局;立体化学信息;重复结构;特殊键;连接点;化合物之间的空间关系。反应图还要组织:反应物;产物;反应条件;反应步骤;箭头方向;多个区域之间的对应关系。这些图像对化学家来说非常直观,但对于通用文档解析系统来说很难直接理解。2. 通用文档解析工具的局限普通 PDF 或论文解析系统通常能够处理:普通文本;公式;表格;页面布局;图片位置。但遇到化学图像时,往往只会把它当作普通图片,而不会分析图片内部的化学语义。这会导致:无法建立完整的化学知识库;分子结构无法转成机器可读格式;反应物和产物无法自动整理;反应条件无法与分子对应;AI for Chemistry 缺少高质量结构化训练数据。3. 现有化学识别系统仍然不够稳定光学化学结构识别(OCSR)系统能够从分子结构图中恢复基本的原子连接关系。但是,在真实论文和专利中,图像质量和结构形式更加复杂,常见问题包括:低分辨率扫描;模糊;图像背景复杂;多个分子拥挤排列;非标准结构表示;键的视觉形式容易混淆;分子结构与文字、箭头、表格相互重叠。即使成功恢复了原子连接,很多复杂语义仍可能丢失,例如:立体化学;重复单元;Markush 片段;配位键;非标准键;原始图像中的空间坐标。因此,论文认为真正可用于数据库构建和 AI 训练的系统,不仅要识别“分子拓扑”,还必须保留:复杂化学语义;原图中的位置;分子与标签的对应关系;从识别结果回溯到原文的能力。4. 反应路线解析也存在类似问题现有系统已经尝试解析反应图,例如识别:反应物;产物;反应箭头;反应条件。但在真实文献中,反应图经常包含:密集排版;多个反应区域;复杂背景;低质量扫描;跨区域对应关系;多步反应;分子编号和结构图分离出现。因此,单独识别某一张反应图还不够。系统还需要把反应图与整篇论文的布局、文字、编号和分子记录联系起来。5. MinerU.Chem 的定位MinerU 是一个通用科学文档解析工具,可以把 PDF 和图片转成:Markdown;JSON;文本;公式;表格;页面布局信息。MinerU.Chem 在此基础上增加化学专用解析层。它首先利用 MinerU 得到论文的整体结构,再对其中与化学有关的图片区域进行深入识别。系统输出两种核心结果:Molecule Summary List记录文档中检测到的分子,包括:分子所在页码;图像中的边界框;化合物编号;MolFile;SMILES;与原始图像的对应关系。Reaction Summary List记录反应图中的:反应物;产物;反应条件;与对应分子记录的链接。这样,用户可以从一个反应追溯到具体分子,再追溯到论文原始页面。6. 系统包含五个化学模块MinerU.Chem 的化学解析层包括:化学相关性筛选判断某个图片或表格区域是否与化学有关。分子结构检测找到页面或图表中的分子结构区域。分子标识符提取识别结构旁边的编号和标签,如 1、2、1a、2a。分子结构识别把结构图转换成 CARBON、MolFile 和 SMILES。反应路线解析识别反应物、产物、条件和反应关系。这五个模块不是相互独立的,而是组成一条完整的数据生产流程。7. 为什么不能只使用 SMILESSMILES 是目前化学信息学中最常用的分子表示形式之一,非常适合表示:原子连接关系;基本分子拓扑;与下游化学软件的接口。但它不擅长完整保留分子图像中的所有信息,例如:非标准键;原子价态;自由基;连接点;重复结构;Markush 结构;原始图像布局;某些特殊立体化学表示。因此,单独把图片转换为 SMILES,可能会得到一个“拓扑上看似正确,但语义不完整”的结果。8. CARBON 是系统的核心表示MinerU.Chem 采用 CARBON:Complex Atomic Representation and Bonding Object NotationCARBON 是一种以原子为中心的图结构表示,可以保存:原子;化学键;原子属性;缩写基团;非标准键;重复结构;二维坐标;原始分子布局。论文将 CARBON 从原本的评测表示扩展为系统内部的原生预测格式。系统内部保留 CARBON,以保证复杂语义和原图布局不丢失;同时再从 CARBON 导出:MolFile;SMILES。这样兼顾了两方面需求:CARBON 负责忠实表示复杂化学结构;MolFile 和 SMILES 负责兼容现有化学工具链。9. 论文的主要贡献作者总结了三项贡献。第一,完成化学解析能力的集成部署把以下模块集成到 MinerU 在线平台:化学相关性筛选;分子检测;编号提取;分子结构识别;反应路线解析。最终输出带有原文位置链接的 Molecule Summary List 和 Reaction Summary List。第二,系统性使用 CARBONCARBON 不只是用于离线评测,而是成为系统内部的原生预测格式。它保留了 SMILES 难以完整表达的:分子布局;复杂化学语义;特殊结构。同时,系统仍能导出 MolFile 和 SMILES,方便下游使用。第三,在真实复杂图像上取得高识别准确率在修订版 MolRecBench-Wild 上:SMILES 可评估子集共 2,392 个样本;SMILES exact match 达到 93.02%;全部图结构标注样本共 5,024 个;图结构准确率达到 79.66%。相比对比系统:SMILES 准确率比 GPT-5.6-Sol 高 18.15 个百分点;图结构准确率比 Gemini-3.5-flash-thinking 高 43.25 个百分点。本章一句话总结第 1 章指出,有机化学文献中的关键知识大量存在于复杂图像中,通用文档解析和单纯 SMILES 表示都难以完整保留这些信息

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询