ERNIE-UIE 通用信息抽取预训练模型下载与选型指南:基于 PaddleNLP 的 UIE 全系列模型详解

发布时间:2026/10/9 5:09:26
ERNIE-UIE 通用信息抽取预训练模型下载与选型指南:基于 PaddleNLP 的 UIE 全系列模型详解 人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载ERNIE-UIEUniversal Information Extraction是 PaddleNLP 基于 ERNIE 3.0 知识增强预训练模型训练并开源的中文通用信息抽取模型可零样本zero-shot支持实体、关系、事件、观点与情感等多类抽取任务。本文以modelcenter/ERNIE-UIE/download_en.md的模型清单为核心系统讲解uie-base、uie-m-large等全系列预训练模型的下载方式、结构差异与选型策略并结合仓库中的 Notebook 与 Gradio 演示应用给出可直接运行的实战调用方案。一、模型清单总览八款 UIE 预训练模型UIE 系列提供了从轻量到重量、覆盖中英双语的多档模型modelcenter/ERNIE-UIE/download_en.md中给出了完整的官方下载对照表。所有模型均通过paddlenlp.Taskflow(information_extraction, model模型名)接口加载使用无需手工下载权重文件PaddleNLP 会自动完成下载与缓存如需离线部署也可按下表链接直接获取.pdparams权重。模型名称模型结构使用场景适配语言模型大小uie-base默认12-layers, 768-hidden, 12-heads信息抽取中文450MBuie-base-en12-layers, 768-hidden, 12-heads信息抽取英文418MBuie-medical-base12-layers, 768-hidden, 12-heads信息抽取中文450MBuie-medium6-layers, 768-hidden, 12-heads信息抽取中文288MBuie-mini6-layers, 384-hidden, 12-heads信息抽取中文103MBuie-micro4-layers, 384-hidden, 12-heads信息抽取中文90MBuie-nano4-layers, 312-hidden, 12-heads信息抽取中文69MBuie-m-large24-layers, 1024-hidden, 16-heads信息抽取中文、英文2.1Guie-m-base12-layers, 768-hidden, 12-heads信息抽取中文、英文1.1G其中几点值得注意uie-base是默认模型使用Taskflow(information_extraction, schemaschema)不显式指定model参数时默认加载的就是uie-base。uie-medical-base为医疗垂类专版权重存放路径与其他模型不同位于paddlenlp/taskflow/information_extraction/uie_medical_base_v0.1/目录下适用于医疗文本的结构化抽取场景。uie-m-base/uie-m-large为中英双语模型由uie_m系列独立发布结构为 12/24 层 Transformer可同时处理中英文输入规模远大于单语模型。二、模型定位与结构差异如何按资源与精度选型从源码结构看UIE 系列通过「层数 × 隐层维度 × 注意力头数」构成从轻到重的阶梯modelcenter/ERNIE-UIE/info.yaml中将其归属为「自然语言处理 / 文心大模型」两大类覆盖命名实体识别、关系抽取、事件抽取、评论观点抽取与情感分类五类任务。选型时可参考以下维度精度优先uie-m-large24L/1024H/16-heads在金融、医疗、互联网三大垂类测试集上表现最佳uie-base12L/768H则是中文单语模型中的默认均衡之选。速度与部署优先uie-nano4L/312H69MB与uie-micro4L/384H90MB体积最小、推理最快适合移动端或对延迟敏感的在线服务uie-medium6L/768H288MB、uie-mini6L/384H103MB则位于中档。中英双语需求直接选用uie-m-base或uie-m-large若仅需英文可用 418MB 的uie-base-en单语模型。模型大小直接决定部署形态450MB 级别的uie-base适合服务端 CPU/GPU 推理69MB 级别的uie-nano则更适合边缘设备。实际选型应在精度与资源之间做权衡建议先用默认uie-base验证效果再按部署约束逐级下探。三、模型效果参照垂类测试集上的 0-shot 与 5-shot 表现modelcenter/ERNIE-UIE/introduction_cn.ipynb与introduction_en.ipynb记录了在互联网、医疗、金融三大自建垂类测试集上的实验结果可以作为选型参考模型金融 0-shot金融 5-shot医疗 0-shot医疗 5-shot互联网 0-shot互联网 5-shotuie-base (12L768H)46.4370.9271.8385.7278.3381.86uie-medium (6L768H)41.1164.5365.4075.7278.3279.68uie-mini (6L384H)37.0464.6560.5078.3672.0976.38uie-micro (4L384H)37.5362.1157.0475.9266.0070.22uie-nano (4L312H)38.9466.8348.2976.7462.8672.35uie-m-large (24L1024H)49.3574.5570.5092.6678.4983.02uie-m-base (12L768H)38.4674.3163.3787.3276.2780.130-shot 表示无训练数据直接通过paddlenlp.Taskflow预测5-shot 表示每个类别用 5 条标注数据微调后的预测。实验表明在垂类场景下通过少量数据few-shot微调可进一步提升效果这也是uie-m-large在 5-shot 医疗场景达到 92.66 的原因。四、环境准备与模型加载安装 PaddleNLPmodelcenter/ERNIE-UIE/introduction_cn.ipynb的环境准备步骤pip install --upgrade paddlenlp pip show paddlenlp随后在 Python 中引入Taskflowfrom pprint import pprint from paddlenlp import Taskflow加载模型时model参数直接对应上文模型清单中的名称首次调用会自动从 PaddleNLP 官方存储下载权重ie Taskflow(information_extraction, schema[时间, 选手, 赛事名称], modeluie-base) ie_en Taskflow(information_extraction, schema[时间, 选手, 赛事名称], modeluie-base-en)仓库中的演示应用modelcenter/ERNIE-UIE/APP/app.py展示了同样的调用方式其运行依赖见modelcenter/ERNIE-UIE/APP/requirements.txtgradio、paddlepaddle、paddlenlp2.4.2应用配置见modelcenter/ERNIE-UIE/APP/app.ymlSDK 为 Gradio 3.4.1CPU 设备即可运行。五、基于 Schema 的五类抽取任务实战schema是 UIE 的抽取目标定义用自然语言描述即可无需训练。模型加载后可通过ie.set_schema(schema)随时更换抽取目标。5.1 实体抽取NERschema [时间, 选手, 赛事名称] ie Taskflow(information_extraction, schemaschema, modeluie-base) pprint(ie(2月8日上午北京冬奥会自由式滑雪女子大跳台决赛中中国选手谷爱凌以188.25分获得金牌))5.2 关系抽取RE以「竞赛名称」为主体抽取「主办方、承办方、已举办次数」关系schema {竞赛名称: [主办方, 承办方, 已举办次数]} ie.set_schema(schema) pprint(ie(2022语言与智能技术竞赛由中国中文信息学会和中国计算机学会联合主办百度公司、中国中文信息学会评测工作委员会和中国计算机学会自然语言处理专委会承办已连续举办4届成为全球最热门的中文NLP赛事之一。))5.3 事件抽取EE抽取地震事件的「地震强度、时间、震中位置、震源深度」论元schema {地震触发词: [地震强度, 时间, 震中位置, 震源深度]} ie.set_schema(schema) ie(中国地震台网正式测定5月16日06时08分在云南临沧市凤庆县(北纬24.34度东经99.98度)发生3.5级地震震源深度10千米。)5.4 评论观点抽取schema {评价维度: [观点词, 情感倾向[正向负向]]} ie.set_schema(schema) pprint(ie(店面干净很清静服务员服务热情性价比很高发现收银台有排队))英文模型调用方式一致schema [{Aspect: [Opinion, Sentiment classification [negative, positive]]}] ie_en.set_schema(schema) pprint(ie_en(The teacher is very nice.))5.5 句子级情感分类schema 情感倾向[正向负向] ie.set_schema(schema) ie(这个产品用起来真的很流畅我非常喜欢)英文示例schema Sentiment classification [negative, positive] ie_en.set_schema(schema) ie_en(I am sorry but this is the worst film I have ever seen in my life.)5.6 跨任务联合抽取schema支持混合结构在同一文本上同时完成实体与关系抽取例如法律判决书场景schema [法院, {原告: 委托代理人}, {被告: 委托代理人}] ie.set_schema(schema) pprint(ie(北京市海淀区人民法院\n民事判决书\n(199x)建初字第xxx号\n原告张三。\n委托代理人李四北京市 A律师事务所律师。\n被告B公司法定代表人王五开发公司总经理。\n委托代理人赵六北京市 C律师事务所律师。))六、轻定制微调用少量标注数据进一步提升效果对于简单抽取目标直接使用Taskflow即可实现零样本抽取对于细分垂类场景推荐使用轻定制功能——用少量标注数据如每类 5 条对所选 UIE 模型进行微调可显著提升效果。微调需要基于对应模型权重即上文下载表中的.pdparams文件继续训练训练完成后同样通过Taskflow加载使用。这一流程与实验表中 0-shot / 5-shot 的对比结论一致few-shot 微调是垂类落地效果提升的关键路径。七、模型信息与引用模型出处PaddleNLPmodelcenter/ERNIE-UIE/info.yaml中from_repo: PaddleNLP发布方 BaiduLicense 为 Apache 2.0。技术背景UIE 源自论文Unified Structure Generation for Universal Information ExtractionACL 2022实现了实体、关系、事件、情感等任务的统一建模并具备跨任务迁移与泛化能力。配套资源中文使用指南见 introduction_cn.ipynb英文版见 introduction_en.ipynb中文模型下载表见 download_cn.md如需快速体验可参考 APP 演示应用 构建自己的 Gradio 抽取界面。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐ERNIE-UIE 通用信息抽取预训练模型下载清单与零样本抽取实战指南ERNIE UIE 通用信息抽取预训练模型下载清单与零样本抽取实战指南 ERNIE UIE 是飞桨产业级开源模型库PaddlePaddle 官方维护中面向人工智能深度学习计算机视觉NLP语音PaddleNLP 热门模型实战指南DeepSeek 系列推理训练与 PP-UIE 通用信息抽取PaddleNLP 热门模型实战指南DeepSeek 系列推理训练与 PP UIE 通用信息抽取 本指南围绕 PaddleNLP 模型库中的两大热门模型家族展教程PaddleNLP 热门模型实践指南DeepSeek 系列思考模型与 PP-UIE 信息抽取模型深度解读PaddleNLP 热门模型实践指南DeepSeek 系列思考模型与 PP UIE 信息抽取模型深度解读 PaddleNLP 作为易用且强大的 LLM 与 S人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLP上一篇iOS-Network-Stack-Dive性能调优从3000并发连接到30%丢包环境优化下一篇exo 贡献指南源码构建、Model Card TOML 规范与 API 适配器开发创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询