Umi-OCR 使用指南:如何用这款免费 OCR 工具把截图、扫描件和图片转成文字

发布时间:2026/9/21 22:29:15
Umi-OCR 使用指南:如何用这款免费 OCR 工具把截图、扫描件和图片转成文字 Umi-OCR 使用指南如何用这款免费 OCR 工具把截图、扫描件和图片转成文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的 OCR 工具识别全部在你的电脑上离线完成不需要联网文件不会上传到任何服务器。它适合需要截图提取文字、批量转换图片或者把 PDF 扫描件变成可搜索文本的人。它到底能干什么四类识别任务一张表看懂 先对号入座看看哪一列是你的需求你想做的事软件里对应的页面说明截图提取文字截图 OCR快捷键框选屏幕任意区域直接识别也支持把别处复制的图片粘贴进来批量 OCR批量 OCR一次拖入几百张图片结果按 txt、jsonl、md、csv 等格式保存PDF 文字识别文档识别支持 pdf、xps、epub、mobi、fb2、cbz从扫描件提取文字或输出双层可搜索 PDF二维码 / 条形码二维码覆盖 QRCode、DataMatrix、PDF417 等 19 种协议支持一图多码也能反向生成码图另外还附带公式识别能力可以在识别代码、公式截图时输出更接近原文的格式。记住三个词就够了免费代码全部开源使用不收任何费用。离线内置离线 OCR 引擎断网也能用敏感内容不经过第三方服务器。开源界面语言由社区翻译协作维护每个版本的改动都能查 更新日志。从下载到启动三步拿到这个绿色便携 OCR 工具 Umi-OCR 的发行包是绿色版没有安装向导也不需要配置运行环境拿到发布包。官方发布的是.7z压缩包或.7z.exe自解压包电脑上没有解压软件的话直接双击自解压包即可。本仓库根目录也放了一份发行包Umi-OCR_Rapid_v2.1.5.7z可以直接取用。解压到任意目录。整个过程不写注册表、不装依赖解压出来就是一个完整文件夹。双击Umi-OCR.exe启动Linux 版本执行umi-ocr.sh。便携意味着把整个文件夹拷到另一台电脑就能继续用想卸载就是删掉文件夹。软件官方支持的运行环境是 Windows 7 x64 和 Linux x64。首次启动后建议做两件事确认界面语言。软件会按系统设置自动选语言不满意可以在全局设置 → 语言/Language里手动改主题、字号、字体也都在这里调整。在快捷方式区域勾选桌面快捷方式或开机自启之后截图识别的唤起成本会低很多。三个常用任务怎么一步步做从屏幕上拿文字截图识别与复制打开截图 OCR标签页用快捷键或页面上的截图按钮唤起框选Esc可以取消。框住要识别的区域松手后右侧记录栏立刻出现结果带置信度和耗时。在记录栏里可以直接编辑文字、划选多条记录复制也可以把结果导出到 txt 文件。图片已经在剪贴板里时比如刚截图还没保存直接在这个页面粘贴就能识别不用先落盘。如果你常识别代码截图把文本后处理的排版解析方案换成单栏-保留缩进输出会保留行首缩进和行内空格方便直接贴回编辑器。把扫描件变成可搜索的文字PDF 文字识别打开文档识别标签页拖入或选择文件。可处理 pdf、xps、epub、mobi、fb2、cbz 六类格式。选择输出方式只提取纯文本或生成双层可搜索 PDF——原始版面保留同时全文可检索、可复制。如果每页都有不想收录的页眉、页脚先进忽略区域编辑器把这几个位置框掉画法见下一节。点开始任务。夜间跑大文档时可以设置任务完成后自动关机或休眠。一次批量转换几百张图片打开批量 OCR标签页把文件夹或多张图片拖进左侧列表。支持 jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff没有数量上限几百张直接丢进去。右栏选择结果格式txt、jsonl、md、csvcsv 可以直接用 Excel 打开。点开始任务列表里逐张显示耗时、置信度和完成状态进度条显示整体进度。如果这批图片带统一位置的水印先画好忽略区域再启动避免水印文字混进结果。最容易踩坑的细节 ⚠️引擎、忽略区域与多语言OCR 引擎怎么选PaddleOCR 还是 RapidOCR发行包内置 RapidOCR 或 PaddleOCR 引擎之后可以在全局设置里切换也可以导入插件随时换。RapidOCR加载快、占用小日常截图提取文字、追求响应速度时用它。PaddleOCR对复杂排版、小字号、正式文档的识别精度通常更高代价是加载慢一些、内存占用更高。实用做法日常默认 RapidOCR遇到一批精度不达标的文档切到 PaddleOCR 跑同一批对比谁的结果可用就固定谁。用忽略区域排除水印和页眉页脚入口在批量识别页右栏设置里的忽略区域编辑器文档识别页同样可用。按住鼠标右键画多个矩形把水印、LOGO、页眉页脚可能出现的位置全部包住框尽量画大一点。注意规则被忽略的是框内整个文本块而不是单个字符。所以框要完整包住不想要的文字只压住一半时整个文本块仍会被保留。中英文混排等多语言文档语言库勾哪几个识别用的多语言模型是内置的在页面设置的识别语言里勾选需要的语言包即可中英混排就把两种都勾上。界面语言是另一套设置目前界面支持简体中文、繁体中文、英语、日语、葡萄牙语、俄语、泰米尔语等由社区在翻译平台上协作维护。识别不准时的常见原因和对策原图模糊、字太小先放大原图或提高扫描分辨率再识别效果比调参数明显。超长图被压缩失真到页面设置 → 文字识别 → 限制图像边长里调高数值避免大图被缩小后再识别。多栏文档输出顺序混乱换排版解析方案比如多栏-按自然段换行适合大多数文档单栏-保留缩进适合代码截图。整批置信度偏低换引擎再跑一遍或先增强图片对比度。进阶用命令行或 HTTP 接口调用 Umi-OCR想把识别动作接进自己的脚本或系统时有两条本地通道命令行入口就是主程序本身前提是在全局设置里允许 HTTP 服务默认开启。指令只在系统内部本地环回传递不经过网卡。例如对某个文件夹里的所有图片含子文件夹做识别并把结果写入文件Umi-OCR.exe --path D:/images --output result.txt完整参数可以用--help查看各指令的含义见命令行手册。HTTP 接口以请求方式提交 Base64 图片做 OCR、提交文档做 PDF 识别或做二维码的识别与生成适合把自己的软件接到 Umi-OCR 的离线引擎上。接口清单和参数见 HTTP 接口手册。两个使用提醒接口并发能力有限尽量不要多线程同时调用长时间连续调用偶发连接报错时重新发一次请求通常就能恢复。写在最后它适合谁遇到问题去哪找比较适合的人频繁从屏幕、文档里抠文字又不想把内容交给在线服务定期要处理成百上千张图片结果要落成 txt、Excel 之类的文件手里有一批扫描版 PDF想变成可搜索、可复制的文本需要本地部署一套离线 OCR通过命令行或 HTTP 接口被程序调用。不太适合的情况只是偶尔识别一两张图随手找个在线工具更轻需要高并发、多机大规模出结果的云端识别场景它的后端面向本机单用户设计使用 macOS 或 Windows 32 位系统官方只提供 Windows x64含 Win7与 Linux x64。遇到问题按这个顺序找项目的 Issues 页面可以直接提 bug 和功能建议维护者会跟进复现想看每次版本改了什么查 更新日志界面翻译不准确或有新语言需求可以到项目使用的 Weblate 翻译平台参与校对和补充。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询