Umi-OCR 新手实操指南免安装离线 OCR 搞定扫描版 PDF 与几百张图片【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR遇到这种情况时你多半会头疼合同是扫描版一个字都选不中论文整页是图片复制不了几百张票据截图堆在文件夹里等着整理成表格。更麻烦的是这些资料你并不想上传到任何在线识别网站。Umi-OCR 是一款免费、开源的离线 OCR 软件——识别引擎装在你自己的电脑上图片不离开硬盘不注册、不限额、不用联网识别多少张全由你自己定。这篇文章先带你把软件跑起来然后按合同归档、批量整理、随手摘抄三个真实场景逐个讲功能最后给出调优参数和常见问题对照照着做就能上手。先跑起来免安装版三步启动 Umi-OCRUmi-OCR 是绿色软件不需要安装。从项目发布页下载.7z压缩包没装压缩软件就选.7z.exe自解压包解压到任意目录Windows 双击Umi-OCR.exe、Linux 运行umi-ocr.sh即可。两个启动前的注意点路径里不要带中文和空格D:/Tools/Umi-OCR没问题D:/工具备/Umi-OCR就可能引出各种兼容问题。⚠️ 建议先把软件目录加入杀毒软件白名单它内置本地 OCR 引擎和运行库部分杀软会误报加白名单能省掉后面大量为什么闪退的排查。首次启动后界面会跟随系统语言。主窗口是标签页结构——截图OCR、批量OCR、文档识别、二维码、全局设置想用哪个点哪个还能锁住常用标签防误关。场景一合同归档——PDF 识别输出双层可搜索 PDF文档识别标签页支持pdf、xps、epub、mobi、fb2、cbz六种格式扫描版 PDF 是最典型的场景。整个流程可以概括为解析→识别→重组解析引擎底层依赖 PyMuPDF先把 PDF 拆开区分本来就有的文本层和需要 OCR 的扫描图片层扫描页交给本地 OCR 引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。最有价值的是双层可搜索 PDF底层保留原扫描图上层覆盖透明文字。外观和原件一模一样但文字可以搜索、划选、复制——给公司做历史合同归档、给学校做论文数字化直接顶上。提取模式也很灵活默认优先提取 PDF 自带文本层速度快、零识别误差遇到纯扫描页才自动切到 OCR你也可以选整页强制 OCR或反过来只提取原文本。v2.1.2 起还支持输出单层纯文本 PDF想要体积小、好编辑的文件就选它。这里同样支持设置忽略区域可按页码范围指定专门对付页眉页脚并能在任务完成后自动关机。场景二整理几百张票据——批量截图识别并导出 Excel批量OCR 标签页的用法很简单把图片直接拖进窗口支持 jpg、png、webp、bmp、tif、tiff 等常见格式几十张几百张都没有数量上限。点开始任务后右侧会逐张显示耗时、置信度和识别结果。下图是任务执行中的批量识别页面左侧为图片列表与进度右侧为实时输出的识别记录任务跑完后按需保存为四种格式之一格式用途txt纯文本最通用jsonl机器可读每张图片一行 JSONmdMarkdown 文档csvExcel 直接打开适合做表格整理两个挂机场景的贴心设计可以设置任务完成后自动关机或待机睡前丢进去几百张醒来直接收结果v2.1.2 起还支持暂停任务只要不退出软件待机/休眠之后可以接着跑。场景三屏幕上的字——截图 OCR结果直接进记录栏打开截图OCR标签页按快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏。还有一个省事的玩法不截图也能识别——在别处复制一张图片比如聊天窗口里的图回到 Umi-OCR 直接粘贴它照样识别。下图是截图识别界面左侧为截取的图片区域右侧为识别记录栏记录栏比想象中好用文字可以直接改错字还能划选多条记录一起复制。对记录右键可以复制单条、全选CtrlA、选中删除识别完顺手就能整理不用再跳去别的编辑器排除水印和页眉页脚忽略区域机制及其规则图片角落的水印、LOGO、页眉页脚每次都混进结果里批量识别页右侧设置里的忽略区域功能就是为这个设计的。进入忽略区域编辑器按住右键在图片上绘制多个矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被排除。批量转论文时把统一的页眉页脚一次框掉输出会干净很多。⚠️ 必须记住一条规则只有整个文本块完全处于框内才会被忽略而不是按单个字符算。画框时宁可大一点把水印所有可能出现的位置都包住漏框一次结果里就混进一行杂音。画完别忘保存配置。调到最顺手引擎、排版方案与性能设置切换识别引擎软件默认内置Rapid-OCR兼容性好和PaddleOCR速度快一些两套引擎全局设置里随时切换。遇到识别不准或报错先换引擎试试往往比调别的参数更有效。排版方案决定输出文字的阅读顺序OCR 引擎吐出的文字是散装的先后顺序靠排版解析方案安排。选对方案输出才符合阅读习惯方案适用场景多栏-按自然段换行两栏/三栏的论文、书籍排版最常用多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制整段合并成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理引擎原始输出不做任何整理不确定选哪个就选多栏-按自然段换行。代码截图则切到单栏-保留缩进缩进结构基本能原样保留下图就是识别代码截图的效果性能调优三个常见问题的解法长图/大图识别不完整去文字识别设置里调高限制图像边长。默认值是为了平衡速度与内存像素特别大的长截图适当调高即可。不要盲目放大原图——过度放大会增加噪声反而降低准确率。内存占用偏高使用 PaddleOCR 插件时v2.1.4 起默认内存占用被限制在系统总内存的一半以内想进一步压缩可在插件配置里调低线程数。截屏闪烁或界面错位显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速通常就能解决。语言、主题、快捷键等也在这个标签页下图是全局设置的界面与外观部分界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等由社区译者协作维护版本更新还会持续新增。注意界面语言和识别语言库是两回事——前者管按钮菜单长什么样后者管 OCR 引擎认哪种文字。识别语言库在各标签页的文字识别设置里单独选择或下载界面用中文、日常识别日文书籍完全可以搭配。常见问题七个高频问题的对照解法忽略区域画了却没效果→ 确认整个文本块完全在框内才会被忽略再确认保存了忽略区域配置。长图识别结果缺胳膊少腿→ 调高限制图像边长而不是盲目放大原图。截图时界面闪烁、错位→ 切渲染器或关闭硬件加速见上文性能调优。命令行指令没反应→ Umi-OCR 依赖本地 HTTP 服务进行进程间通信确认全局设置里 HTTP 服务已开启默认开启仅监听本地环回、不经过物理网卡数据不会外泄入口要用主程序Umi-OCR.exe备用启动器可能不支持。批量任务想中途暂停→ v2.1.2 起支持暂停任务只要不退出软件待机/休眠后可以继续跑。代码截图排版全乱了→ 排版方案切到单栏-保留缩进。文件夹里几万个文件加载很卡→ v2.1.5 优化了异步加载机制稍等加载完成再操作预览界面会显示加载进度。进阶命令行与 HTTP 接口两条程序化通道命令行入口就是主程序本身所有指令支持简写比如--screenshot可写--sc。几个常用姿势umi-ocr --screenshot --clip # 截屏识别结果直接进剪贴板 umi-ocr --path D:/scans -- all_result.txt # 识别整个文件夹含子目录结果追加到文件 umi-ocr --qrcode_create 文本内容 D:/qrcode.png 256 # 生成二维码手动指定宽高参数细节和简写规则见项目内 命令行手册配合快捷键工具还能实现按一个键自动截指定屏幕区域并识别。HTTP 接口Umi-OCR 启动后本地 HTTP 服务提供 OCR、文档识别、二维码等接口文档见 docs/http/api_doc.md。开发者用几十行代码就能把它封装成上传图片 → 返回 JSON 识别结果的局域网小工具。版本演进几个值得记住的节点v2.1.0新增批量文档识别支持 pdf、epub、mobi 等六种格式v2.1.2批量任务支持暂停新增单层纯文本 PDF 输出v2.1.4PaddleOCR 插件默认内存占用限制在系统总内存的一半以内v2.1.5修复 PDF 页面旋转导致的文本错位优化超大文件夹的异步加载。手头有旋转过方向的扫描件的话记得用最新版再识别。下次再收到扫描版合同、面对一堆带水印的票据时直接打开 Umi-OCR——不用上传、不怕泄露那些复制不了的字拖一下就能拿走。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考