Umi-OCR 离线文字识别指南:免费、可批量的一站式 OCR 方案

📅 发布时间:2026/8/31 20:03:08
Umi-OCR 离线文字识别指南:免费、可批量的一站式 OCR 方案 Umi-OCR 离线文字识别指南免费、可批量的一站式 OCR 方案【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款开源、免费、完全离线的文字识别软件不联网、不注册、不限字数解压即用。截图识别、批量图片、扫描版 PDF、二维码都是它的拿手好戏还内置多国语言界面。对需要 Umi-OCR 离线文字识别方案的人来说这篇文章从安装到接入工作流一次讲清。⚡ 五分钟跑通从安装到首次识别Windows下载发行版解压即用从官方发布渠道下载发行版.7z压缩包或.7z.exe自解压包解压到任意目录双击Umi-OCR.exe启动首次打开会自动跟随系统语言打开截图 OCR标签页用快捷键唤起截图并划选区域完成第一次识别源码编译日常用不上真要自建才需要单独部署运行环境README 的构建项目章节有说明这里一笔带过。习惯命令行的用户可以用 Scoop 一条线装好scoop bucket add extras # 添加 extras 软件仓库 scoop install extras/umi-ocr # 安装 RapidOCR 引擎版 # 或scoop install extras/umi-ocr-paddlePaddleOCR 引擎版两个引擎版不要同时装快捷方式会被覆盖装完后可以通过导入插件随时切换引擎。Linux下载发行版 部署运行环境下载 Linux 版本发行版和对应的运行库按官方步骤部署好 Python 运行环境后用umi-ocr.sh脚本启动即可项目也支持 Docker 方式部署适合服务器场景。进软件先逛全局设置页确认 HTTP 服务已开启命令行与接口调用的前提主机选仅本地即可顺手把截图快捷键、主题、语言都配好。按场景拆解从截屏到批量文档截一段屏里的字适用情境网页、文档、软件界面里的文字选不中或逐段复制太麻烦操作要点打开截图 OCR标签页按快捷键唤起截图、划选区域识别结果实时出现在右侧记录栏可直接编辑、划选复制左侧预览栏也支持鼠标划选复制一个具体参数在文本后处理 - 排版解析里选方案——代码截图选单栏-保留缩进普通文章选多栏-按自然段换行识别结果会按阅读习惯自动换行批量图片 OCR 导出 Excel 或 Markdown适用情境手里有一批图片要集中数字化几百张也照单全收操作要点把图片拖进批量 OCR页支持 jpg/png/webp/bmp/tiff 等格式无数量上限勾选 txt、jsonl、md、csv(Excel) 中想要的输出格式提交任务大文件建议勾选任务完成后自动关机/待机一个具体参数识别超长图时去页面设置 → 文字识别 → 限制图像边长把数值调高图片带固定水印的在右栏忽略区域编辑器按住右键画矩形框即可排除PDF 扫描件转可搜索适用情境纸质扫描件、图片型 PDF 无法复制文字或者想给电子书补一层索引操作要点打开文档识别页拖入文档扫描件走 OCR 后输出双层可搜索 PDF原图打底 透明文字层可复制可检索文本型 PDF 直接提取原有文字一个具体参数文档页同样支持忽略区域把固定出现在每页的页眉、页脚框掉正文提取更干净类型支持格式可输出图片识别jpg, png, webp, bmp, tiff 等txt, jsonl, md, csv(Excel)文档识别pdf, xps, epub, mobi, fb2, cbz双层可搜索 PDF、纯文本扫个码 / 生成个码适用情境图片里有条码/二维码要读内容或者要把一段文本生成码图操作要点二维码标签页拖入图片即可扫码支持一图多码覆盖 QRCode、DataMatrix、EAN13、PDF417 等 19 种协议反向输入文本则生成码图一个具体参数生成时可调整纠错等级与图片尺寸产物直接保存为图片文件接进你的工作流CLI 与 HTTP 接口两种调用方式共用同一个前提全局设置页开启 HTTP 服务默认已开启仅本地即可通信只在本地环回进行不走物理网卡。最常用 CLI 命令umi-ocr --show # 弹出主窗口 umi-ocr --screenshot --clip # 截图识别结果复制到剪贴板 umi-ocr --path D:/images # 批量识别文件夹图片含子文件夹 umi-ocr --qrcode_read D:/code.png # 识别二维码 umi-ocr --qrcode_create 文本内容 out.png 128 # 生成 128px 二维码HTTP 端点一句话版/api/ocr传入 Base64 图片返回结构化识别结果/api/doc文档识别可下载双层 PDF 结果/api/qrcode二维码识别与文本生成码图/argv把上述 CLI 命令经 HTTP 转发执行适合程序调用注意后端对并发支持较弱批量调用请串行偶发ECONNREFUSED重试一次就好。完整参数见命令行手册与HTTP 接口手册。 调优实战速度与精度怎么平衡引擎二选一引擎特点适合场景RapidOCR兼容性好、速度稳定默认版本自带通用识别、老系统Windows 7PaddleOCR速度稍快、语言模型可灵活配置大批量中文文档三个实操建议预处理保证文字清晰可读超大图先缩到合理尺寸再识别速度提升最明显忽略区域批次图片带固定水印/页眉的先画忽略区域比识别完再手动清洗省事分批 自动关机超大数量分批提交配合任务完成后自动关机/待机放一晚上跑完资源提醒一句批量处理高分辨率图片时引擎会持续占用内存任务期间尽量关其他内存大户识别异常时检查全局设置里的引擎内存清理选项。踩坑速查五个高频问题启动提示缺少 DLL→ 安装 Visual C 运行库或重新从官方渠道下载稳定发行版含完整运行库。截屏时画面闪烁、UI 错位→ 全局设置 → 界面和外观里切换渲染器换成不同渲染方案或关闭硬件加速。识别结果混入水印、页眉页脚→ 批量页忽略区域编辑器里按住右键画矩形框把干扰元素完全包裹注意只有整块落在框内的文本才会被忽略框别画太小。批量任务跑得太慢→ 调高限制图像边长、分批提交或换用速度更快的引擎版本配合自动关机错峰处理。命令行收不到输出→ 系统重定向符不生效改用--clip或--output file.txt命令完全无反应时检查全局设置里 HTTP 服务是否开启。插件生态与二次开发入口Umi-OCR ├─ Umi-OCR.exe # Windows 主程序 ├─ umi-ocr.sh # Linux 启动脚本 └─ UmiOCR-data ├─ main.py # Python 入口 ├─ py_src/ # 业务源码 ├─ qt_res/ # 界面资源与 QML 源码 ├─ plugins/ # 插件目录OCR 引擎等 └─ i18n/ # 多语言翻译文件plugins/目录是扩展的核心入口可插拔的扩展点有四类OCR 引擎Rapid、Paddle 本身就是插件形态也可集成新识别引擎输出格式在 txt/jsonl/md/csv 之外扩展新的保存格式预处理识别前对图片做清理、增强后处理排版解析就是这个方向的现成例子文本纠错、半全角转换都能往这里加动手前建议先通读 README 的工程结构说明再下钻py_src/源码。社区参与 项目动态翻译贡献项目在 Weblate 平台上做界面本地化协作可在线校对现有语言繁中、英语、日语、俄语等或添加新语言问题反馈Bug 与功能请求直接提交到项目 Issue作者维护活跃项目动态更新日志记录了各版本细节当前 v2.1.5 带来了日志机制、双栏模式与--reload配置重载Roadmap 关键词GPU 加速的离线 OCR、独立数学公式识别与 LaTeX 渲染、表格图片识别输出 Excel、图片翻译、macOS 平台兼容免费、离线、可批量Umi-OCR 把这三件事同时做到了开源 OCR 工具里日常识别不花一分钱敏感数据不出本机。下载发行版解压后五分钟就能跑出你的第一次截图识别——数字化工作流从这一张截图开始。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考