
Paperless-ngx 多语言 OCR 快速上手指南【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngxPaperless-ngx 扫英文文档很顺但中文发票、日文研报一进来OCR 乱码、日期猜错、搜索落空就全冒出来了。想让它真正吃下多语种材料得把界面、识别、日期解析这条链路一次捋顺这篇给你能直接抄的配置。为什么要折腾这个Paperless-ngx 默认只带英语 Tesseract 语言包PAPERLESS_OCR_LANGUAGE缺省就是eng中文扫描件识别出来基本是乱码开票日期3月5日 这种写法也抓不准。界面切了中文但识别层没动等于只换了皮肤——三处都配齐才叫多语言可用。 能力全景一张表环节负责什么配置项落在哪界面文案菜单、按钮、提示翻译前端设置里切语言Django i18n 语言 cookiesrc/locale/ 下 55 语言包文本识别扫描件转文字PAPERLESS_OCR_LANGUAGE、PAPERLESS_OCR_LANGUAGESTesseract 引擎装包逻辑在docker/rootfs/etc/s6-overlay/s6-rc.d/init-tesseract-langs/run日期推断把3月5日变成日期PAPERLESS_DATE_PARSER_LANGUAGESdateparser 库不填则跟随 OCR 语言全文检索搜索时的分词语种PAPERLESS_SEARCH_LANGUAGEsrc/documents/search/时间戳文档创建/修改时间PAPERLESS_TIME_ZONEDjango 时区缺省 UTC最小可跑通配置把下面这段贴进 compose 的environment重启容器就完事语言包由初始化脚本自动安装不用手进容器environment: - PAPERLESS_OCR_LANGUAGEchi_sim - PAPERLESS_OCR_LANGUAGESchi_sim eng - PAPERLESS_DATE_PARSER_LANGUAGESzhen - PAPERLESS_TIME_ZONEAsia/Shanghai - PAPERLESS_TASK_WORKERS1基础编排文件可以从 docker/compose/ 里的现成模板改。界面语言等容器起来后在个人设置里切成中文即可翻译包已经在镜像里了。逐项拆关键配置你问界面已经是中文了为什么 OCR 还是瞎的它答两码事。界面语言只翻译按钮和菜单识别扫描件靠 Tesseract 语言包。想认中文PAPERLESS_OCR_LANGUAGE写chi_sim——注意这是 Tesseract 的命名不是zh-cn。你问PAPERLESS_OCR_LANGUAGE和PAPERLESS_OCR_LANGUAGES什么关系它答前者是每次识别用哪个语言后者是往容器里额外装哪些语言包。镜像默认只带engchi_sim、jpn不写进LANGUAGES就不会被安装脚本装进来识别时直接报缺包。你问日期解析为什么填zhen而不是chi_simeng它答两套体系。dateparser 认短码、用加号连接Tesseract 认三位 ISO 码。docs/configuration.md的PAPERLESS_DATE_PARSER_LANGUAGES一节专门标了这个差异混填会报错或解析不到。你问时区不改会怎样它答缺省 UTC所有时间戳差八小时跨国协作对不上账。国内环境直接Asia/Shanghai。 三个工作流走一遍中英混合发票。拿到一沓中文抬头、英文条款的 PDFOCR 同时挂chi_sim和engTesseract 逐区识别日期解析挂zhen后Invoice Date: 2026-03-05 和 开票日期3月5日 都能落进元数据最后得到一个中英文内容都可全文检索、日期整齐的归档库。多语种研报归档。拿到中、英、日三种语言的论文语言包扩到chi_sim eng jpn搜索语言跟随主语言再挂工作流按关键词自动打标得到一个不用切语言界面就能混搜的文献库。双时区团队共用一套库。上海和柏林的同事共用实例PAPERLESS_TIME_ZONE定成公司基准时区界面语言各自选时间戳不再各说各话批量编辑、权限行为跨时区一致。⚡ 资源与速度预估文档类型单次批量体感耗时容器内存参考纯扫描件 A45 份分钟级10 页约几分钟4G 够用中英混排 PDF20 份以排队为主看并发8G 起日文 / 手写体5 份明显更慢个别页可能超时8G 以上留余量并发数由PAPERLESS_TASK_WORKERS控制缺省只有 1 个 worker批量大就先调它再调别的每多挂一种语言包Tesseract 常驻内存都会往上走扩容时把余量算进去。 高频踩坑 Top 3症状界面全中文中文扫描件识别还是乱码。根因只动了界面语言识别层仍是默认eng。处方PAPERLESS_OCR_LANGUAGEchi_sim并确认chi_sim已出现在PAPERLESS_OCR_LANGUAGES里被装进容器。症状rootless 模式启动后语言装不上、识别报错。根因安装脚本要apt-get装tesseract-ocr-*rootless 容器没有权限官方文档明确说这种情况别依赖自动装包。处方改回 root 运行或在基础镜像里预装语言包再启动。症状日期字段时准时不准。根因日期解析语言没单独指定且PAPERLESS_DATE_ORDER缺省是DMY3/5 被理解成 5 月 3 日。处方显式设PAPERLESS_DATE_PARSER_LANGUAGESzhen再按团队习惯调PAPERLESS_DATE_ORDER。 收个尾语言包、日期解析、时区三处对齐Paperless-ngx 就能从能扫升级到扫得懂剩下的交给日常使用反馈。想继续玩docs/configuration.md 里翻PAPERLESS_AI_LLM_OUTPUT_LANGUAGE让 AI 分类输出中文或到 docker/compose/ 换带 Tika 的编排试 office 文档解析。【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考