程序员老鬼

local_ai_ocr 这个开源项目,专门用于 Windows 端的本地离线文字识别。

想从文档、PDF 里把文字抠出来,真是年年都在用 OCR,年年都在被气笑。

线上工具不是限页数、加水印,就是动不动让你登录、传云端,碰到点敏感文件(合同、证件、论文初稿之类的),总感觉心里一紧:这东西传上去,安全么? 本地工具呢,又经常是识别率感人、排版乱作一团,用一次怀疑人生那种。

最近在 GitHub 闲逛的时候,偶然刷到一个项目:local_ai_ocr。 看介绍是基于 DeepSeek-OCR 模型做的,主打一个「本地离线」「支持 GPU」「还原排版」,专门给 Windows 用户用的 AI OCR 小工具。 简单折腾了一下,感觉可以用一句话总结:——就像把云端收费 OCR,拽回自己电脑里白嫖了。

先说大家最关心的隐私问题。

Image

local_ai_ocr 的工作方式很直接:模型、程序统统在你电脑本地跑,不需要登录账号,也不需要把文件传到任何服务器。 你丢进来的 PDF、图片,理论上就只在你这台机器上转一圈,处理完就结束,不会神秘“上云”。

对于那种不敢上传的东西,比如公司内部资料、科研数据、还没公开的标书,这种完全离线的方案会舒服太多。 哪怕是心理层面的安全感,也比盯着「文件上传中」那条进度条强多了。

再来是上手门槛。

Image

有些本地 AI 工具一看教程就头大:装环境、配依赖、命令行各种参数,一套搞下来比写个小项目还复杂。 local_ai_ocr 这边算比较友好:作者已经打包好,下载解压,运行一下初始化脚本,基本就能开箱即用。

界面也是那种非常「程序员审美」的朴素风格,但好在逻辑很清晰: 要么直接拖文件进去,要么选路径批量处理,没有乱七八糟的启动广告、会员弹窗之类的骚操作。 用过某些国产 OCR 桌面端的朋友应该能懂,这一点真的挺难得。

识别效果这块,我简单说几个点。

纯文字文档,比如扫描版的书页、打印好的讲义,这类对它来说基本是降维打击,速度快、错字少。 碰到带表格、混排、标题层级比较复杂的 PDF,它的一个优势就出来了:支持直接导出 Markdown。

Markdown 听起来有点技术味,但好处很实际:它能把标题、列表、表格这些结构都标记出来。 你后面不管是丢到笔记软件里,还是再转成 Word、网页,都比「一坨纯文本」要好用太多。

表格识别这一块也可以单独拎出来说。

有些 PDF 里的表格既不是图片,也不是标准表格,属于那种看上去是表格、复制出来乱成麻的类型。 local_ai_ocr 会尽量把这些表格结构还原出来,用 Markdown 的表格语法重新搭一遍,至少行列是对得上的。

你再导入到 Obsidian、Notion、甚至直接贴到支持 Markdown 的编辑器里,就能一秒变回规规矩矩的表格。 对经常整理报表、财务、统计数据的同学来说,这点真的很省时间。

性能方面,它吃得下 GPU,这点也挺香。

如果你电脑里有 NVIDIA 显卡,开启 GPU 模式之后,多页 PDF 跑起来速度会明显上一个台阶,几十页的文档处理起来不会太煎熬。 当然没显卡也不是不能用,只是老老实实走 CPU,速度就看你机器配置了。

整体体验下来,是那种「认认真真做功能」的项目。 没有 UI 花里胡哨,也没有一堆花活,只是在识别准确率和排版还原上把精力堆得比较明显。

GitHub地址:github.com/th1nhhdk/local_ai_ocr

-END-

我为大家打造了一份AI教程,完全免费:songshuhezi.com/rpa.html