又一个 OCR 开源模型火了,但 Chandra OCR 2 这次真不只是“识字”
做过 PDF 和扫描件处理的人,应该都懂那种崩溃感。
不是识别不出来,是识别出来以后更难收拾。表格被打散,公式糊成一坨,手写字东缺一笔西少一画,最后你看着导出来的 txt,只会怀疑自己为什么不一开始就手动录。
所以我今天刷到 Chandra OCR 2 的时候,第一反应不是“又来一个 OCR”,而是先看它敢不敢碰最难的那些东西。
结果还真敢。
这个开源模型主打的不是单纯把字抠出来,而是把图片和 PDF 直接转成结构化的 Markdown、HTML、JSON,连原始排版都尽量保住。官方给出的重点能力里,最实用的几项都挺戳痛点:复杂表格、数学公式、手写内容、多语言文档,甚至表单里的复选框这类细节,它都在认真处理。GitHub 和模型页都明确提到,它支持 90 多种语言,还能提取图表并自动生成描述。
这事为什么值得聊?因为很多 OCR 工具的问题,不是“识别率差一点”,而是它默认你处理的是一张规规矩矩的纸。但现实里的文档根本不是这样。论文里有公式,报销单里有表格,合同里有勾选框,老师批注还是手写的。传统 OCR 一旦碰到这种混搭局,输出经常就不是可编辑文档,而是一场灾后现场。
Chandra OCR 2 比较像是在认真解决这个老问题:别只把字认出来,得把文档当成文档。 它保留结构、还原布局、输出机器能继续处理的格式,这就意味着它不只是给人看,也能直接接进后续工作流。比如知识库清洗、论文整理、表单入库、多语言档案数字化,这些场景一下就顺了很多。
还有个细节我挺在意:它支持命令行直接处理单个文件或者整个目录。这个就很工程化,不是那种“演示很惊艳,落地很麻烦”的项目。真要批量跑扫描件、老 PDF、历史档案,这种能力比一堆花哨 demo 更有用。
当然了,OCR 这条赛道也不是第一次有人喊“效果很好”。但 Chandra OCR 2 至少让我觉得,它抓的点是对的:不是继续卷干净页面上的识别分数,而是去啃那些最容易把人逼疯的脏活累活。
你要是经常处理扫描论文、跨语言文档,或者公司里堆着一堆格式乱七八糟的 PDF,这个项目确实值得装下来试试。
有时候,真正有用的 AI 进步,不是更会聊天。
是终于肯帮你把那些最麻烦的文档,老老实实收拾明白。
GitHub地址:datalab-to/chandra。