新开源DeepSeek-OCR,正在用眼睛“看懂”世界
就在昨晚,DeepSeek发布了新模型,也就是那个ocr。
今天,我的手机就被DeepSeek新开源的那个OCR模型刷屏了。
然后我看到一句话写的很好,遗忘也是一种优化策略。
我一行行读着那些技术拆解:“10倍上下文压缩”、“视觉Token”、“DeepEncoder”、“3B MoE解码器”…说实话,一开始我有点技术性的眩晕。这些词汇构建起了一堵高墙,高效,但也冰冷。
直到我看到一些评论说,不要把 DeepSeek OCR仅仅当作 OCR 模型看,就像人类记住一些事情,时间久了会慢慢遗忘,但部分信息已经抽象出来,依稀记得个大概,当需要用到是,这种模糊的记忆就全出来了。
一瞬间,某种东西被点通了。
回想起来,我们和AI打交道的方式,一直很“拧巴”。
那个时候,我们用OCR,是拼了命地想把图片里的文字“抠”出来,转换成AI能理解的纯文本字符串。我们是在“削足适履”,强迫这个五彩斑斓、图文混排的物理世界,去适应AI那个贫瘠的、一维的文本框。
我们忍受着糟糕的排版识别、丢失的上下文、支离破碎的格式。我们默认了一个前提:AI是“瞎”的,它只懂文本。
但DeepSeek这次在干嘛?
它用了一种极其“鬼才”的思路。它不是在“读”字,它是在“看”字。
它把一整页文档(无论多复杂)当作一张完整的“图像”来看待,然后用一种高效的视觉压缩方式,把这整页的信息,酣畅淋漓地压缩成几百个,甚至几十个“视觉Token”。
然后它告诉大模型:你别读文本了,你就“看”这些压缩后的“视觉Token”吧。
结果呢?
10倍的压缩率,识别准确率依然高达97%。
这就像Karpathy(前特斯拉AI总监)的那个设想:也许未来LLM(大语言模型)的所有输入都应该是图像,哪怕是纯文本,也先渲染成图片再喂给模型。
我们绕了一个大圈,从“图像→文本”,又回到了“文本→图像”。
我们真正想要的,从来不是一个更牛逼的OCR工具。我们想要的是一个能理解我们“版面语言”的AI。
为什么一份PPT要那样排版?为什么一张网页要把最重要的信息放在左上角?为什么一个复杂的仪表盘里,图表和数字是那样布局的?
这些“版式”、“布局”、“图文混排”本身就是信息,是人类社会上千年来沉淀下来的“视觉共识”。它有重点、有逻辑、有呼吸感。这是一种“活人感”。
过去的AI读不懂这些。你把一张复杂的网页扒成纯文本喂给它,它的灵魂就丢失了。它不知道什么是标题,什么是注释,什么是强调。
而DeepSeek-OCR,用“视觉压缩”的方式,恰恰是在保留这种灵魂。
它不是在“识字”,它是在“识局”,识别那个布局。
所以,我们不能只把它当OCR看。它的真正野心,是让AI学会“阅读”我们真实世界里的复杂文档:那些网页、PPT、SaaS软件的截图、那些混杂着化学公式和图表的论文。
这些东西,一旦强行转成纯文本,信息就损失殆尽。而DeepSeek在做的,是为AI保留那个完整的“现场”。
我不再把它看作一个单纯的OCR工具了。我更愿意把它看作一个“世界阅读器”的雏形。
它在用一种新的方式,让AI睁开眼睛,学会用我们人类习惯的方式,去“看”我们创造的知识。
至于那个用不同“分辨率”来模拟“遗忘机制”的假想,也很有意思。虽然我也觉得(像汪源说的)这更像“近视”而不是“遗忘”,但这个方向的探索,充满了技术的人文主义色彩。
AI不仅要学会看,还要学会“瞥”,学会“忘”,学会抓重点。
毕竟,遗忘也是一种优化策略。
两年多过去,AI的进化是肉眼可见的。但直到今天,我才感觉到,它终于开始学着,真正“读懂”我们这个,有点潦草、有点混乱,但充满结构和意图的真实世界了。
这比单纯的参数竞赛,要酷得多。
关注公众号,用极客视角洞察未来!