程序员老鬼

DeepSeek 发布了一个新型 OCR文档理解模型:DeepSeek-OCR

我今天看到个点子,真的有点上头…DeepSeek 出了个叫 DeepSeek-OCR 的新模型,本质上不是普通 OCR,那玩意儿只是顺带的。它居然把「长文当图片塞进模型里」,靠少量视觉 token就把原本文本那坨上下文给压缩了,然后再“解码”回文字。简单讲:不逐字读,改成“看图识字”。结果呢?他们自己给的数字是10×压缩还能还原到大概 97%,20×的话精度掉到 60% 左右(这就明显有损了)。听着有点离谱,但现在一堆人实测、媒体报道都在说这事儿。

Image

对了,它不是那种几百 B 的巨兽哈,宣传里说是个大概 3B 级别的视觉-语言模型/解码架构,代码和权重上来就丢 GitHub 了,帖子也给了跑通经验(有人在一块小卡上折腾成功)。这说明它更像是一个“概念验证 + 可落地”的工程组合:前面用视觉编码器把文字画成图后嵌成少量 token,后面用一个解码器从这些视觉 token 里把字“读回来”。

为啥把文字画成图片反而更省?我瞎琢磨了一下: 文字直接进 LLM,token 是按字词切的,越长越贵;但如果你把整页排版“拍成图”,视觉编码器一眼扫全局,提要素、提结构,最后只吐出一小撮视觉 token。这些 token 更像“信息块”而不是“一个字一个字数”,密度高,冗余低。学界其实早有人在探这条路:把长上下文转成视觉/潜空间来减 token,这次 DeepSeek 等于是做了个更狠的版本+放了结果出来。

然后我突然想到一个特别中二但好懂的比喻——“视觉压缩记忆”:

  • 新近的对话/资料 → 高清图(高保真,信息多);
  • 老一点的上下文 → 模糊缩略图(低信息密度,但还能找回大意);
  • 需要时再把“缩略图”解码回细节。 这不就有点像我们脑子里记事儿嘛?近的清楚、久的模糊,但要真用得上,再翻照片/笔记,能把细节捞回来。DeepSeek 官方博客和几家报道基本就是这个味儿。

我随手捋几件实打实的影响(也是我最兴奋的地方):

  1. 上下文天花板被撬开了。以前几百页 PDF 扔进去直接把显存烧干;现在先“拍照压缩”,LLM 只吃一小把视觉 token,计算量噌地降下去——省钱、省时,还能开更大活儿。
  2. 长期记忆可存档。把历史聊天、知识库“渲染成册”,需要就按页拉回,像翻图册一样。有人直接夸张到“百科压一张超清大图”的类比,虽然标题党,但方向是一致的。
  3. 文档理解更像人类在“看版面”。不是只抄文字,而是把版式、层级、图表位置都带上,这对表格、扫描件、票据这类结构化抽取特别友好。DeepSeek 说他们在综合文档基准上也打过一些同类 OCR 的分数。 但别光嗨,坑也不少,我碎碎念几条:
  • 信息丢失不可避免:10× 还能 97% 挺亮眼,20× 就只剩 60% 的还原,这就不是“无损笔记”,是「学习提纲」了。做检索还行,让它逐字逐句还原法条/合同…我会紧张。
  • 错误类型会变:传统 LLM 的错多是“编”,这个路线的错更像OCR+解码串联误差,比如某些小字、脚注、公式,下游一旦用它做严肃推理,误差可能被“放大”。(这一点目前更多是合理推断,但从他们公开的 20× 数字已经能感到边界了。)
  • 版权/合规要上心:你把一整本书“渲染成图再吃掉”,从法律视角它还是一份复制品与派生处理,不是说变成图片就自动合规,这条在实务里千万别想当然。
  • 不是 DeepSeek 独家灵感:学术界早有“视觉/潜空间压缩长上下文”的工作,这波更多是一个工程级演示+数据点,GitHub 上已经有人提醒要把前作引用全补齐。

顺带一提,落地门槛并不高到离谱:有人已经写了在小显卡/边缘设备上把它跑起来的过程记录;媒体也在说开源、可直接上 Hugging Face 和 GitHub 折腾那种,工程味挺足。

我脑子里还冒出几个特别具体的玩法,就先记在这儿:

  • 邮件/客服归档:把一年的来往全压成“视觉年鉴”,查历史靠检索+解码,成本小到可怕。
  • 法律/金融合规阅卷:未必逐字录入,先压缩做“线索定位”,真的要引用原文再精准解码对齐。
  • 多模态学习:把教材页“留版式”,学习时模型不仅记住文本,还能记住图表在第几栏第几行,定位快很多。
  • 超长推理管线:Agent 先用压缩记忆粗略规划,再按需把某几个段落解码回来细算,像人类“先想大纲,再填细节”。

我也留个小清单,看他们后续怎么卷:

  • 会不会给出更系统的评测(比如不同字体/语言/扫描噪声下的曲线,而不是只报一个 97%)?
  • 编码-解码两端能不能做成可控档位,比如“标题超清、正文模糊”的分层压缩?
  • 安全怎么做:压缩后再解码会不会更鼓励模型“脑补”?有没有“我不确定,别乱还原”的拒答策略?
  • 跟检索/向量库的协作:先压缩做全量索引,再按需精解,可能是最舒服的折中。

最后…我自己情绪稍微收一收:这事儿真的像把“上下文成本”拧到一个新的档位。它不是什么灵丹妙药(特别是高压缩比时的信息损失),但这个“把文本变成图,再从图里还原出文本”的回路,确实给 LLM 的记忆体系打开了侧门。挺像当年的 JPEG:不是最完美,但足够实用,生态就会围着它转起来。你说这是不是 AI 记忆系统的一个开端?我也不敢打包票…反正我现在已经想把我的工作日志先都“拍扁”一遍试试了,嗯。 ——对了,你要是也玩了,记得盯紧 10× 和 20× 两个档位的“翻车点”,有啥奇怪的还原(尤其是数字和专有名词)给我抓个包回来,我好奇得很。

体验地址:deepseekocr.app

-END-

我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html

最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领取,也可以链接我领取,微信:hls404