看到DeepSeek- OCR模型后,Andrej Karpathy提出了一个很激进的想法:所有LLM的输入都应该是图像,包括纯文本。
看到DeepSeek- OCR模型后,Andrej Karpathy提出了一个很激进的想法:所有LLM的输入都应该是图像,包括纯文本。
什么意思?
传统的大语言模型:文本 → tokenizer → LLM → 输出
很无聊
Andrej的vision:文本 → 渲染成图片 → LLM → 输出
即使你要输入的就是纯文本,也先把它渲染成图片,再喂给模型。
这就好玩了,这么做有什么好处?
他给了4个理由:
1. 信息压缩更高效
这正是DeepSeek-OCR证明的。一页文档,传统方式可能需要2000个text tokens,用vision tokens只要64个。压缩率30倍。
文本tokens很浪费,图像tokens更密集。
2. 更通用
Text tokens只能表达文字。但现实世界的信息不只是文字:
- 粗体、斜体
- 彩色文字
- 表格、图表
- 任意图像
全部渲染成图像输入,模型天然就能处理这些。
3. 可以用双向注意力
这是技术细节。传统的text-to-text是自回归的(从左到右)。图像输入可以用双向注意力,看到全局信息,更强大。
4. 删除tokenizer(重点!)
Andrej很讨厌tokenizer。
他的吐槽:
- Tokenizer是一个丑陋的、独立的、非端到端的阶段
- 它继承了Unicode、字节编码的所有历史包袱
- 有安全风险(如continuation bytes攻击)
- 两个看起来一样的字符,在tokenizer眼里可能完全不同
- 这个emoji在tokenizer里只是一个奇怪的token,不是一张真正的笑脸图片
他希望tokenizer消失。
他的vision是什么
- 输入:全部是图像(即使原本是文本)
- 输出:还是文本(因为输出像素不现实)
OCR只是vision→text任务之一。很多text→text任务都可以变成vision→text。