alitrack

本地中文OCR实测:Gemma 4 vs Qwen3-VL 8B

不用云端API,M3 Ultra上跑两个开源模型,五类中文文档实测对比。

六月社区热传一篇文章 [Gemma 4 12B + TurboQuant + MTP + RAG = Better OCR & Self-Hosted],展示 Google 最新开源模型在本地做 OCR 的完整管道。标题诱人,但缺定量数据。

我在 M3 Ultra 上复现了这套管道,加了一个对照组 Qwen3-VL 8B——Qwen 最新一代视觉语言模型。五类中文文档,字符级 CER 对比。结论:Gemma 4 不适合中文 OCR,Qwen3-VL 8B 是甜点位。


● ● ●

测试设置

条件值
硬件Apple M3 Ultra, 256GB 统一内存
推理引擎mlx-vlm 0.6.3 (MLX backend)
量化均为 4-bit
Gemmamlx-community/gemma-4-12B-it-4bit (~7.5 GB)
Qwenmlx-community/Qwen3-VL-8B-Instruct-4bit (~5 GB)

测试集:经营报告、增值税发票、中英技术文档、框线表格、合同条款。覆盖数字密集、结构化数据、专有名词、排版复杂度四个维度。


● ● ●

结果

发票:Qwen 完美,Gemma 崩溃

Gemma 4 12B 处理发票时输出循环噪声 VaporVaporVapor...,完全不可用。同样的图片给 Qwen3-VL 8B,CER = 0.0%,一字不差。

增值税电子普通发票,发票代码 044002200111,发票号码 89012345,购买方杭州猿通信息科技有限责任公司,金额 ¥48,000.00,税率 6%,税额 ¥2,880.00,价税合计 ¥50,880.00。全部正确。

报告:Gemma 幻觉年份和术语

"2026年第二季度经营分析报告",Gemma 输出成了 "2026年第2季度业绩报告",数字金额部分 "同比增长 23.7%" 变成 "同期同比增长 32.7%"。Qwen3-VL 仅有一处轻微格式差异("第二季度" vs "第2季度"),CER 6.9%。

技术文档:Gemma 篡改专有名词

"TurboQuant RAG Pipeline 技术规范 v2.1",Gemma 写成 "技术树"。"MTP 多令牌预测加速" 整段被替换成不相关内容。Qwen3-VL 准确输出全部内容。

合同:Gemma 再次崩溃

"技术服务合同",Gemma 输出 "报考报考报考..." 死循环。合同这种带编号层级和中文法律用语的文档,彻底超出了 4-bit 12B 的能力边界。Qwen3-VL 完整输出。


● ● ●

汇总

文档类型Gemma 4 12B (4-bit)Qwen3-VL 8B (4-bit)
经营报告⚠️ 38.9% CER✅ 6.9% CER
增值税发票❌ 崩溃✅ 0.0% CER
技术文档⚠️ 70.4% CER✅ 准确
框线表格❌ 大面积幻觉✅ 内容全对
合同❌ 崩溃✅ 内容全对

Gemma 4 12B (4-bit) 不适合中文 OCR。发票和合同两类最常见的文档场景直接崩溃,剩余三类也存在数字幻觉和术语篡改。

Qwen3-VL 8B 精度 96.8%,接近 Qwen3.6 27B 的 100%,但模型只有 5GB,速度更快。


● ● ●

为什么 Qwen3-VL 8B 是甜点位

架构差异。Gemma 4 是"encoder-free"统一架构,理论上更轻量,但 4-bit 量化后 vision 能力退化严重,对结构化中文文档(发票框线、合同编号)直接 token 崩溃。Qwen3-VL 有专门的视觉编码器,VLM 原生支持多模态,4-bit 量化后 OCR 精度几乎无损。

模型规模匹配任务。8B VL 专为视觉理解设计,远比 12B 通用模型更擅长 OCR。参数多 ≠ 效果好——视觉任务需要视觉架构。

生产验证。在 MoDora 文档分析系统中实测 15 页学术论文:

Qwen3.6 27BQwen3-VL 8B
OCR 精度100%**96.8%**
单页速度~60s**~31s**
模型大小~17 GB**~5 GB**
提取粒度粗**细**(布局识别更好)

Qwen3-VL 8B 在精度只降 3.2% 的前提下,速度快了将近一倍,内存占用只有三分之一。而且因为专门为视觉任务训练,布局识别能力反而更强——能正确区分标题层级、页眉页脚、图表边框。


● ● ●

所以那篇文章的 "Better OCR" 是什么意思

文章展示的管道是 OCR → RAG 检索 → 上下文纠正。作者的逻辑不是"Gemma 4 OCR 强",而是用 RAG 把 Gemma 4 的 OCR 错误修正回来。把幻觉纠正到正确答案,确实能 "Better"——但这套管道换 Qwen3-VL 8B 同样有效,且 Qwen 的裸 OCR 起点高得多,RAG 只需要做微调而非纠错。


● ● ●

建议

如果你要在本地做中文文档 OCR:

  • Qwen3-VL 8B 是当前 Mac 上的最佳甜点位——5GB 显存、96.8% 精度、~30s/页
  • Qwen3.6 27B 追求极致精度(100%),代价是 17GB 和两倍时间
  • Gemma 4 12B 不建议用于中文 OCR 生产场景
  • 英文 OCR 可以考虑 Gemma 4,速度更快但精度仍然不如 Qwen3-VL

完整代码和测试集:https://github.com/alitrack/labs/tree/main/ocr-benchmark