本地中文OCR实测:Gemma 4 vs Qwen3-VL 8B
不用云端API,M3 Ultra上跑两个开源模型,五类中文文档实测对比。
六月社区热传一篇文章 [Gemma 4 12B + TurboQuant + MTP + RAG = Better OCR & Self-Hosted],展示 Google 最新开源模型在本地做 OCR 的完整管道。标题诱人,但缺定量数据。
我在 M3 Ultra 上复现了这套管道,加了一个对照组 Qwen3-VL 8B——Qwen 最新一代视觉语言模型。五类中文文档,字符级 CER 对比。结论:Gemma 4 不适合中文 OCR,Qwen3-VL 8B 是甜点位。
● ● ●
测试设置
| 条件 | 值 |
|---|---|
| 硬件 | Apple M3 Ultra, 256GB 统一内存 |
| 推理引擎 | mlx-vlm 0.6.3 (MLX backend) |
| 量化 | 均为 4-bit |
| Gemma | mlx-community/gemma-4-12B-it-4bit (~7.5 GB) |
| Qwen | mlx-community/Qwen3-VL-8B-Instruct-4bit (~5 GB) |
测试集:经营报告、增值税发票、中英技术文档、框线表格、合同条款。覆盖数字密集、结构化数据、专有名词、排版复杂度四个维度。
● ● ●
结果
发票:Qwen 完美,Gemma 崩溃
Gemma 4 12B 处理发票时输出循环噪声 VaporVaporVapor...,完全不可用。同样的图片给 Qwen3-VL 8B,CER = 0.0%,一字不差。
增值税电子普通发票,发票代码 044002200111,发票号码 89012345,购买方杭州猿通信息科技有限责任公司,金额 ¥48,000.00,税率 6%,税额 ¥2,880.00,价税合计 ¥50,880.00。全部正确。
报告:Gemma 幻觉年份和术语
"2026年第二季度经营分析报告",Gemma 输出成了 "2026年第2季度业绩报告",数字金额部分 "同比增长 23.7%" 变成 "同期同比增长 32.7%"。Qwen3-VL 仅有一处轻微格式差异("第二季度" vs "第2季度"),CER 6.9%。
技术文档:Gemma 篡改专有名词
"TurboQuant RAG Pipeline 技术规范 v2.1",Gemma 写成 "技术树"。"MTP 多令牌预测加速" 整段被替换成不相关内容。Qwen3-VL 准确输出全部内容。
合同:Gemma 再次崩溃
"技术服务合同",Gemma 输出 "报考报考报考..." 死循环。合同这种带编号层级和中文法律用语的文档,彻底超出了 4-bit 12B 的能力边界。Qwen3-VL 完整输出。
● ● ●
汇总
| 文档类型 | Gemma 4 12B (4-bit) | Qwen3-VL 8B (4-bit) |
|---|---|---|
| 经营报告 | ⚠️ 38.9% CER | ✅ 6.9% CER |
| 增值税发票 | ❌ 崩溃 | ✅ 0.0% CER |
| 技术文档 | ⚠️ 70.4% CER | ✅ 准确 |
| 框线表格 | ❌ 大面积幻觉 | ✅ 内容全对 |
| 合同 | ❌ 崩溃 | ✅ 内容全对 |
Gemma 4 12B (4-bit) 不适合中文 OCR。发票和合同两类最常见的文档场景直接崩溃,剩余三类也存在数字幻觉和术语篡改。
Qwen3-VL 8B 精度 96.8%,接近 Qwen3.6 27B 的 100%,但模型只有 5GB,速度更快。
● ● ●
为什么 Qwen3-VL 8B 是甜点位
架构差异。Gemma 4 是"encoder-free"统一架构,理论上更轻量,但 4-bit 量化后 vision 能力退化严重,对结构化中文文档(发票框线、合同编号)直接 token 崩溃。Qwen3-VL 有专门的视觉编码器,VLM 原生支持多模态,4-bit 量化后 OCR 精度几乎无损。
模型规模匹配任务。8B VL 专为视觉理解设计,远比 12B 通用模型更擅长 OCR。参数多 ≠ 效果好——视觉任务需要视觉架构。
生产验证。在 MoDora 文档分析系统中实测 15 页学术论文:
| Qwen3.6 27B | Qwen3-VL 8B | |
|---|---|---|
| OCR 精度 | 100% | **96.8%** |
| 单页速度 | ~60s | **~31s** |
| 模型大小 | ~17 GB | **~5 GB** |
| 提取粒度 | 粗 | **细**(布局识别更好) |
Qwen3-VL 8B 在精度只降 3.2% 的前提下,速度快了将近一倍,内存占用只有三分之一。而且因为专门为视觉任务训练,布局识别能力反而更强——能正确区分标题层级、页眉页脚、图表边框。
● ● ●
所以那篇文章的 "Better OCR" 是什么意思
文章展示的管道是 OCR → RAG 检索 → 上下文纠正。作者的逻辑不是"Gemma 4 OCR 强",而是用 RAG 把 Gemma 4 的 OCR 错误修正回来。把幻觉纠正到正确答案,确实能 "Better"——但这套管道换 Qwen3-VL 8B 同样有效,且 Qwen 的裸 OCR 起点高得多,RAG 只需要做微调而非纠错。
● ● ●
建议
如果你要在本地做中文文档 OCR:
- Qwen3-VL 8B 是当前 Mac 上的最佳甜点位——5GB 显存、96.8% 精度、~30s/页
- Qwen3.6 27B 追求极致精度(100%),代价是 17GB 和两倍时间
- Gemma 4 12B 不建议用于中文 OCR 生产场景
- 英文 OCR 可以考虑 Gemma 4,速度更快但精度仍然不如 Qwen3-VL
完整代码和测试集:https://github.com/alitrack/labs/tree/main/ocr-benchmark