MacBook Air 更值钱了: 谷歌凌晨突发 Gemma 4 12B
2026 年 6 月 4 日凌晨, Google DeepMind 没开发布会、没发推、没写博客, 把一个叫 Gemma 4 12B 的新模型悄悄推到了 Hugging Face 和自家的 LiteRT-LM 仓库里。 —— 但更反直觉的是: 这个 "Gemma 4 家族" 的新成员, 不是常规补丁, 是一颗精准卡时间的子弹。
一、凌晨四点的安静
我先讲一个画面。
凌晨四点, 旧金山。Demis Hassabis 没发推, 也没在 X 上扔几颗钻石 emoji (4 月 2 日 Gemma 4 首发时他扔过)。Hugging Face 上 google/gemma-4-12b-it 仓库的提交时间戳, 安静地往前走了一格。两个小时后, 国内科技博主睡眼惺忪发现, Gemma 4 家族 — 4 月发的 E2B (2.3B)、E4B (4.5B)、26B MoE、31B Dense 这四口子 — 突然多了第五个孩子, 一个长得不大不小的 12B, 专门挑了 "16GB 内存的笔记本就能跑" 这个尺寸。
这意味着, 入门款的 MacBook Air M5 (16GB 统一内存起步)、市面上随手一抓的 AI PC, 现在能跑动一个 Gemini 同源血统的多模态 Agent。
如果你不是搞 AI 的, 看到这就够了。这就像有一天你的 iPhone 突然能本地运行 Photoshop 全功能 — 不是云端, 不是订阅, 是装在你自己机器上、断网也能用的 Photoshop。
如果你是搞 AI 的, 你应该已经在想另一个问题: 为什么是 12B? 为什么是现在? 为什么连发布会都不开?
接下来我用三层视角拆给你看 — 它是什么 (能力)、为什么这时候来 (战略)、今晚你能拿它干什么 (实用)。看完这三层, 你就明白这一次为什么不普通。
二、16GB 突然不再是低配
要理解 12B 这个数字为什么重要, 你得先知道一件反直觉的事 —— 过去两年, 端侧大模型的天花板, 不是被算力卡住, 是被内存和带宽卡住的。
我打个比方。你把模型参数想象成一本厚厚的字典, 每次 AI 给你回答一个字, 它都要把整本字典从硬盘搬到 CPU 旁边的小桌子上、找一遍、再搬回去。模型越大, 字典越厚, 搬运越慢。决定速度的不是 CPU 多快, 是 "字典从书架搬到桌上有多快" —— 这个搬运速度就是内存带宽。
MacBook Air M5 的统一内存带宽差不多 500 GB/秒。一个 12B 模型半精度大概 24 GB, 4-bit 量化 (一种把字典字号缩小一半的压缩术, 让它能塞进更小的桌子) 后大概 7-8 GB。算下来理论上每秒能搬 60 多次, 实际打折也能跑 8-15 个字符每秒 —— 够你打字读完, 不至于让你睡着。
这就是为什么不是 8B、也不是 20B, 偏偏是 12B。下面这张图把我心里那条 "端侧能力曲线" 画给你看:
12B 落在 "笔记本甜点" 这个象限的右上角 — 再小, 它撑不起多步推理和工具调用; 再大, 16GB 内存就装不下了, 速度断崖式下跌到一秒钟蹦两三个字, 体验立刻崩盘。Gemma 4 家族原本在 4.5B 和 26B 之间是断档的 — 一个跑得动但太轻, 一个能力强但工作站才扛得住 — 12B 就是冲着这道缝补的。
我前面给出的那条 "8-15 字符每秒" 是个推测, 因为这个模型发布才几小时, 还没有第三方独立实测数据 — 如果一两周后社区跑出来速度只有 3-5 字符每秒, 那这篇文章的核心 hook 就破了, 我会回来更新。这点先把丑话讲在前面。
三、把"看"和"说"塞进一个大脑
接下来要讲一个会被大多数评测漏掉、但其实是这次最值得讲的技术细节: encoder-free 统一架构。
我又打个比方。上一代 Gemma 3 12B 想看懂一张图, 内部要安排两个员工: 一个翻译官 (vision encoder, 上一代用的是 SigLIP, 单独占 400 MB - 1.5 GB 内存) 专门负责把图片翻译成 AI 听得懂的语言, 一个真正的大脑负责理解和回答。两个员工各占地方, 还得有交接环节, 慢、占内存、还容易在交接时丢信息。
Gemma 4 12B 这次把翻译官直接裁了 —— 让大脑自己学会看图。具体怎么做的? 就是把图片切成一小块一小块, 经过一层很轻的线性变换 (大致就是几次矩阵乘法 + 位置编码), 直接当成 "文字" 投到和文本一样的语义空间, 让大脑用同一套机制处理。这个改动对端侧的意义是巨大的: 12B 模型权重一次性进内存, 不再有翻译官单独占用 1-2GB 显存, 16GB 笔记本才有空间留给上下文 (KV cache)。
更反直觉的是结果。Gemma 4 12B 在 DocVQA (文档视觉问答, 94.9 分) 和 InfoVQA (信息图表理解, 88.4 分) 这两个看图说话的硬骨头基准上, 居然反超了它的"哥哥" 26B MoE 模型 (官方公布的 26B 这两项数据在 92-93 分区间)。一个 12B 在文档理解上打过自家 26B —— 这就是"统一架构"在某些任务上的红利。
但工程师视角不能只说好话。这里有个已知的不放心: 翻译官没了, 看图能力靠大脑自己学。在常规文档识别上, 大脑学得很好; 但在医学影像、卫星图、密集小字发票这类需要极细颗粒度视觉处理的任务上, 没有专用翻译官, 12B 的视觉能力可能不如旧架构 + 外挂强翻译官的组合。这个隐患得等社区跑出来才知道。如果你打算用 Gemma 4 12B 做发票识别 OCR 或者医学图像辅助, 别一上来就 all in, 先小样本测一下。
四、醉翁之意不在酒
OK, 技术讲完了。现在切到一个完全不同的角度 —— 为什么是 6 月 4 日这一天, 为什么是这种"凌晨静默上线"的姿态?
把日历翻出来看一眼就懂了。6 月 8 日, 也就是 Gemma 4 12B 发布后第 4 天, 是 Apple WWDC 2026 开幕日。彭博社 5 月底的报道里已经放风, Apple 这次会重点讲 "端侧 AI", 而且 — 注意这个细节 — Apple 私下里正在把 Google 的 Gemini 模型轻量化, 嵌进 Siri。
这就是说, Apple 一边在自己的舞台上准备讲端侧 AI 故事, 一边偷偷用着 Google 的模型。Google 看在眼里, 干脆赶在 Apple 上台前 4 天, 把自己端侧最厉害的中尺寸模型 + 全套开源 Apache 2.0 + 跨平台推理框架 (litert-lm) 直接扔到桌面上。这不是开发者随手补的一个尺寸, 这是一记精准的预防针 —— 你 Apple 再怎么讲端侧故事, 也绕不开 "我用的还是 Google 的同源技术" 这个事实。
把时间拉长再看一眼整张牌桌:
把这张时间线读完, 你会发现一个不太被外界注意的事实 —— 2025 年 4 月 Llama 4 翻车后, 美国开源大模型阵营实际上一直缺一面真旗。Meta 转闭源去做 Avocado, OpenAI 嘴上说要开源 GPT-mini 但拖了一年没动, 阿里、深度求索、月之暗面在地球的另一个时区猛攻。这一年里, 美国开源端正经在做事的, 只剩 Google 一家。
12B 这次发布, 表面是产品行为, 实质是Google 在抢三件事的话语权:
抢端侧硬件入口 —— 让 AI PC、Mac 出货量(每年几亿台) 默认带的是 Google 的模型, 而不是 Apple 自研或者高通 NPU 的独占协议 抢推理框架的协议层 —— litert-lm 这次同步升级, 加了 OpenAI API 兼容。这意味着任何用 OpenAI 协议写的客户端 (Continue、Aider、Open WebUI、各种 LangChain 应用) 都能无缝切到本地 Gemma 4 上。这是奔着 Ollama 那个 "事实标准" 的位置去的 — Ollama 是社区项目, Google 这次是想立自己的、跟硬件深度优化的、跟 Gemini 同源的官方协议 抢开发者心智 —— Apache 2.0 这件事别小看。上一代 Gemma 1/2/3 用的是 Google 自定义协议, 大企业法务部门看了就摇头。这一代彻底切到 OSI 认可的 Apache 2.0, 商用、修改、再分发都没限制, 金融、医疗、政府这些 "数据绝对不出本地" 的市场, 终于有一个敢直接拉进生产环境的开源多模态模型
这三件事都打中了, 12B 是导火索, litert-lm 才是真武器。
当然, 这一切都有前提。如果 Google 下一代 Gemma 5 突然撤回 Apache 2.0、塞进 "竞争限制条款" (Meta 当年 Llama 3.1 干过), 信誉立刻清零; 如果 OpenAI 真的开源 GPT-5 Nano, Google 的端侧稀缺位坍塌; 如果 6 月 8 日 Apple 在 WWDC 上反手把 Foundation Model 也开源 (虽然概率极低), 牌局重新洗。 我的判断有效期, 给 12 到 18 个月。
五、那我现在能拿它干嘛?
讲到这, 你可能已经在想 —— 那我现在能拿它干嘛?
如果你有一台 16GB 起步的 MacBook (M1 以上) 或者 16GB 的 AI PC, 装好 Ollama 后, 一条命令就能拉起来。 4-bit 量化版本占盘 7-8 GB, 剩下的内存留给上下文。
下面是我能想到的、对你确实有用的几个场景:
本地知识库问答: 把你的几万份 PDF、扫描件、Notion 笔记喂进去, 数据不出本地。DocVQA 94.9 分的视觉能力, 处理扫描合同特别在行 离线 Agent: 在飞机上、在没网的会议室, 用本地 Agent 自动调用工具、抓内网数据 隐私敏感场景: 医疗病历、法律合同、内部财务, 不上传任何云端 轻量编程助手: Codeforces ELO 估计在 1500 左右, 写写 Python 脚本、SQL 查询、配置文件够用 (但写大型架构请上 GPT-5 或 Claude) 教育/研究: 单张 RTX 4090 全速跑, 高校实验室的科研 baseline
什么场景不要用 12B?
生产环境高并发: 12B 单卡推理一秒钟也就 8-15 个字, 一张 4090 同时撑五个用户就开始排队 需要 100K+ 上下文的长文档分析: 16GB 笔记本上, 上下文超过 32K 就开始爆内存 强中文场景: 这块 Qwen 3 系列仍然是最优, Gemma 4 12B 的中文能力够用但不顶尖 企业级法务/医疗的关键决策: 模型再强也只是辅助, 终审还得人来
补充一句给小白的提醒 —— Gemma 4 12B 的训练知识截止到 2025 年 1 月。问它这之后发生的事, 它要么不知道、要么乱编。这种需要最新信息的问题, 要接 web search tools 联网检索后再问。
六、接下来
你 MacBook Air 里多了一个 Gemini 血统的大脑, 这件事的意义, 6 月 8 号苹果的舞台上, 我们会听到第一个回声。