Python技术迷

LiteRT-LM:谷歌把端侧大模型这条路,直接铺到 iPhone 和树莓派上了

这两天我回头看了下 Gemma 4,最戳人的其实不是参数,也不是榜单。

是它已经能直接在 iPhone 上本地跑起来了。 不走云,不等接口,模型就在设备里推理,这个味道一下就不一样了。

再往下看,谷歌其实不只是放了个 Gemma 4。 它还顺手把一套端侧底座一起摆出来了,名字叫 LiteRT-LM。

这东西说白了,就是专门给“模型上设备”准备的。 Android、iOS、桌面、Web,连树莓派都能接住,不太像那种只在 demo 里好看的项目。

我比较在意的一点,是它不只跑文本。

Image

视觉、音频这些多模态输入也能接,函数调用也给了。 看到这里基本就明白了,谷歌想推的不是“端上聊聊天”,而是让你直接在本地拼智能体工作流。

这就很关键。

很多端侧项目以前卡就卡在这儿: 模型能跑,但一到真实任务,调工具、接输入、串流程,全得自己补。 LiteRT-LM 相当于把这层脏活先铺平了一点。

还有个细节挺实用。 它兼容的不只是 Gemma,自家模型之外,Llama、Qwen 这些主流模型也能接。 而且还给了不用写代码的命令行工具,终端里就能直接把模型拉起来试。

Image

这比“看 README 想象自己能用”强多了。 你真能很快知道,这玩意到底离自己的项目有多远。

另外,LiteRT 这套底座不是实验室新玩具。 它已经在 Chrome、Pixel Watch 这些真实产品里跑过大规模场景了。 开源项目最怕一眼新,第二眼虚,这点反而让人放心不少。

当然,端侧大模型这件事,后面肯定还是要继续看性能、功耗和适配成本。 但至少谷歌这次没只讲愿景,而是把路都修到设备门口了。

GitHub地址:google-ai-edge/LiteRT-LM