程序员老鬼

炸裂!Google发布 三款基于Gemma 模型的变体,直接把LLM玩出了新花样!

今天聊个很炸裂的事:Google发布了三款Gemma模型变体,分别是 MedGemma、SignGemma 和 DolphinGemma,各自盯准医疗、手语、动物语言三个垂直方向,直接把LLM玩出了新花样。

Image

这波更新我只能说:Google也太会玩了,真的封神了!!!

1)爆款之首:MedGemma,医疗AI直接起飞!

老实说,我第一眼看到MedGemma的时候,内心直接冒出一句话:“医疗AI这波直接起飞!”

为什么?看配置:

  • 4B 多模态模型:能同时处理图像+文本,支持 X 光、病理切片、眼底图像等。
  • 27B 文本模型:主打文本推理,比如问诊摘要、诊断建议、临床辅助决策,适合做智能问诊机器人那种。

Image而且都能在单块GPU上跑,门槛一下子就降了!

应用场景直接拉满:

  1. 🖼 医学图像分类:X 光、皮肤病图,拿来做基础分类分析,4B模型稳稳的;
  2. 🔍 图像解读+报告生成:比如自动写胸片报告,自动回答图像中异常区域,这个我试了下Demo,准确率比很多小厂高一截;
  3. 📖 临床文本推理:27B版本处理结构化诊断任务,一句话总结就是:临床大脑来了!

技术亮点:

  • 图像编码用的是 SigLIP,比CLIP还强,专为医疗优化过;
  • 预训练数据涵盖 X 光、皮肤科、眼科、病理全链条;
  • 支持LoRA 微调,还能嵌入代理系统,比如接到 Gemini 语音或FHIR结构化数据上,做真正“端到端”的智能诊疗。

说句实话,如果我是做医疗AI创业的,这模型出之前我还得自己训练个基础模型,现在?直接用MedGemma起飞,少走一年弯路!

2)SignGemma:AI终于懂“手语”了!

这款模型针对的是 ASL(美式手语),能直接把手语视频翻译成英文文本,支持多语种!

虽然目前还没完全开放,但光这个方向就已经让我眼前一亮了!

  • ✅ 针对听障社区的数字技术接入;
  • ✅ 多语言手语支持,搞不好未来还能支持中国手语;
  • ✅ 完全多模态输入(图像+时间序列),配合视频识别模型,有很大空间。

Google说今年晚些时候上线,建议感兴趣的同学可以关注 HuggingFace 或 Google Health 官网,早鸟注册搞不好能提前玩到。

3)最炸裂的脑洞:DolphinGemma,和海豚“聊天”不是梦!

看到这个模型我人都傻了...

DolphinGemma 是用来预测和生成海豚语言信号的模型!

你没看错,不是科幻,不是概念,是400M参数的音频到音频模型,可以模仿“海豚语言”的连续性预测模式。

三大研究目标:

  1. ✅ 模拟“签名哨音”“爆发脉冲”等自然声音,用AI去分类和生成;
  2. ✅ 基于上下文预测下一段海豚语,思路和“预测下一个词”一样;
  3. ✅ 与 Georgia Tech 合作开发 CHAT 系统:海豚模仿哨音 -> 请求物品 -> 研究人员收到“骨传导翻译”响应!

简直有点像海豚版“图灵测试”……

这一块属于纯研究,但如果你是做语言学、生物声学,甚至跨物种交互的,DolphinGemma 是个非常有价值的起点。

Google这波真狠!

  1. 多模态模型已经不稀奇了,但能做到在单GPU上跑,还能分图文精细化适配医疗图像/报告任务,这是实力的体现;
  2. 能做手语翻译的模型不多,Google如果能开放训练数据+模型权重,会大大提升 AI 无障碍辅助能力;
  3. 把语言模型用于海豚交流,这脑洞太炸,我只能说,未来AI不是在做人的工具,而是在成为一种“通用语言引擎”。

Google这波三连击:MedGemma、SignGemma、DolphinGemma,确实可以封神了!

我感觉这个方向一旦开了,接下来几年会出现很多垂类微调版本,比如:

  • 法律专用Gemma
  • 交通事故图文识别Gemma
  • 动物保护语音分析Gemma……

这才是LLM价值的真正落地,不是卷参数,而是卷应用。

感兴趣的朋友可以试试Demo地址,也欢迎有做垂类的朋友来聊聊看法,我们下篇再见!

图片

最后,我为大家打造了一份《AI副业资料》合集,发送关键字 gpt,完全免费。

同时,也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。

-END-

ok,今天先说到这,老规矩,给大家分享一份不错的副业资料,感兴趣的同学可以链接我,微信:hls404 找我领取。

以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。