程序员老鬼

阿里开源 Fun-Audio-Chat,会共情的语音大模型来了。。。

今天刷到一个事,有点意思:阿里又扔了个开源语音大模型,名字叫 Fun-Audio-Chat,是通义团队的新一代端到端语音交互模型,直接对标 GPT-4o、Gemini 那一挂的语音能力,而且一上来就开源了权重和代码。

Image

它的核心卖点就俩:延迟低、还能听情绪。以前那种语音→文字→大模型→语音的老流水线,你肯定见过,说一句话要等半天它才慢悠悠回你一段机械音。Fun-Audio-Chat 走的是 S2S 架构,你开口它就一边听一边想,一边开始说,人类视角感受就是:终于不像机器人,而是个人在跟你唠嗑。

它里面有个挺骚的设计,叫双分辨率:底层用 5Hz 的低帧率跑大部分计算,上面再挂一个 25Hz 的精细语音头负责细节和情绪,这一套下来,算力能省将近一半,但语音质量和情绪表达还能拉满,多项语音 benchmark 里都是 8B 量级的第一梯队。

功能上大概可以粗暴理解成四件事:你说话,它能帮你总结语音内容;你下口头指令,它能走工具链路帮你完成任务;它能听出你是在着急还是委屈,回复的语气也会跟着变;最后,它回你的也是自然语音,而不是让你盯着一堆字。

对开发者比较爽的是,它是真·开源:Fun-Audio-Chat-8B 的模型、训练 / 推理代码、技术报告,都摆在 GitHub 和 HuggingFace 上,Apache 2.0 协议,想接到车机、耳机、机器人、智能客服,都可以自己玩,不再完全被闭源语音大模型锁死。

当然,现在它也不是万能的,极端噪音、多轮长对话、复杂任务编排,估计还得靠别的系统兜底。但方向很清楚了:语音这条赛道开始从「谁听得最清楚」变成「谁更像一个真正在跟你说话的人」。

Image

技术细节和测评成绩,官方仓库和技术报告里都有,有兴趣可以自己去扒一扒。

反正站在普通用户视角,我只在乎一件事:以后跟 AI 说话,能不能少一点“您好,请问需要什么服务”,多一点「你今天听起来有点累,要不要先歇一会儿」这种真正有点人味的回应。

Image

阿里这次把 Fun-Audio-Chat 整套开源扔出来,大概就是在说:语音交互这场仗,开源阵营也要认真下场了。

-END-

我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html

最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领,也可以链接我微信:hls404