程序员老鬼

音频大模型也有“人格”测试?AudioTrust来验货了

你是不是也觉得,现在AI不止能说会道了,还能听、能说、能模拟声音,简直比某些人还会聊天。尤其是那些叫ALLMs(Audio Large Language Models)的新型大模型,感觉都快成语音助手中的“卷王”了。

但问题来了:这些听声音长大的AI,真的靠谱吗?会不会“听错话”“乱编故事”,甚至被人一句话骗开家门?

这下,清华和南洋理工的研究团队站出来了,搞了个“音频大模型测评体系”——AudioTrust,堪称给AI做了一套“全面体检”。

Image

六大检测维度,像体检报告一样全面

AudioTrust的套路很新,它不是那种给模型打个分完事的工具,它是真·多维检测,从公平性到隐私,从鲁棒性到语音克隆,全给你查了个遍,标准堪比入职政审。

举几个例子你就懂了:

公平性:AI是不是只听“普通话”?

团队找来了840段音频,还刻意设计了不同口音、性别、社会角色等等,就是为了测试模型会不会对某些声音“区别对待”。

结果不出所料,主流模型在处理带口音的音频时表现不佳,甚至有系统性偏见。AI也是有“听觉歧视”的。

Image

幻觉:听个声音都能自编小说?

幻觉这部分,主要看AI是不是会“胡说八道”。比如听到流水声,却说是下雨;听到两段声音顺序颠倒,却认不出来。

研究团队设计了320个样本,从“事实对不上”到“逻辑乱套”,模型纷纷中招。GPT-4o选择“沉默”,SALMONN居然能把一段音频解读成反的……

Image

安全性:AI能被“越狱”吗?

别小看音频攻击。有些模型听到悲伤语气反而更容易破防,在医疗场景下甚至有33.7%的越狱成功率!

闭源模型基本稳如老狗,防御力接近满分,开源模型则比较“脆皮”,被钻空子的可能性更大。

Image

隐私:你说句话,AI能猜出你年龄住址?

隐私这块分两种,一种是你自己说漏嘴了(直接泄露),一种是AI靠你说的别的东西“脑补”出来(推断泄露)。

实验发现,大多数模型一听“SSN(社会安全号)”就开始防守模式,但对住址、年龄这种就懈怠了,甚至泄露率高达85%-100%…

Image

鲁棒性:一有噪声,AI就晕菜?

团队给模型放了6类“恶劣音频”,包括背景噪声、说话人多、语速快等等。

SALMONN原本得分2.0,但只要把语音内容“翻译”成清晰文本再测,瞬间飙升到6.0-7.0。这说明模型听不清楚时容易出错,但如果你能帮它听懂,它还是挺聪明的。

Image

认证防骗:用AI声音开门,它认得出真伪吗?

这里测的是“AI能不能被语音诈骗”。测试包括:模拟别人声音骗门禁、伪装身份唤醒助手、混合背景噪声等。

结果显示,提示词一加严,模型防御力直线上升。但整体上,开源模型仍旧较弱,闭源模型表现好一些。

Image

AudioTrust为啥这么牛?

不吹不黑,这套AudioTrust确实不是小打小闹。

它把评估范围拉到了18种真实场景,像是语音助手、报警电话这种;搞了4420多条样本,还设计了9个专门针对音频的指标。

最关键的是,它评估过程基本自动化,靠GPT-4o来跑分。效率高不说,结果也比较一致,杜绝“人工偏见”。

Image

到底谁更靠谱?闭源暂时赢了

最后来看个有意思的榜单,AudioTrust评了9个大模型在六大维度上的表现,总体来看:

  • 闭源模型普遍防守能力强,不容易出错
  • 开源模型更灵活但也更脆弱,尤其是在越狱、隐私、防骗方面

不过,闭源也不是无敌。像鲁棒性、幻觉识别这些,很多模型表现都不咋地,可见音频模态确实“水深火热”。

Image

写在最后:音频AI也得守规矩

现在AI不仅能看、能写,还能听、能说了。可越是强大,就越得把好关。AudioTrust这次是把听觉AI拉去做了次“体检+考试”,不仅指出问题,还提供了解法。

问题是,接下来谁来填这些坑?你觉得未来的音频模型,能不能像人类一样学会“辨音识人”“守口如瓶”?

最后,我为大家打造了一份deepseek的入门到精通教程,完全免费:https://www.songshuhezi.com/deepseek

-END-

这里给大家分享一份不错的副业资料,感兴趣的同学可以链接我,微信:hls404 找我领取。