Kimi-Audio 总体性能排名第一,几乎没有短板
在AI圈里,最近有个“大六边形战士”横空出世——Kimi-Audio。啥意思?简单来说,就是一个能打多边形战士:语音识别、音频理解、音频转文本、语音对话……这些任务它全都能搞,还都搞得不错。这次,Kimi 团队直接把模型开源,甚至连评估工具包也一起打包上线,摆明了要和同行们掰掰腕子。
我平时对音频处理需求不多,但有时候也会想:有没有一个模型能一把梭,啥都能做?搞个语音识别得找一个,做语音对话又得另找,来回切换工具太烦了。这回 Kimi-Audio 上线,我不禁心里嘀咕:这家伙真有这么全能吗?性能真能秒杀同行?抱着试试看不吃亏的心态,研究了一圈,发现这模型还真有点东西,尤其是多任务基准测试成绩一出,确实让人眼前一亮。
架构亮点:三大件,稳得一批
Kimi-Audio 背后的架构,设计得挺有意思,不是那种一招鲜、吃遍天的思路,而是三大件齐上阵——音频分词器、音频大模型、音频去分词器。听起来有点复杂?其实原理简单。
先是 音频分词器(Audio Tokenizer),负责把音频变成一串离散的语义 token,帧率大概在 12.5Hz,还能提取声学向量,保证细节不丢失。简单点说,就是既压缩了信息量,又保留了声音的丰富性,堪比手工打磨的好音质。
接着,核心的 音频大模型(Audio LLM) 上场,这个模型一肩挑,负责生成语义 token 和文本 token,能处理多模态输入(音频和文本),然后在后端分两个输出,一个对音频,一个对文本,啥任务都能接。背后是共享的 Transformer 层架构,稳。
最后是 音频去分词器(Audio Detokenizer),用流匹配的方法把模型生成的离散 token 重新变成连贯的音频波形,输出的语音又自然又带感。
这种设计的好处就是:一个模型搞定一堆活,语音识别、理解、生成,统统不在话下。看得我心里直痒痒,真想赶紧跑个 demo 玩玩。
训练套路:1300 万小时音频喂出来的狠活
咱再看看它的训练数据和方法。为了让 Kimi-Audio 成为真正的“六边形战士”,训练团队可是下了血本,预训练阶段直接用了 1300 万小时 的音频数据,啥类型都有——多语言、音乐、环境音,长音频、短音频通通齐活。而且人家不是随便糊弄几条数据,是有一整套自动流水线净化、切分、标注,搞成高质量的音频-文本对,保证数据靠谱。
预训练完还不算,后面又搞了个 监督微调(SFT),数据涵盖了音频理解、语音对话、音频转文本等任务,进一步提升模型的指令跟随和生成能力。训练方式也有讲究,专门设计了三种预训练任务:光文本、光音频,还有音频到文本的模态转换,弥合两个模态之间的差距,别说,思路确实新。
中间训练有个小细节挺有意思,他们把每个任务指令都做了音频版本(用 Kimi-TTS 生成的),训练的时候随机选用文本或音频的指令,这样模型不管听到啥指令都能应对自如,听觉、阅读双修,实力倍增。
实测表现:十多项基准测试,拿捏同行
说了这么多,咱看看真刀真枪的数据表现。在十多个音频基准测试里,Kimi-Audio 基本都拿了第一,这不是我吹,是实打实的成绩。
语音识别(ASR)表现
这个领域是硬仗,Kimi-Audio 直接在 LibriSpeech 上把 WER(词错误率)干到了 1.28%,比那些一线大模型低了不少。包括普通话的 AISHELL-1(0.60%) 和 AISHELL-2(2.56%),也全是第一,横扫。
音频理解能力
在音乐、环境音、语音情感识别这些任务里,Kimi-Audio 也一马当先。像 MMAU 测试里的声音类别理解(73.27 分)和语音类别(60.66 分),还有 VocalSound 几乎满分的 94.85%,全都领先同行,妥妥的实力派。
音频到文本聊天能力
这块看似冷门,但对做智能对话、助理的人来说挺重要。Kimi-Audio 在 OpenAudioBench 和 VoiceBench 上的表现几乎横扫所有子任务,特别是在推理、问答能力上,吊打同行,比如 OpenBookQA 拿了 83.52%,真不是盖的。
语音对话能力
最让我惊讶的是语音对话部分的评分。在和 GPT-4o、GLM-4-Voice 这些大佬一块评测时,Kimi-Audio 除了口音控制稍逊一点,情感、同理心、速度控制等维度都拿了高分,平均分 3.90,比绝大多数模型都要强,跟 GPT-4o 也就差个 0.16 分,真是悄悄打进了第一梯队。
我怎么看?
看完整体评测,我得说,Kimi-Audio 真不是个普通的模型。这么多任务能全场最佳,而且还开源,确实是音频领域的一股清流。对我这种不常接触音频处理的人来说,可能一开始觉得没啥用,但一想到以后做点语音转文本、搞个语音助理啥的,有这样一个通用模型,简直省事儿太多,不用到处找工具,啥都能整合进来,香啊。
唯一的小建议是,这么全能的模型,入门门槛有点高,毕竟多模态训练、评测一堆参数,初学者估计得花点时间慢慢摸索。不过要是能出点简单易用的demo,那就更方便了,期待后续搞点更接地气的应用出来。
开源地址就放这儿了,感兴趣的赶紧冲一波试试:
https://github.com/MoonshotAI/Kimi-Audio
也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。
-END-
以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。