首个音频全模态模型评测框架开源!热门模型一键复现
如今,音频模型已经成为重要的生产力工具,对研究者而言,如何提高音频模型的性能和效果是重中之重。
在音频模型快速更新的背景下,研究者普遍面临以下几类问题,导致研发效率低下:
第一,论文与公开报告中的指标往往难以在本地稳定复现,复现流程依赖零散脚本、隐藏参数与复杂前后处理,导致“结果对不上、过程跑不通”。
第二,不同模型对运行环境的要求差异巨大(框架版本、CUDA 依赖、第三方库互斥等),在同一台机器上并行评测多个模型时极易陷入依赖冲突与环境反复重装的问题。
第三,除通用语音大模型外,TTS、ASR、Codec 等专有音频模型在社区与产业侧的关注度持续提升、热门模型与方案快速涌现,围绕这些模型的“可复现评测”需求也显著增长。
基于上述痛点,清华、OpenBMB、面壁智能联合发布 UltraEval-Audio v1.1.0 版本。
在原有的“一键测评”音频模型的基础上,重点新增热门音频模型的一键复现能力,扩展对 TTS/ASR/Codec 等专业模型与专项评测的支持,并引入隔离推理运行机制,以在工程层面降低复现门槛、提升评测流程的可控性与可迁移性。
值得一提的是,作为 MiniCPM-o 2.6、VoxCPM 等高影响力音频、全模态模型的御用测评工具,UltraEval-Audio v1.1.0 开源将帮助研究者显著提高音频模型的研发效率。
UltraEval-Audio:
行业首个全模态、语音大模型评测框架
UltraEval-Audio 是由清华 NLP 实验室、OpenBMB 与面壁智能联合推出的面向音频模型的测评框架。
它不仅为音频大模型领域确立了一套完备的评测方法论,更将这套体系具象化为开箱即用的工程框架,完善了音频评测体系和框架,增加了系统化的评测体系定义(如表1)。
然而,随着开源社区的爆发式增长,必须要承认的是:“评测”的前提是“复现”,而“复现”的成本正在日益成为阻碍模型落地的一道高墙。
基于此,UltraEval-Audio v1.1.0 从“定义标准”向“工程赋能”迈出了关键一步。新版本不再仅仅关注模型最终的评测结果,更致力于解决模型从代码库到评测流水线之间的“最后一公里”难题。
UltraEval-Audio v1.1.0评测框架:https://github.com/OpenBMB/UltraEval-Audio/tree/main/replication
UltraEval-Audio v1.1.0论文《UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models》:https://github.com/OpenBMB/UltraEval-Audio/blob/main/assets/UltraEval_Audio__A_Unified_Framework_for_Comprehensive_Evaluation_of_Audio_Large_Language_Models.pdf
热门模型 “一键复现”
快速对齐论文效果
在音频领域,复现的工程难度往往不亚于算法创新。
官方代码仓库中复杂的依赖、语焉不详的预处理逻辑、以及隐藏在各个脚本角落里的 temperature 或 sample_rate 参数,常让复现结果变成一场“玄学”实验。
为了打破这一困局,UltraEval-Audio v1.1.0 针对 VoxCPM、MiniCPM o2.6、CosyVoice3、GLM-TTS、Kimi-Audio、Qwen3-Omni 等社区顶流模型进行了深度适配与官方复现。
技术团队不仅仅是“调通代码”,而是对这些模型的推理链路进行了 白盒化重构:
标准化的流水线封装: 深入拆解了各模型官方仓库中零散的预处理脚本(如音频重采样、特征提取)与后处理逻辑(Post-Process),将其标准化封装进框架的
Prompt Management和Model Deployment模块中。无论是音频 Tokenizer 的特殊处理,还是 Chat Template 的精细对齐,UltraEval-Audio 都已并在底层处理完毕。所见即所得的复现基准: 在
replication/文档目录下提供了对齐官方效果的 Benchmark 评测报告与一键复现脚本(详见 GitHub 链接)。可以保证研究者在只需执行一行命令的情况下,获得与论文报告高度一致的指标表现。
GitHub 链接:https://github.com/OpenBMB/UltraEval-Audio/tree/main/replication
从现在起,研究者无需再花费数小时去调试环境或猜测隐藏参数,真正实现从“下载模型”到“产出权威评测结果”的无缝衔接。
隔离推理运行机制
彻底解决依赖冲突
在音频大模型的评测实践中,研究者常面临一个棘手悖论:试图用一个 Python 环境兼容所有模型几乎是“不可能的”。
老牌模型可能依赖 CUDA 11.x 和旧版 torchaudio,而新锐模型则强制要求 PyTorch 2.x 和最新的 Flash-Attention。
这种“版本互斥”导致研究者在并行评测多个模型时,不得不反复重装驱动或手动切换 Conda 环境,这不仅是工程灾难,更严重拖慢了迭代效率。
为此,UltraEval-Audio v1.1.0 重构了底层架构,全新引入隔离推理运行机制。
如架构图所示,这一机制实现了评测控制流与模型计算流的物理级解耦:
全自动化的环境沙盒 (Environment Sandbox): 框架不再强制模型推理运行在主进程环境中。相反,它能够根据配置文件自动识别并调用每个模型专属的 Python 虚拟环境。这意味着,你可以同时在一台服务器上评测依赖完全冲突的两个模型,系统会自动为它们划分独立的运行“沙盒”,互不侵扰。
高鲁棒性的 IPC 交互 (IPC Communication): 模型加载与推理进程被封装在隔离环境中,仅通过轻量级、高吞吐的 IPC(进程间通信)协议与评测主进程交换数据。
解耦优势: 这种设计使得评测主程序(Evaluator)极其轻量且稳定,无论下层模型的推理脚本如何修改、依赖库如何复杂,都不会影响上层评测逻辑的稳定性。
故障隔离:即使某个模型的推理进程因环境问题崩溃,也不会导致整个评测任务中断。
通过 Isolated 机制,UltraEval-Audio 真正实现了“配置一次,到处运行”,让评测工作回归对模型本质的关注,而非无休止的环境调试。
评测范围扩大
覆盖 TTS、ASR 与 Codec 专有模型
除通用语音大模型外,团队观察到 TTS(语音合成)、ASR(语音识别)与 Codec(音频编解码) 等专有模型在社区与产业侧的关注度正在持续攀升。
在 v1.1.0 中,他们打破了“仅评测通用音频大模型”的边界,将评测能力下探至 TTS(语音合成)、ASR(语音识别)与 Audio Codec(音频编解码) 三大专有领域,打造全链路的音频评测基础设施。
TTS 语音合成:聚焦任务多样性针对 TTS 模型,并集成了权威数据集 Seed-TTS-Eval,CV3-Eval, Long-TTS,支持 VC 音色克隆与长语音合成等典型任务场景,为模型在合成文本准确性,音色模仿,声学自然上的表现提供多维度定量基准。
ASR 语音识别:多场景覆盖 针对 ASR 模型,支持了包括 LibriSpeech、Common Voice、AISHELL-1、WenetSpeech 在内的十余个主流数据集。评测范围横跨清晰朗读(AISHELL-1)到复杂真实环境(WenetSpeech),从单一语种(LibriSpeech)到多语种(MLS、FLEURS),确保评测结果具有广泛的鲁棒性参考价值。
Audio Codec 音频编解码:构建三维评测体系 Codec 作为音频基础模型的底层组件,其重建质量至关重要。针对现有评测标准不统一的痛点,并构建了语义、音色、声学的“三维评测体系”,为模型优化提供精细的诊断工具:
语义: 采用 Whisper-large-v3 与 Paraformer-zh 计算 WER(词错率),确保内容不丢失;
音色: 基于 WavLM-large 提取声纹特征并计算余弦相似度,衡量音色保真度;
声学: 结合 UTMOS(自然度)与 DNSMOS(抗噪/音质),客观量化听感体验。
技术团队提供了详细的测评及复现指南,帮助研究者快速上手:
立即开启评测:https://github.com/OpenBMB/UltraEval-Audio
复现指南:https://github.com/OpenBMB/UltraEval-Audio/tree/main/replication
谁是你最关心的模型?
虽然目前已经支持了 VoxCPM、 MiniCPM o2.6、CosyVoice3、Qwen3-Omni 等模型,但语音 AI 的星辰大海远不止于此。
你是否也有过“看论文心动,看复现头痛”的经历?你最想在 UltraEval-Audio 中看到哪个“明星模型”的一键复现?其技术团队将优先复现得票最高的模型,让真相不再迟到!
GitHub 链接:https://github.com/OpenBMB/UltraEval-Audio/issues/41
今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!