美团开源“语音克隆”模型,1B/3.5B双选,超自然复刻你的声音
如果说波形潜空间解决的是“在哪个空间里建模”的问题,那美团LongCat团队在推理阶段做的两处改进,则是要优化“生成路径”和“质量纯度”。
他们首先发现了一个在流匹配TTS里长期存在但未被关注的问题:训练和推理的不匹配。在标准CFM训练里,模型只在掩码区域算损失,而作为条件的音频提示区域是不参与优化的。
但到了推理阶段,这些提示区域却会随着扩散的常微分方程自由演化,导致它们的分布轨迹偏离了训练时的约束,最终结果就是说话人音色漂移、稳定性下降。
他们为此提了一个双重约束机制。一是在每一步推理迭代里,强制把提示区域的潜变量强制重置成理论真值,让提示区域的演化轨迹和训练时完全对齐,从而给生成部分提供一个干净、稳定的声学条件。
二是在计算无条件速度场的时候,直接把提示区域的潜变量移除,算出真正意义上的无条件速度,避免信息泄漏。
另一个改进是针对无分类器引导(CFG)的。传统扩散模型普遍用CFG来放大条件预测和无条件预测的差异,从而提升生成质量,但副作用是引导强度越大,频谱就越容易“过饱和”,音质变差,听感也不自然。
美团LongCat团队提出的自适应投影引导(APG)换了个思路。引导信号里真正有益的部分和导致劣化的部分,在几何上是正交的。APG把引导信号分解成平行和正交两个分量,只保留正交的那部分(有益部分),同时抑制平行分量(劣化部分),这样既提升了自然度,又避免了音质损失。
这两项推理优化加在一起,让生成语音在保持高说话人相似度的同时,自然度和声学质量都明显更好。
在Wav-VAE的实验阶段,美团LongCat团队还观察到一个有意思的现象:VAE的重建质量并不是越高越好。单纯追求高重建分数,会让潜空间的维度膨胀,反而让下游的扩散模型学不动,整体表现反而下降。
为了解决问题,美团LongCat团队对比了不同潜空间维度和帧率配置下的建模表现,确定了64维潜在维度加上11.7Hz的帧率最优配置。这个配置既给生成模型留出了足够的学习空间,又保留了必要的声学细节,在重建保真度和生成质量之间找到了一个平衡点。