小红书技术REDtech

小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

Image

近日,小红书 dots 团队正式开源dots.tts。这是一个 20 亿参数、全连续、端到端的自回归语音合成模型。

在当前主流语音生成路线中,一类模型采用非自回归扩散,一次生成完整语音;另一类模型将语音量化为离散 Token,再沿用大语言模型的方式逐步预测。dots.tts 选择了另一种组合:跳过离散声学 Token,直接在连续隐空间中进行自回归生成。

围绕这条路线,我们希望建立一套同时具备高保真音色克隆、长程稳定生成、低步数推理和双流交互能力的 TTS 基座,并将完整训练链路开放给社区。

目前开源版本具有以下特点:

  • 零样本克隆效果领先:在 Seed-TTS-Eval 三个子集上,取得对比系统中最佳的平均内容准确度和平均说话人相似度;

  • 完整开放六个检查点:覆盖预训练、自纠正对齐、四步/两步/单步低步数生成和 1T1A 双流模式;

  • 面向交互场景:天然支持音频流式输出,并可通过 1T1A 让文本流和语音流交错推进;

  • 低延迟推理:在论文给定的单卡四步推理条件下,普通流式模式首包延迟为 85.4 毫秒,1T1A 双流模式为 54.4 毫秒;

  • 可继续扩展:dots.tts.edit 沿用同一套连续自回归基座,进一步获得文本、情绪、韵律和停顿编辑能力;

  • 训练路径完整开源:训练、推理、微调、蒸馏和双流推理代码均已开放,采用 Apache 2.0 许可证。

本文将从效果、技术路线、低步数推理、双流交互和能力扩展五个方面,介绍 dots.tts 的设计与开源内容。

Image

语音合成模型首先要回答两个问题:文字能否准确说出来,以及生成的声音能否稳定保持参考说话人的特征。

Seed-TTS-Eval 是常用的 zero-shot 音色克隆评测。模型只获得一小段训练时未见过的参考音频,再使用同一个声音合成新的文本。评测中的 WER/CER 衡量内容准确度,SIM 衡量生成音频与参考音频的说话人相似度。

dots.tts SOAR 版本在中文、英文和中文困难集上的 WER/CER 分别为0.94%、1.30% 和 6.60%,SIM 分别为 81.0、77.1 和 79.5。

三个子集取平均后,SOAR 版本的平均 SIM 达到 79.2,平均 WER/CER 为2.95%;基础预训练版本的平均 WER/CER 为2.92%。在论文列出的对比系统中,dots.tts 分别取得最佳平均说话人相似度和最佳平均内容准确度。

Image

图 1|Seed-TTS-Eval 上的平均 WER 与平均 SIM 分布。横轴越靠左内容越准,纵轴越靠上音色越像,dots.tts 位于左上角。

Image

表 1|Seed-TTS-Eval 零样本克隆核心结果。约 3 秒参考音频,由评测集自带的 ASR 与 WavLM-SV 打分;基线取自各自论文或默认配置的开源版本。

为什么 zero-shot 克隆能够反映基座能力?

自回归是大模型最熟悉的生成方式。文本大模型预测下一个 Token,TTS 模型则在目标文本、参考音频和已生成声学历史的条件下,预测下一个声音片段,并持续将生成结果纳入后续上下文。

几秒参考音频包含说话人的音色、语速、音高走势、停连和韵律。模型需要理解这些特征,再逐步预测这个人会如何说出另一段新文本。zero-shot 克隆由此同时检验内容建模、参考音频理解、说话人保持和长程生成稳定性。

Seed-TTS-Eval 上的结果说明,dots.tts 在这几项基础能力上形成了较好的平衡:内容说得准,声音保持得住,逐步生成也足够稳定。

在其他测试集的表现同样出色

在 MiniMax-Speech 的 24 语种评测中,dots.tts SOAR 的平均说话人相似度达到 83.9。dots.tts 的不同版本在其中 19 个语种取得单项 SIM 第一,并在另外 2 个语种并列第一。

另外,在偏表现力的 EmergentTTS-Eval 上,以 gpt-4o-mini-tts 为基准做两两对比,dots.tts SOAR版本拿到表中最高的句法复杂度得分 65.7%,高于所有闭源系统;dots.tts Base 版本则取得开源系统中最好的情绪表现力得分 72.7%。

Image

图 2|EmergentTTS-Eval 总体胜率对比。红色为 dots.tts,紫色为闭源系统,蓝色为开源系统,虚线为 50% 基准线。

下面几个音频取自这几个测试集。

seed-tts-eval 困难文本

参考音频:「由于对球没有很好的控制力,我通常打直球。」

生成音频:「喇嘛与哑巴 打南边来了个哑巴,腰里别了个喇叭;打北边来了个喇嘛,手里提了个獭犸。提着獭犸的喇嘛要拿獭犸换别着喇叭的哑巴的喇叭;别着喇叭的哑巴不愿拿喇叭换提着獭犸的喇嘛的獭犸。不知是别着喇叭的哑巴打了提着獭犸的喇嘛一喇叭;还是提着獭犸的喇嘛打了别着喇叭的哑巴一獭犸。喇嘛回家炖獭犸;哑巴嘀嘀哒哒吹喇叭」

多语言克隆西班牙语

参考音频:「El Instituto Acton, un Tintag libertario conservador cristiano estadounidense, lleva su nombre.」

生成音频:「Mi padre suspiró, amparado en aquella sonrisa triste que le perseguía como una sombra por la vida.」

跨语言克隆英文 - 中文

参考音频:「Which is what has brought us to this point in the first place.」

生成音频:「那我来给大家推荐一款 T 恤,这款呢真的是超级好看,这个颜色呢很显气质,而且呢也是搭配的绝佳单品,大家可以闭眼入,真的是非常好看,对身材的包容性也很好,不管啥身材的宝宝呢,穿上去都是很好看的。推荐宝宝们下单哦。」

语言表现力

参考音频:「没必要和那些大师的作品比较吧。」

生成音频:「哎呀你得知道啊,要把知识硬塞到那些学生的脑瓜子里去,啧啧,说真的,实在是件乏味得要死的苦差事,你说是不是嘛。不过呢,要是偶尔能遇上个心有灵犀的聪明孩子,哎嘿,你只要稍微点拨一下下,他就能豁然贯通了,哇,真的太神奇了。嘿嘿嘿,我跟你讲,这时候呀,这世上绝对再没有比教书更让人心仪的事情了,哈哈哈哈,你说对吧?」

Image

语音包含大量连续变化。一个人的声音身份分布在频谱质感、气声、鼻音、音高起伏、音节时长、停顿方式和语速变化中,这些细节共同构成了“这个人怎样说话”。

离散语音表示需要将这些变化映射到有限码本。量化后的序列便于语言模型学习,也会带来不可逆的信息损失。多个不同的声音细节可能被压入同一个编号,编码阶段丢失的信息很难在后续生成中恢复。

语音重建结果可以直接观察这种差距。参与比较的四种离散表征,PESQ-NB 位于2.40—2.92,SIM 位于 0.68—0.85;三种主要连续表征的 PESQ-NB 达到3.99、4.23 和 4.09,SIM 达到 0.963、0.950 和 0.969。连续表征在 PESQ、STOI、SIM 和重建后 WER 上整体表现出更高上限。

其中,SIM 对声音克隆尤为关键。离散方案的最高值为 0.85,dots.tts VAE 达到0.969。这意味着自回归模型开始学习之前,连续隐空间已经保留了更完整的说话人信息。

MingTok-Audio 使用 50 FPS 的潜变量序列,在 PESQ 和 STOI 上取得最高结果。dots.tts VAE 面向48 kHz 语音,将连续序列压缩到25 FPS,仍取得 4.09/3.95 的 PESQ、0.973 的 STOI、0.969 的 SIM 和 4.14% 的 WER。这一设计在高保真信息和自回归序列长度之间取得平衡,为后续大规模训练控制了计算成本。

Image

表 2|LibriSpeech test‑other 测试集上的语音重建性能。FPS 表示底层表征的时间帧。粗体标记每列中最佳的非先知(non‑oracle)结果。“‑” 表示该指标由对应文献给出。

一段带回声的声音,更容易听出连续表示的上限

参考音频中的声音特征有时超出了狭义的“音色”。空间反射、距离感和尾音衰减,同样会影响人对一段声音的整体判断。

下面的参考音频带有明显回声。dots.tts 在合成新文本时,延续了说话人的基础音色和韵律,也保留了回声带来的空间感。连续克隆由此覆盖说话人特征与声学环境共同构成的整体声音。

参考音频:「祂的承诺兑现后,布洛妮娅… 我们就不必再穷尽此生守护一片废土。你和我,我们会亲眼见证新世界从废墟中升起。」

生成音频:「听好了,这场仗我赢了。你的底牌、后路、人脉,全在我手里。现在,带着你那份不甘,乖乖退场吧!」

Image

连续表示提高了声音信息上限,也增加了自回归预测的难度。

自回归模型会把已经生成的声音继续作为后续条件。连续隐变量缺少离散码本的量化约束,前一步的微小偏差会进入下一步历史,并在长句生成中逐渐累积,最终可能表现为音色漂移、节奏变化、重复或吞字。

为了降低这种误差积累,dots.tts 首先从AudioVAE 的语义化训练入手。

AudioVAE 第一阶段学习高质量波形重建,并通过正则约束形成更平滑、低噪的连续隐空间。第二阶段继续保留重建目标,同时加入 WavLM 帧级表征对齐,以及 ASR、情绪和说话人识别等多任务监督。

这些监督为连续隐空间提供了清晰结构:ASR 对应内容信息,情绪任务对应表达方式,说话人任务对应声音身份,高保真重建负责保存局部声学细节。连续表示由此兼顾信息完整度和可学习性。

在 HoliTok 的工作中,团队使用这套语义化 AudioVAE 进行了 ASR 与 TTS 统一建模实验。同一份连续表示同时服务语音理解和语音生成。参与比较的连续表征中,HoliTok 是唯一无需额外优化技巧即可直接稳定完成统一建模的方案;加入因果 Semantic Encoder 后,ASR 和 TTS 的表现进一步提升。这项实验说明,语义化 VAE 会直接影响连续表示的可学习性。

第二阶段训练得到的编码器随后作为因果 Semantic Encoder。每生成一段连续语音,Semantic Encoder 都会从中提取更稳定的语义历史,供后续自回归步骤使用。

连续隐变量保留音色、韵律和局部声学细节,Semantic Encoder 负责整理长程反馈。它只读取已经生成的音频,可以随语音逐段更新。AudioVAE 与 Semantic Encoder 共同降低连续误差的长程累积,使高保真连续表示能够稳定进入自回归生成过程。

Image

图 3|dots.tts 整体架构。文本经 BPE 直接进入 LLM,因果 Semantic Encoder 把已生成的 VAE 潜变量压成语义历史回灌,AR 流匹配头在 48 kHz AudioVAE 的连续隐空间中逐块去噪,全链路没有离散声学 Token。

Image

基础模型效果稳定之后,下一项问题是后训练和推理效率。

1. 无奖励的自纠正对齐

标准预训练主要使用干净的历史音频,实际推理面对的则是模型自己逐步生成的历史。两种状态之间存在分布差异。

团队参考 SOAR 的思路,对DiT模块进行无奖励的自纠正对齐。模型先沿自己的预测向前生成,构造真实推理中可能出现的偏离状态,再学习将这些状态拉回干净目标。该阶段不依赖奖励模型或额外声学教师,重点修复多步生成中的误差累积。完成对齐后的 SOAR 检查点同时作为后续低步数蒸馏的教师。

2. MeanFlow 将稳定生成压缩到四步

连续潜变量需要沿速度场逐步求解。MeanFlow 将教师在一段时间区间中的生成轨迹蒸馏为平均速度,让学生一次跨过更大的求解区间,并把分类器自由引导融入蒸馏目标,减少每个声学块所需的网络前向次数。

四步生成已经能够保持稳定质量。团队继续向更低步数推进。

3. sCM 与 Reward-Aware DMD 继续压缩到两步和单步

MeanFlow 直接压缩到双步和单步时,生成质量会明显下降。团队引入简化一致性模型(sCM),约束生成轨迹不同时间点的预测保持一致,得到稳定的双步模型。

在此基础上,团队进一步采用奖励感知的分布匹配蒸馏(Reward-Aware DMD)。该方法在对齐教师生成分布的同时引入语音质量奖励,并结合双时间尺度更新策略(TTUR)稳定训练,最终形成自然、清晰、音色一致的高质量单步模型。

本次四步、两步和单步检查点均已开放,可根据质量、吞吐和部署成本选择对应版本。

Image

在交互场景中,TTS 的延迟会直接影响对话体验。降低延迟既需要缩短模型计算时间,也需要让语音尽早开始输出。

普通流式模式下,完整文本先作为前缀输入,dots.tts 随后逐步生成音频块。播放端可以持续接收生成结果,无需等待整句音频全部完成。这种模式适合文本已经准备好的标准 TTS,也能降低长文本合成中的等待感。

面向语言模型实时输出播报的场景,dots.tts 进一步支持1T1A 双流模式。上游语言模型从输出第一个文本 Token 开始,语音侧就可以消费新增文本并生成音频,文本生成和语音生成由此重叠推进。这套模式适合实时语音 Agent、双工交互等场景。

在1T1A 模式下,上游语言模型开始输出后,最快 54.4 毫秒即可输出音频首包。

除项目自身的推理接口外,SGLang-Omni 已支持 dots.tts,并对服务吞吐进行了优化。在 SGLang-Omni 公布的 Seed-TTS-Eval EN 测试中,单卡最高可运行 16 路并发。这补充了 dots.tts 在工程部署侧的另一项能力:既可以面向单路实时交互压低首包延迟,也可以借助推理框架面向多请求服务提升并发吞吐。

Image
Image

本次开源覆盖基础训练、稳定性增强、低步数生成和双流交互,共提供六个检查点。

除了模型权重,项目还开放了训练、推理、微调、蒸馏和 1T1A 双流推理代码,并提供 CLI、Python API 和流式调用方式。

对研究者而言,这套开源内容可以用于复现和继续验证连续自回归路线;对开发者而言,可以在同一套基座上完成领域音色适配、低延迟部署和实时交互系统集成。

Image

建立生成基座之后,团队继续探索了语音的精确编辑能力,这就是 dots.tts.edit。

语音编辑是一项同时考验理解与生成能力的任务:模型不仅要结合源语音、文本和编辑指令,理解“改什么、怎么改、在哪里改”,还要生成符合目标的语音,并尽可能保持未指定区域的内容、说话人特征和声学连贯性。

利用 dots.tts 连续自回归架构,将文本条件与连续语音潜表示纳入统一的条件生成框架的特点;团队继续探索了语音的精确编辑能力,训练了 dots.tts.edit。在其中,源文本、源语音、编辑指令和目标文本共同构成模型的上下文,由同一模型生成编辑后的目标语音。这使语音编辑成为检验该架构是否具备统一承载语音理解与生成能力潜质的代表性任务。

它支持四类操作:替换、插入或删除文字;改变整句或局部片段的情绪;调节指定片段的音高与语速;在文字边界插入、延长或缩短停顿。多项操作可以组合在同一条指令中,并通过一次生成完成。这样一来,dots.tts 的能力从“用一个声音说出新文本”,继续扩展到“只修改声音里被指定的部分”。

Image

团队同时提出双语评测套件 doteBench,共包含 2,081 个案例。其中 1,841 个单项编辑案例覆盖文本、情绪、韵律和停顿,240 个组合案例要求模型一次完成多项编辑。

doteBench 同时检查三个方面:目标指令是否执行,未编辑区域是否保持,完整音频是否自然。文本编辑看目标区域和保留区域的 WER/CER;情绪、韵律和停顿分别检查目标属性的变化;WDTW-Dur、WDTW-F0 和 SpkSim 则衡量未编辑部分在时长、音高和说话人身份上的保持程度。

在论文评测的开源模型中,dots.tts.edit 在五类任务上取得了整体领先的指令跟随和局部保持表现:

Image
Image

我们将 dots.tts 定义为“基座”,主要基于四个方面。

第一,基础生成能力足够扎实。zero-shot 音色克隆、内容准确度和跨语言音色保持,为后续能力扩展提供了稳定起点。

第二,技术路线具备长期扩展空间。连续表示保留声音细节,自回归建模支持上下文学习和天然流式生成,语义化 AudioVAE 与 Semantic Encoder 提升长程生成稳定性。

第三,同一套模型能够覆盖不同部署形态。SOAR 处理误差积累,低步数蒸馏覆盖四步、两步和单步生成,1T1A 连接文本流与音频流。从高质量离线合成到实时双流交互,开发者可以在同一基座上选择不同推理配置。

第四,新能力可以沿现有骨干继续生长。dots.tts.edit 已经验证,文本、情绪、韵律和停顿编辑可以在保留基础合成能力的前提下接入这套生成路径。

本次开放六个检查点,以及训练、推理、微调、蒸馏和双流代码,希望让连续自回归语音生成不只停留在一项研究结果中。研究者可以继续探索新的表示与训练方法,开发者可以面向行业场景完成适配,产品团队也可以将其接入语音 Agent、创作工具和双工对话系统。

从声音克隆、低步数推理到双流交互与精确编辑,dots.tts 正在形成一套可持续训练、蒸馏和扩展的开源语音合成基础设施。

Image

我们是谁

dots studio 多模态团队专注于依托大模型技术不断扩展多模态能力边界,从视觉理解到视觉/语音理解再到视觉/语音的交互形态,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。

研究方向和招聘方向

全双工交互模型

我们探索如何通过最自然的交互形式,拉近人与模型的距离,赋予智能温度:

  • 打造音视频输入的可靠全双工交互基座,充分发挥大语言模型的智能;

  • 在延迟和交互细节,打磨对自然度的追求;

音频生成基础

我们关注构建音频生成的基础模型:

  • 具备高质量多模态输入的音频生成模型,包括人声、哼唱、音乐、General Audio;

  • 具备强可控和可编辑的能力,支持对音色/风格/情绪/语速等多种维度及其复合要求进行可控编辑;

  • 探索端到端统一表征,追求 learnability / quality / compression 的极致 trade-off 优化。

多模态理解模型基础

我们关注构建理解文字/视觉/语音三种模态的基础模型:

  • 具备对图片/视频/语音的全面感知,例如文字/表格/实体/动作/空间关系/情感/声音事件等;

  • 具备视觉和语音联合感知,例如在视频上同时输入视觉和语音能够增强理解;

  • 具备多模态输入的推理能力,模型能够无偏地利用 context 中不同模态的信息进行高质量的结构化推理,解决复杂问题。

视觉生成基础

我们关注构建图片生成的基础模型:

  • 具备高质量多模态输入的图片生成模型,提升真实感、一致性和复杂度;

  • 具备强可控与可编辑的能力,支持多种控制方式并保持编辑前后的一致性;

  • 探索 Diffusion 理论,在生成效率和效果上追求 10x 提升的架构创新。

过往工作

  • dots.vlm1:2025.08 发布,首个基于大规模 MoE LLM 的 VLM 模型,在通用能力上达到当时的开源最好水平

  • dots.ocr:2025.08 发布,首个基于 VLM 端到端进行文档解析的模型,在主要的文档解析效果上达到最好水平

  • Diff-Instruct*:在 1-step text-to-image 生成模型上,提出 score-based PPO 强化学习算法

联系我们

热招职位(HC积极开放中)

职位类型

职位

社招

【Dots】多模态基座研究员-语音方向
小红书招聘

【Dots】多模pretrain-图片生成模型研究员

小红书招聘

【Dots】多模理解-视觉语言大模型研究员

小红书招聘

校招Redstar

【REDstar】Dots-视觉语言大模型算法工程师

小红书招聘

Ace

顶尖实习

Dots-【Ace顶尖实习生】全模态实时交互大模型研究(语音方向)

小红书招聘

Dots-【Ace顶尖实习生】探索多模态大模型的通用能力增强和跨模态能力迁移

小红书招聘

投递方式

微信小程序打开小红书招聘,搜索关键词「Dots」查看相关职位,或者直接联系我们

leader 柯雄 [email protected]

HR 沐橙 [email protected]

Image