字节 Seedance 1.5 pro,如何实现「音画同出」:中学生能看懂
字节今天发布了 Seedance 1.5 pro,原生音视频联合生成
划重点视频、声音同时生成,而非先出视频、再配音对口型
本文里,我将以尽可能易懂的方式,讲讲其原理
保证中学生能看懂
如果你需要更专业、细致的了解,可以看这个技术报告https://arxiv.org/abs/2512.13507v2
先看两个案例,感受下这个技术
案例一:火锅店,三代人,三种口音
重庆火锅店包间,三人围坐吃火锅,热气腾腾。画面左侧的老人用重庆话说「这个毛肚七上八下,刚刚好」,说完夹起毛肚。画面中间的中年男人给右侧的年轻人夹菜,用普通话说「慢点吃,小心烫」。年轻人吃完后用上海话说「爷爷,辣是辣,不过老灵额」。老人听完哈哈大笑拍桌子,三人相视而笑。全程缓慢推镜,背景是火锅沸腾声和餐厅环境音
案例二:审讯室,甩镜,微表情
女人坐在昏暗的审讯桌前,神情严肃,不屑的翻看着资料,女人说:“前面你说了这么多,听起来天衣无缝的。”说完后,镜头向左边方向快速甩镜。此时画外音女侦探有力量的语调快速问”你是AI吧?!“特写男人的面部,围绕男人缓慢旋转的推镜头,推镜至五官,男人表情紧张,眼睛微微睁大,流露出一丝丝轻微的不安感。男人听完单手摘下眼镜,低下头,停顿一下,抬头皱眉,然后从抿嘴转为嘴角微笑的表情,轻微咽一下口水,随后微笑着问:”你怎么知道?“
Seedance 1.5 pro
12 月 18 日,火山的 FORCE 原动力大会上,发布了豆包视频生成模型 Seedance 1.5 pro,核心卖点是「原生音视频联合生成」
这个模型,能做四件事:
• 文本生成音视频(T2VA):你写一段描述,它生成带声音的视频• 图片生成音视频(I2VA):你给一张图,它生成带声音的视频• 文本生成视频(T2V):传统的文生视频,不带声音• 图片生成视频(I2V):传统的图生视频,不带声音
之前一些音画同出,是「缝合怪」:模型先生成画面,然后再来配音
问题在于,视频已经定型了,口型已经固定了,配音只能尽量去对。对不上的地方就会穿帮,行业里管这个叫「腹语效应」
Seedance 1.5 pro 则做到了音视频同时生成,两边持续交换信息
视频流知道现在该说什么话,音频流知道现在画面是什么表情
架构是怎样的
Seedance 1.5 pro 用的是双分支 Diffusion Transformer 架构
Diffusion Transformer
Diffusion Transformer 这是当前视频生成的主流架构
Sora 用的是这个,Kling 用的是这个,Veo 也是
方式大概是这样,从一张全是噪点的图开始,一步一步去掉噪点,最后得到清晰的视频
每去一步噪,模型会参考你的文本描述,决定「往哪个方向去」
再说什么是「双分支」
传统的视频生成模型,只有一个分支,只管生成画面
Seedance 1.5 pro 有两个分支,一个负责视频,一个负责音频,两条线同时跑
那么,两条线怎么协作?
答:中间有一个「跨模态联合模块」,让两个分支在生成过程中持续交换信息
视频分支在去噪的时候,会收到音频分支的信号:现在这个时间点,音频那边在生成一句话,这句话的口型是这样的
音频分支在生成的时候,也会收到视频分支的信号:现在画面里的人嘴张开了,你这边得出声;画面里的人嘴闭上了,你这边得停
通过这种方式,生成出来的视频和音频,时间上是同步的,语义上是一致的
技术基础是 MMDiT(Multimodal Diffusion Transformer)
Stable Diffusion 3 用的就是这个架构
Seed 团队在这个基础上加了音频分支和跨模态交互机制
训练数据怎么搞
模型能力的上限,很大程度上是数据决定的。Seedance 1.5 pro 在数据处理上做了三件事
第一件事:筛数据
网上能爬到的视频很多,但大部分不能直接拿来训练
技术报告里说,筛选管线优先保证三件事:音视频一致性、动作表现力、以及后面会提到的课程式调度
举个例子:
• 音视频同步:画面里的人在说话,但口型对不上的;画面里有动作,但没有对应声音的,筛掉• 表现力:动作幅度不够、表情变化不丰富的,筛掉
筛完几轮,数据量会大幅减少,但剩下的都是能用的
第二件事:打标签
每条数据都要告诉模型「这里面有什么」
视频的标签包括:画面里有几个人、在做什么动作、互相之间有什么互动、镜头怎么运动
音频的标签分两类:
1. 人声标签——这段声音是说话、还是唱歌、还是笑声叹气。如果是说话,说的什么语言、什么口音、什么情绪。比如这是「普通话,女性,开心」,那是「四川话,男性,疲惫」2. 非人声标签——这段声音是环境音还是音乐。环境音的话,声源是什么:车流声、雨声、键盘敲击声。音乐的话,什么流派、什么节奏
这套标签打得很细,技术报告里说是「professional-grade descriptions」,专业级的描述
第三件事:安排训练顺序
数据弄好后,拿去训练,也是分先后顺序的
技术报告里叫「curriculum-based data scheduling」,课程式数据调度
具体怎么安排的,报告没有展开。但课程学习的一种做法是:
先让模型学简单的:一个人、正面镜头、说话清晰、口型明显
学会了,再喂难一点的:两三个人、有互动、有镜头切换
最后喂最难的:多人多语言、复杂镜头调度、微表情递进
训练步骤
Seedance 1.5 pro 的训练分三步走:预训练、SFT、RLHF
第一步:预训练
这一步,是让模型「能生成」
这一步用的数据量大、种类多。既有纯视频,也有纯音频,也有音视频一起的。让模型把视频生成和音频生成的基本功都学会
这一步结束,模型已经能根据文本描述生成带声音的视频了,但质量不稳定,有时候好有时候差
第二步:SFT(监督微调)
这一步,是让模型「生成得好」
这一步用的数据量小,但质量高。每一条都是精挑细选的:画面精美、音频清晰、口型完全对齐、情绪表达到位
让模型学习这些高质量样本,知道「好的生成结果长什么样」
第三步:RLHF(人类反馈强化学习)
这一步,是让模型「符合审美」
RLHF 的逻辑是:让人来评判模型的生成结果,告诉模型「这个好、那个不好」,模型根据反馈调整自己
围绕这个,Seed 团队训练了一个「奖励模型」,这个奖励模型学会了人类的评判标准,可以自动给生成结果打分
打分有三个维度:动作质量:动作流不流畅、物理上合不合理、有没有穿模(比如手穿过桌子)视觉美学:画面好不好看、构图合不合理、色彩协不协调音频保真度:声音清不清晰、有没有杂音、情绪表达对不对
模型每生成一个结果,奖励模型从这三个维度打分。分数高的,说明方向对了,继续往这个方向走;分数低的,说明方向错了,调整策略
这一步的训练量很大,Seed 团队专门优化了训练管线,速度提升了近 3 倍。同样的时间,能让模型学到更多反馈
推理优化
视频生成,通常很慢,生成一个 10 秒的视频,可能要算好几分钟
因为要一步一步去噪,每一步都是大量计算
Seedance 1.5 pro 把推理速度提升了 10 倍以上
怎么做到的?三层优化
第一层:蒸馏
原本模型生成一个视频可能要 100 步去噪,太慢了
蒸馏的做法是:训练一个「学生模型」,让它模仿「老师模型」的行为。老师用 100 步才能做到的事,学生可能 10 步就能做到差不多的效果
步数少了,计算量就少了,速度就快了
Seed 团队用的是多阶段蒸馏,分好几轮来压缩步数,每一轮都尽量保证质量不掉
第二层:量化
模型参数通常用 32 位浮点数存储,精度高,但计算量大
量化就是把精度降下来,32 位变 16 位,甚至 8 位。精度低了,计算量就小了,速度就快了
当然不能降太多,否则生成质量会明显下滑。Seed 团队找了一个平衡点:精度降到一定程度,速度提升明显,质量基本不掉
第三层:并行
视频生成的计算量很大,一个 GPU 算不过来
并行就是把任务拆开,分给多个 GPU 同时干活,最后把结果合起来
三层优化叠加,端到端加速超过 10 倍
评测对比
Seed 团队建了一套评测基准叫 SeedVideoBench 1.5
请专业电影导演定标准,请电影制作、摄影、设计领域的专家做人工评测
与各类模型进行对比:Kling 2.5、Kling 2.6、Veo 3.1、Sora 2、Seedance 1.0 Pro
具体的评测信息如下
视频能力
评测维度:动作质量、指令跟随、视觉美学
T2V 任务(文本生成视频):
• 指令跟随:Seedance 1.5 pro 领先 • 视觉美学和动作质量:和 Kling 2.6、Veo 3.1 有竞争力
I2V 任务(图片生成视频):
• 各项指标稳定,比上一代 Seedance 1.0 Pro 有明显提升
音频能力
评测维度:音频指令跟随、音频质量、音视频同步、音频表现力
和 Kling 2.6、Veo 3.1、Sora 2 对比:
在中文语境上,Seedance 1.5 pro 在中文对话、方言、独白的生成上,准确度高于 Veo 3.1。基本没有吞字、发音错误
在口型匹配上,Seedance 1.5 pro 能正确对应说话角色的数量和身份。在这个维度上超过 Veo 3.1 和 Kling 2.6
在音频表现力上,Sora 2 在情绪表达上更「夸张」,Seedance 1.5 pro 更「克制」。技术报告的原话是「able to achieve consistent emotional alignment with visual content while avoiding over-exaggeration」——在需要稳定调性控制的专业制作场景更合适
即将上线:Draft 样片功能
AI 生成视频有个老问题:抽盲盒
为了一个理想的镜头,可能要反复试很多次
每次都是全分辨率生成,等半天,算力消耗大
Draft 样片功能解决这个问题
• 第一步,先生成低分辨率的预览。速度快,成本低 • 第二步,看预览。不满意就调 prompt,重新生成预览 • 第三步,预览满意了,再生成高清成片
预览和成片之间,是高保真一致的
预览里的画面构图、人物动作、口型节奏,成片里都会保留
不会出现「预览挺好,成片变样」的情况
官方数据:创作效率提升 50%,推理成本最高节约 60%
以及
这个模型,已上线了,带来了原生的「有声片」,并且更符合本土需求,可通过多渠道进行访问
个人/企业用户
可在即梦 AI、豆包 APP、火山方舟体验中心体验
API 用户
可在 12 月 23 日起可在火山引擎使用 API,模型名称: Doubao-Seedance-1.5-pro