救命!腾讯这款Video-Avatar让AI虚拟人“戏精”上身了!
这几年,让AI根据声音生成虚拟人动画的技术是越来越火。但是吧,你真用了那些市面上流行的产品,你就会发现角色在动起来的时候多少会有一点崩溃,而且AI配音的喜怒哀乐也没有办法跟动画对得上号。还有,要是想让好几个角色在一个画面里你一言我一语地互动,这又该怎么整?
腾讯就推出了个叫Hunyuan Video-Avatar的新模型。简单讲,Hunyuan Video-Avatar 这东西是基于一种叫做多模态扩散变换器(MM-DiT)的技术模型。它的主要目标就是,你只要给它一张角色图片,再配上一段声音,它就能给你生成一段视频。这段视频里的角色不仅动作流畅、形象逼真,情感表达也特别到位,而且还能让好几个角色一块儿在里面聊天说话。
以前的技术在生成视频时,为了让角色形象保持一致,常常会过度依赖输入的参考图片,结果就是生成的动作看起来很僵硬,像是直接把参考图的姿势复制粘贴过来,缺乏生气。如果放宽限制让动作更自然,角色又容易“走形”,不像原来那个人了。
而Hunyuan Video-Avatar则是改变了参考图像信息融入模型的方式。它不再是简单粗暴地把图像信息“加”进去,而是设计了一种更精巧的“注入”机制。它会把参考图像的特征提取出来,转换成模型更容易理解和学习的形式,然后巧妙地将这些特征沿着特定的维度(通道维度)融入到视频生成过程中。
这么做的目的是为了接下来的操作:Hunyuan Video-Avatar回先把参考图复制好几份,跟视频的每一帧画面“叠”在一起,再用一个工具处理;同时,单独处理参考图,最后再把两边的结果拼起来。
在视频生成领域,实现角色的动态表现与身份一致性之间的平衡一直是个核心难题。让角色动起来不难,难的是动起来之后还能保持原来的样子,不出现奇奇怪怪的变形或者“画风突变”。Hunyuan Video-Avatar的关键在于其独特的条件注入策略:它并非简单地将参考图像的特征与噪声视频的特征在初始阶段进行拼接或相加,而是采用了更为精细的特征融合方式。
这样做的好处是,既能牢牢锁住角色的核心特征,保证“神似”和“形似”,又能给动态动作留出足够的发挥空间,让角色动起来更自然、更有活力。论文里提到,他们尝试了好几种注入方法,最后发现一种把参考图像复制多份,然后通过一个投影模块直接加到视频潜在特征上的方式效果最好。
这种“后期添加”式的注入,避免了在扩散模型的早期去噪阶段就过强地引入静态的图像约束,从而为模型学习和生成时间上连贯的动态变化保留了更大的灵活性。同时,由于参考图像的特征始终作为条件信息存在于模型的后续处理流程中,模型在生成每一帧时都会受到该身份信息的引导,确保了角色核心视觉特征(如面部拓扑结构、关键的纹理细节、整体画风等)在整个视频序列中的高度一致性。
即使在角色进行大幅度的动作或表情变化时,这种机制也能有效抑制身份漂移(identity drift)或伪影的产生,使得生成的角色既生动又不失其固有的身份特征。这种处理方式,相较于一些仅在输入层进行简单条件叠加的方法,能更好地解耦身份信息与动态信息,从而在保证高动态性的前提下,实现了更强的角色一致性和视频整体的视觉保真度。
但是光口型对上了还不够,角色的表情也得跟得上声音里的情感变化才行。如果声音听起来很高兴,但角色却面无表情,那效果肯定大打折扣。
Hunyuan Video-Avatar引入了“情感参考图像”的概念。也就是说,除了角色的主要参考图,你还可以再给一张表达特定情绪(比如开心、悲伤)的图片。模块会从这张情感参考图中提取情感相关的特征,然后通过特定的注意力机制(空间交叉注意力),把这些情感信息“注入”到视频生成模型的中间层。这样一来,模型就能更好地理解音频中的情感,并将其准确地反映在角色的面部表情上,让角色的喜怒哀乐更加逼真。
为了实现多人同台飙戏,Hunyuan Video-Avatar专门引入了一个专门为多角色场景设计的模块。这个模块的核心思想是“精准定位,分区控制”。首先,它会利用人脸检测技术,在视频的潜在特征层面为每个角色生成一个“面部掩码”(Face Mask),相当于给每个角色的脸划定了一个专属区域。然后,当输入某一段音频时(音频特征使用 Whisper 提取),模块会通过空间交叉注意力机制(spatial cross-attention strategy,确保每个音频帧仅与其时间对齐的视频帧的空间 token 交互),确保这段音频的信息主要作用于其对应的面部掩码区域。
这样,不同的音频就能精准地驱动各自对应的角色,而不会互相干扰。如此一来,就能实现多个角色在同一场景中,根据各自的音频独立进行表情和口型变化的生动效果,让多人对话场景的生成成为可能。
以前的技术大多只能处理单个角色的音频驱动,想让多个角色根据各自的音频在同一个画面里互动,就比较困难了。很容易出现张三说话,李四也跟着动嘴的情况。
总的来说,Hunyuan Video-Avatar 不仅仅满足于让角色“会说话”,它追求的是更高层次的“会表演”——能够展现动态、传递情感,并且支持更复杂的多人互动场景。
从让静态图片“开口说话”,到如今Hunyuan Video-Avatar驱动的虚拟人能够“眉目传情”、“同台飙戏”,AI在视频生成领域的进化速度着实令人瞩目。 尽管成果喜人,但AI生成视频在细节的自然度、长时序的逻辑一致性以及对复杂情感的精微演绎上,仍有广阔的提升空间。同时,模型的训练与推理效率(如论文提及的生成速度)也是制约其广泛应用的关键因素。
不过我真正害怕的,还是像Deepfake时期一样,AI生成的内容越来越真实,那么我去辨别这些内容的难度也就越来越高。说不定再过半年,我已经完全没有办法区分AI生成的内容了。
加入星球,探讨用户增长与变现专业话题