阿里推出王炸EMO框架!AI视频又炸圈了!
前言
在人工智能的浪潮中,视频合成技术正以惊人的速度发展。阿里巴巴的最新成果——EMO(Emote Portrait Alive)框架,再次将AI视频技术推向了新的高度。本文将探讨EMO框架的技术特点、与Sora技术的比较,以及这一技术对未来视频制作可能带来的影响。
一、阿里巴巴的EMO框架
EMO是阿里巴巴智能计算研究院推出的一款基于音频驱动的肖像视频生成框架。它能够通过单张参考图像和一段音频,生成表情生动的AI视频。这一技术的应用场景广泛,从让历史人物“复活”到为电影角色配音,EMO展现了AI在视频制作中的无限潜力。
EMO(Emote Portrait Alive)是一个由阿里巴巴智能计算研究院开发的创新框架,它专注于通过音频驱动生成富有表现力的肖像视频。这个框架的核心在于其直接的音频到视频合成方法,它绕过了传统的3D模型或面部标记的中间步骤,从而实现了无缝的帧过渡和在整个视频中保持角色身份的一致性。
EMO的关键技术包括以下几个方面:
1.音频驱动的视频生成:EMO利用扩散模型(Diffusion Models)的强大生成能力,直接从给定的图像和音频剪辑合成角色头部视频。这种方法消除了对中间表示或复杂预处理的需求,简化了创作过程。
2.稳定性控制机制:为了解决音频和面部表情之间映射的不确定性,EMO引入了速度控制器和面部区域控制器,作为超参数,提供微妙的控制信号,确保生成视频的稳定性,同时不损害多样性和表现力。
3. 身份保持:为了确保生成视频中的角色与输入参考图像保持一致,EMO采用了类似于ReferenceNet的模块,称为FrameEncoding,用于在视频中保持角色身份的一致性。
4.训练数据集:EMO的训练基于一个庞大且多样化的音视频数据集,包括超过250小时的视频素材和超过1500万张图像。这个数据集涵盖了多种语言和内容类型,为模型提供了丰富的人类表情和声音风格的训练材料。
5. 网络架构:EMO的网络架构包括ReferenceNet和Backbone Network。ReferenceNet用于从参考图像中提取特征,而Backbone Network则负责去噪操作,并通过两种注意力机制(参考注意力和音频注意力)来保持角色身份的一致性和调节角色的运动。
6. 时间模块:为了操纵时间维度并调整运动速度,EMO在Backbone Network中应用了时间模块。这些模块通过自注意力机制在时间维度上捕捉视频的动态内容,确保生成的视频流畅且连贯。
EMO的这些关键技术使其在生成说话视频和唱歌视频方面表现出色,不仅在表达力和真实感上显著优于现有的最先进技术,而且在定量评估中也取得了优异的成绩。这一技术的发展为视频内容创作、虚拟角色动画和多媒体交互等领域带来了新的可能性。
EMO与Sora技术的比较: EMO与Sora技术虽然都致力于视频合成,但它们的技术路线有所不同。EMO并不依赖于Transformer架构,而是采用了Stable Diffusion 1.5的魔改版本。在口型同步质量上,EMO虽然略逊于Sora,但其开源的承诺和GitHub上的高关注度,显示出业界对其技术的期待。
EMO的技术细节: EMO框架主要由帧编码和扩散两个阶段构成。在帧编码阶段,ReferenceNet网络从参考图像和视频帧中提取特征。扩散阶段则通过预训练的音频编码器处理音频嵌入,结合人脸区域掩模和多帧噪声,控制人脸图像的生成。EMO的骨干网络应用了参考注意力和音频注意力,确保角色身份的一致性和运动的自然性。
二、EMO背后的团队
EMO背后的团队是一群在人工智能领域拥有深厚背景和丰富经验的专家。这个团队由四位主要成员组成:Linrui Tian、Qi Wang、Bang Zhang和Liefeng Bo博士。他们各自在机器学习、计算机视觉和人工智能领域有着显著的贡献。
Liefeng Bo博士,作为团队的领军人物,目前担任阿里巴巴通义实验室XR实验室的负责人。他在人工智能领域有着广泛的研究,特别是在机器学习、计算机视觉和机器人技术方面。Bo博士曾在芝加哥大学丰田研究院和华盛顿大学进行博士后研究,并在亚马逊西雅图总部担任首席科学家,之后加入京东数字科技集团AI实验室,继续他的研究工作。他的研究成果在学术界和工业界都得到了广泛的认可,谷歌学术被引数超过13000次。
Bo博士的加入,为EMO项目注入了强大的研究动力和实践经验。他的专业知识和领导能力对于EMO框架的开发至关重要,确保了项目在技术创新和应用实践上的成功。在Bo博士的带领下,EMO团队不仅在技术上取得了突破,也在推动AI视频合成技术的发展上发挥了重要作用。他们的工作不仅展示了阿里巴巴在AI领域的技术实力,也为整个行业的发展树立了新的标杆。
最后
AI视频技术的前景是广阔而充满潜力的。随着EMO和Sora等技术的成熟,我们正见证着视频内容创作的革命。在娱乐行业,AI视频合成技术可以为电影制作、动画和游戏开发带来前所未有的便利。例如,电影制作人可以利用这些技术为经典角色赋予新的声音,或者创造出全新的虚拟角色,而无需依赖传统的演技和复杂的动作捕捉技术。
在教育领域,AI视频合成技术的应用同样令人兴奋。它可以用于创建互动式教学视频,让历史人物“复活”来讲述他们的故事,或者模拟复杂的科学实验,让学生在虚拟环境中进行探索和学习。这种技术还可以帮助语言学习者通过观看母语者的口型和发音来提高语言技能。
此外,AI视频合成技术在新闻、广告、社交媒体内容创作等领域也有着巨大的应用潜力。它能够降低内容创作的门槛,让个人创作者也能制作出专业级别的视频内容。
GitHub:https://github.com/HumanAIGC/EMO
论文:https://arxiv.org/abs/2402.17485