程序员老鬼

KlingAI 发布 数字人模型 Avatar 2.0可以根据文本内容生成最长5分钟的口型同步视频

最近,对于想把文字、音频变成视频的人来说,有一个好消息:KlingAI 推出了 Avatar 2.0 —— 一个能把照片 + 声音/文字,转成 最长约 5 分钟“会动会表演”的数字人视频 的工具。

Image

它让“AI 数字人”从过去那种“只有嘴在动”“木头脸”时代,真正迈向“会演戏、会情绪表达”的新阶段。

先聊聊它为什么“厉害” —— 看得见、听得见,还感觉得到“情绪”。

  • 不仅仅“对口型” —— 是“全身演绎”过去许多 AI 头像/数字人,只能做到“嘴巴跟音频开合同步”,好像在“读稿子”。但 Avatar 2.0 背后的团队说,他们让数字人成为“演员”:当声音语调变高,它会眉眼扬起;当节奏变缓,它的动作可能带有轻微停顿;当歌词里有激情、犹疑、强调……脸部表情和身体姿态都会跟着变化。比起旧的“面瘫式 AI头像”,现在的它更——有人味儿。

  • 从图 + 音 + 文 本 → 一个完整“故事线”Avatar 2.0 并不只是简单把声音塞给嘴巴同步,而是用了所谓的“多模态导演模块”(MLLM Director):系统会把你给的头像(或照片)、音频、文字提示整合起来,理解你想表达什么:“慢镜头靠近”“微笑 + 眨眼 + 手势强调”“轻声”“激昂”“疑问”等等。然后把这些转化为一条“蓝图视频”(blueprint video),决定动作、节奏、情绪,再生成真正的视频。也就是说,你不仅给了“声音”,还给了“情绪”“表演提示”,最终出来的是一段连贯、有情绪、有镜头感的视频。

Image
  • 支持长视频输出 —— 真正适合内容创作由于 Avatar 2.0 使用了“两阶段生成 + 并行子段拼接”的技术方案,它不仅能生成 5–10 秒的小片段,也能稳定输出 最长约 5 分钟 的完整表演。这意味着,它不再只适合做“短一句话”“一句歌词”那种短片,而是可以做小故事、完整演讲、营销介绍、甚至微型 MV。

那它对普通人或内容创作者来说,会带来什么变化/可能性?

对个人创作者: 你不需要摄影棚、不需要专业演员,也不需要复杂设备。只要一张照片 + 文字脚本/音频,就能生成“看得像真人说话”的视频。这对于短视频作者、播客主、原创歌手、教育/科普/知识类创作者来说,很有吸引力。比如:你录一段朗读、一段讲解,就能马上变成一个“数字人讲述者”。

Image

对商业/营销/品牌: 电商商家可以用它做产品介绍:把产品图片 + 解说音频放进去,让“数字代言人”出现,演示产品、介绍功能,为广告做内容生成,节省真人拍摄成本。音乐人可以用它出“虚拟 MV” —— 上传一段音乐 + 歌词,Avatar 2.0 就能“演唱 + 表演”。也许以后广告、短视频、品牌推广里,“数字人 + AI 生成内容”会越来越普遍。

对未来内容形式的影响: 过去“文字 → 图像 → 视频”的链条,要么太耗资源,要么专业门槛高;现在有了像 Avatar 2.0 这样工具,创作门槛大大降低。你只需要“想想想 + 说说说 + 上传 + 点击”,就可能得到一段“有戏”的视频。对于内容民主化、让更多人参与创作,是一次技术红利。

当然,也有人会担心 —— 便利背后,是否有伦理、版权、真实感与信任的问题?毕竟,当“谁都能做数字人视频”,未来“真实/AI”界限可能变得模糊。特别是如果用到别人的照片、声音、形象,需要尊重肖像权、版权,以及内容真实性。

总的来说,Avatar 2.0 的出现,对 AI 数字人视频生成是一次重大技术跃迁。从“嘴动嘴型同步”走向“整体表演、情绪丰富、故事连贯”的“会演”的数字人,它开启了一个面向 5 分钟级、适用于创作者、营销者、普通用户的全新视频创作可能。

如果你愿意,也可以试试看 —— 给它一张照片,一段脚本/语音,看它能不能“演”出你想表达的感觉。或许,你会为自己的想法,新添一个“虚拟演员”。

-END-

我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html

最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领,也可以链接我微信:hls404