findyi

AI居然有脸了

大家好,我是洋哥。

一觉醒来,AI又上新货了。

阿里通义实验室 Wan 团队,放出了一个叫 Wan Streamer 的模型。这个模型的功能简单来说就是:AI 能跟你视频通话了。

你开摄像头,对面能实时生成一张 AI 的脸,看着你,听你说话,实时回应你。

有人说,这有什么大不了的。AI数字人不是早就有了吗?但这和普通AI数字人可不是一码事。

普通数字人,本质上是个播放系统。提前录好真人的形象和动作,再用脚本驱动它说话。你问它“天气怎么样”,它回“今天天气不错”;你换个问法,它可能就答非所问了。它根本不知道你在说什么,只是在匹配关键词,然后触发对应的台词。

Wan Streamer 不是在播放,是在思考。

Wan Streamer背后跑的是大语言模型。它真正理解你说的每一句话,实时生成回应,实时生成配套的表情和口型。你说了个笑话,它笑;你说的话让它“困惑”,它的表情也会变。

Image

Wan Streamer 角色演示

还有一个更大的差别:它能看到你。

你开摄像头,它不只是在说话,它在感知你。你的表情,你的状态,你当下的反应,它都在接收。但普通数字人对着镜头说话,根本不知道对面坐的是谁,更不知道那个人现在是什么状态。

数字人是把真人克隆进了屏幕。Wan Streamer 是让 AI 本身长出了一张脸。

这是两件本质不同的事。

当 AI 有了脸,谁会最先被砸到?

AI越来越强,这已经不用讨论了。关键是:当AI有了脸,它会先砸进哪些赛道?我想了一下,至少这三个方向机会很大。

第一个:AI 陪伴赛道。

以前做 AI 陪伴,靠文字靠语音。你心里很清楚对面是个机器,有距离感,那道心理墙一直在。但如果能视频,对面有一张会说话的脸,在看你,在回应你……这道墙,会开始松动。AI 陪伴的天花板,被 Wan Streamer 直接炸开了。

第二个:教育场景。

AI 外教、AI 面试官、AI 培训讲师。以前只有语音,现在有了视频。你练英语口语,对面有一张脸在看着你、听你说、跟你对话,沉浸感完全不一样。在线教育会不会重新洗牌也很难说。

第三个:客服和销售。

语音客服最大的问题是没有温度,用户排斥。但如果客服打来,对面弹出一张笑着的脸,看着你,实时回应你的每一句话……转化率跟现在的语音客服,不是一个量级的。

但我必须说另一面。

视频通话在人类社会里承担的是什么角色?是判断"这是真人"的最后防线。 见不到面,打个视频,看到脸,大脑就认了:这是真的。

现在这道防线被穿了。

一张实时生成的 AI 脸,加上声音,加上能感知你表情的能力,骗局的门槛会骤然崩塌。这不是我在危言耸听,是大家必须提前想清楚的事。

机会和风险,从来是同一枚硬币的两面。

这件事背后,是 AI 在穿越“存在感门槛”。

我一直有个判断:AI 能力的演进,是在一层一层突破人类感知的门槛。

认知门槛,早就过了。写代码、分析数据、写文章,AI 已经超过绝大多数人了。

感知门槛,已经基本穿越。能看图、能听声、能理解情绪,很早之前就做到了。

存在感门槛,是最难的那一层。就是那种"你感觉到对面有一个活生生的人"的感受。这不是靠逻辑传递的,是靠眼神、表情、节奏传递的。

文字,没有存在感。语音,有一点。视频,是存在感最强的媒介。

Wan Streamer 做的事,就是第一次把存在感,赋予了 AI。

这道门槛,今天被正式撞开了。

门槛撞开了,那接下来的问题就很现实了:谁来用?

Wan Streamer 是开源模型,也就是说谁都可以拿来部署,去赋予它一个角色。AI 陪伴师、AI 外教、AI 销售顾问,前面说的那些方向,今天都还没人占位。

但技术窗口绝对比你想象的短,这是每一次技术拐点之后的规律,没有例外。当年短视频刚起来的时候,也有人说“再等等,等平台更成熟”。等想明白的时候,赛道里全是人了。

如果你想搞清楚自己适合哪个方向,怎么用这类技术搭出第一个能跑的产品,破局研发了一套三天体验卡,大家可以扫码直接学习课程。

完成课程我们还给大家送几套 AI 超级个体课,先到先得👇

Image