Z Potentials

深度|从看视频到“玩”视频:Xmax X2.0 重塑交互视频的底层逻辑

图片
Image

麦克卢汉说,"媒介即信息"。每一次真正改变世界的技术革命,都不是内容变得更丰富,而是媒介发生了变化。从纸张到电视,从互联网到智能手机,真正重构产业的,从来都不是一次参数升级,而是人与信息交互方式的改变。

今天的AI视频行业的竞争逻辑还在围绕拼画质、拼时长、拼物理规律、拼世界模型这几个维度进行。几乎所有人都在回答"视频生成得够不够真实",却很少有人思考另一个问题——视频,会不会变成一种新的交互媒介?

Xmax AI昨天发布的X2.0,或许第一次把这个问题摆到了台前。相比继续提升生成质量,它更大的突破在于,把视频从一种只能观看的内容,变成了一个可以实时交互、主动把玩的空间。它正在试图回答的,是"生成之后,人如何与内容发生关系"。这或许才是AI视频真正意义上的下一次跃迁。

01 清华系团队打造,从视频出发,重构媒介形态

在视频生成领域,主流竞争仍集中于两个方向:海外团队如 Runway、Pika 持续探索视频生成的可控性与交互效率,国内可灵、Seedance 等模型则不断突破画质、运动一致性和工业化生产能力。而 Xmax AI 选择了一条更难的路径——实时交互。

不同于传统视频生成模型“输入指令—生成视频”的单向流程,X2.0将摄像头、视频流和用户操作纳入同一个实时闭环,让AI能够持续理解环境变化,并根据用户意图即时改变画面。用户一个动作、一次触碰,模型都需要在极短时间内完成理解、生成和反馈。响应速度是毫秒级。

这背后考验的并不是单一的视频生成能力,而是模型实时推理、交互理解和时序一致性的综合能力。简单来说,X2.0需要做到:用户在操作,模型同时在“理解”和“创作”。

比如这个case里,把手机摄像头对准一起吃饭的同事,屏幕里的她变成了机械姬;

摄像头对着小狗,用手指触摸屏幕,神奇地改变了屏幕里小狗的轨迹和动态

瓦学弟不用再玩雷兹,也能在现实里Fire in the hole!

这不是预渲染的特效,也不是后期合成的画面——每一帧都是由 AI 基于摄像头实时捕捉的画面、结合用户操作即时生成。

支撑这条技术路线的,是一家典型的"清华系"AI创业团队。Xmax AI创始人史佳欣本科、博士均就读于清华大学,博士期间来自清华KEG实验室——智谱AI同样诞生于此;核心研发团队则主要来自清华KEG实验室、清华HCI实验室,以及字节跳动、阿里、华为等企业,在大模型、人机交互和实时系统方向拥有长期积累。

事实上,Xmax AI并不是第一次探索这条技术路线。早在今年2月,公司便发布了全球首个虚实融合实时交互视频模型X1,在海外开发者社区引发广泛关注。不过,当时的X1更多证明的是"实时交互视频"这一技术方向的可行性。

而时隔5个月,Xmax AI于昨日凌晨正式发布新一代模型X2.0,并同步开放商用API,意味着这项技术开始从实验性Demo走向产品化能力,也从技术验证迈向商业落地。

此次发布的X2.0开放了三大类、五项核心实时交互能力,同时支持自由Prompt,以满足更多创作和应用场景。相比传统视频生成模型"生成一次、观看一次"的工作方式,X2.0最大的不同,在于它能够持续理解摄像头输入,并实时响应用户操作,实现低延迟、多轮连续交互。它让视频不再是只能单向观看的内容,而是成为了像游戏一样可以随手把玩的全新体验。感兴趣的可前往开放平台 https://platform.xmaxai.com/  亲测体验。

02 极致的研究与工程能力,构筑实时交互模型的技术壁垒

与大多数AI产品仍聚焦于提升内容生产效率不同,X2.0带来的突破并不只是生成能力的提升,而是视频交互方式的改变,它更接近一次底层媒介形态的重构。

当然,实时交互并非没有探索者。海外的 Decart,以及国内的 PixVerse、Vivix 等团队也在布局这一方向。Decart今年 5 月刚完成 3 亿美元融资,估值达 40 亿美元,累计融资额已超过 4.5 亿美元。目前,Decart 的 Lucy 系列模型已在直播和虚拟试穿等场景中进入测试阶段。

但真正的挑战在于,实时与交互是两个相互拉扯的指标:更快的响应速度往往意味着更高的生成难度,而更开放的交互方式则要求模型具备更强的场景理解能力。

X2.0的差异化,在于将交互泛化性和生成速度同时推到极致,让AI视频从一次性生成走向连续交互。只需要抬个手,模型就能理解你的意图,并实时改变视频画面内容。这背后依赖的不只是模型能力,更是一整套从算法、推理到系统工程的长期积累。

在架构层,传统视频模型用双向 Attention 做联合建模,必须等整段渲染完才能输出,本质是"下载模式"。Xmax 改用逐帧自回归生成,把视频生成升级为"流媒体模式",响应延迟大大压缩。

这意味着,模型无需等待完整视频渲染结束,而是在生成过程中持续输出帧序列,将传统离线生成流程转变为实时流式生成。对于实时交互场景而言,这种架构变化是从“能生成”走向“能交互”的关键一步。

架构创新只是开始,工程落地才是真正的难点。实时交互视频最大的挑战,在于速度、成本和生成质量之间的平衡。Xmax 通过系统性创新,从训练、推理到部署进行全链路优化,打破了这个“不可能三角”:

  • 多阶段融合蒸馏:缩减采样步数,推理延迟大幅下降

  • 上下文持久化:长时推理质量几乎不衰减

  • 注意力稀疏化 + FP8 量化:单张消费级显卡满血运行

这些优化共同降低了实时视频生成的计算成本,也让AI视频从实验室Demo走向更具规模化应用潜力的产品形态。

如果说实时性是性能壁垒,那交互性就是场景壁垒。Xmax 提出的统一交互架构,把视频模型从"Prompt 翻译器"升级为全能的视频流操作系统:看懂摄像头画面、解析视频流、识别手势交互、生成全新效果。团队通过自建高质量多模态训练数据 + 多任务训练,验证了模型的涌现和泛化能力。理解 + 生成 + 实时反馈的闭环,让X2.0天然适合成为下一代人机交互甚至是下一代内容媒介的底层基础设施,而不是视频创作链路上的单一环节。

通过训练与推理链路的协同优化,Xmax进一步将实时交互能力推进到端侧部署,在最新款 iPhone 上实现了 384 分辨率、16fps 的本地实时推理。实时视频交互不再完全依赖云端算力,而开始具备进入消费级设备的可能:一方面,本地计算降低了云端调用成本,提升了大规模应用的经济性;另一方面,数据无需离开设备,也为隐私保护和合规应用提供了更好的基础。

将 Decart 与 Xmax AI 进行横向对比可以发现,两者的商业化成本存在明显差异。以一小时的调用成本计算,二者价差高达 12 倍——值得注意的是,这一价格对比还是在 Decart 基于 720p 分辨率定价、而 Xmax AI(X2.0)基于更高清晰度的 960p 定价的前提下得出的。Xmax AI 凭借这一成本优势,为实时交互模型的规模化落地与普及提供了更具可行性的方案。

Image

这些变革意味着,实时交互AI不再是顶级AI厂商的前沿研究赛道,而是真真切切可以被亿万普通人使用的全新媒介。

03 直播与电商的“结构性变天”:实时视频交互离搞钱还有多远?

极致实时、零门槛交互、虚实融合、端侧推理——这几个关键词背后,是视频社交、游戏、直播、远程协作、智能硬件、虚拟陪伴、手机等多个万亿级场景的入口级机会。而在这些方向中,直播、电商和虚拟陪伴可能是最先产生商业价值的领域。

以直播场景为例,中国直播间日活超 3 亿,但玩法却像停留在二十世纪:发弹幕、刷跑车、连麦。所谓的互动,不过是在视频流上叠了层“五毛特效”的滤镜。平台不是没有考虑过这个问题,快手卷弹幕游戏,抖音抠道具交互,但都没逃过“评论区社交”的旧逻辑。归根结底,是因为传统视频流是单向的,只能停留在观看层面。

而当 X2.0 的实时交互能力杀入,直播间对用户来说,将从单向的观看体验,升级为双向的互动输出,达成千人千面的直播体验。

这个视频里,观众弹幕喊一声“变身”,主播瞬间化身宿傩,表情神同步。

在 Free 模式下,弹幕不再仅仅是文字符号或者观众愿望,想让主播眼睛射激光,直播画面会实时根据语义生成视觉反馈。

对于平台和观众体验而言,这是从“单向观看”到“双向输出”的交互变革。内容不再是主播单向输出,而是由每个观众的指令实时控制,每个用户都可以对直播画面进行特定的干预和实时修改,实现真正千人千面的消费体验。

对于电商行业,技术变量也将带来全新的机会。一直以来,女装电商的退货率一直是所有网店店主和平台的心病,每年近千亿的逆向物流费用和损耗,虽然阿里、京东折腾过 3D 建模试穿,还上线了照片试穿(AI生图换装),但这些体验都相当于玩动态贴纸,参考价值并不大。

Xmax的逻辑很简单:调用摄像头,ClothX 能在保留你真实体型、动态、光影环境的前提下,实现秒级换装。不是静态图,而是你动一下,衣服的褶皱和垂感也跟着动,随着肢体运动可以完整观察到衣服的各个角度,真正给消费者身临其境试衣的感觉。

这个能力给电商生意打开了新的想象空间:一方面,可以在详情页一键试穿,直播间主播远程带货,线下智能镜实时引流。另一方面可以带来明显降本增效,只要实时试穿能压低哪怕 5% 的退货率,省下的运费就足以覆盖 API 调用成本。

除了直播和电商,陪伴一直都是女性甚至年轻群体里不容小觑的大市场,但现在的AI 陪伴产品的体验暂时都还停留在聊天阶段,角色被困在屏幕里,你玩你的,它聊它的。

X2.0在做的,是让虚拟角色“下场”。 手掌拂过桌面,小精灵凭空出现,它能识别你的手势,响应你的触碰。不需要进行昂贵的 3D 建模和动作编排,仅仅通过小小的摄像头,就能让你拥有虚实次元融合的体验。

这种轻量级的技术路径,意味着它能长在任何设备上:比如在手机终端: 按一下,召唤一只虚拟小猫和你互动

同时还能互动不再只停留在chat阶段,X2.0可以透过摄像头让平行时空的你们穿越次元相见,

上述场景只是冰山一角。媒介底层逻辑的跃迁,意味着过去所有基于“屏幕”的行业,都值得用 X2.0 重做一遍。比如打造沉浸式短剧,观众可以一键将男主替换成心仪的男神,甚至让自己成为剧集的一部分。

还可以将现实世界“赛博化”, 在景区,互动屏幕能一拍即合生成古装分身;透过智能眼镜,乏味的通勤街景能瞬间变为“赛博朋克”的科幻世界。

X2.0 在做的,是在打破“看”与“玩”的边界。当同一个模型适配足够多的终端,实时互动视频就不再是一个功能,而是一个巨大的全新的产品形态窗口期。

04 媒介已变,未来将来

回顾互联网的演进,每一次媒介的巨大变化,都催生了万亿级的商业帝国。

在 PC 时代,网页、搜索引擎构筑了早期互联网的基础;到了 移动时代,智能手机的普及与 4G 网络的爆发,将交互界面从桌面转移到了掌心,催生了短视频平台等超级 App,开启了移动互联网的黄金十年。

如今,历史正在开启新的篇章。当AI解锁了全新的生成式计算能力,当视频不再是预制的资产,而成为可以实时演算、实时交互的全新形态,视频这一媒介正在发生前所未有的变化。观众与画面的关系从单向的——你可以选择看什么,却无法改变正在发生的事,逐渐演变成双向互动——你的一举一动影响着视频画面和内容的演进,每个消费者都可以随时随地参与到内容当中。

随着 Xmax X2.0 全面开放 API,实时交互视频的底层基础设施已然就位。至于这块全新的界面上,最终会长出怎样颠覆性的产品与生态?目前还有太多未知。但这,恰恰是这个开放平台最迷人的地方。

(产品传送门:https://platform.xmaxai.com/)

图片
图片
图片
图片
图片
图片