开源版 Veo 3来了!LTX-2 终于开源了,它可以“一次性生成最长20秒的画面 + 声音+口型同步”的完整4K高清 AI 视频。
兄弟们,这波真有点夸张。 开源版「Veo 3」来了,名字叫 LTX-2。
一句话概括:能“一次性生成最长 20 秒的 4K 视频 + 声音 + 口型同步”,还支持文字、图片、草图混着喂。
以前吹的「AI 视频要颠覆短视频行业」,现在感觉有点要落地了。
以前玩开源视频模型,基本都是几秒小短片,没声音,人物张嘴像在练口型操。 你要想做个完整片段,还得自己剪音乐、配解说、对嘴,一顿操作猛如虎。 LTX-2 的思路直接粗暴:画面、对白、环境声、音乐一次性算完,出片就能丢到时间线上。 人还在写提示词,成片已经在硬盘里躺平了。
这次最爽的地方,其实不只是 4K 画质。 是它把“声音 + 画面 + 口型”拉到了一条时间线上去。 比如你写一句: 「一个人站在雨夜的街口,自言自语:‘要不明天就辞职吧。’远处传来车流声。」 LTX-2 不仅会给你下雨、路灯、街景,还能把角色嘴型、台词和背景声一锅端出来。
更夸张的是输入方式。 你可以只打字,也可以丢一张参考图,甚至就是一张随手画的草图。 画个小 stickman、写上“跑向海边日出”,模型自己给你脑补成镜头语言。 对那些不会画分镜、也请不起美术的小团队来说,这简直是救命稻草。
很多人最关心的,还是“家用电脑扛不扛得住”。 官方给的说法是:这代在速度、更高画质和生成时长上都做了优化,还能在「普通电脑显卡」上跑。 翻译成人话:不用非得上 4090,日常游戏本、家用中高端卡也有机会体验。 虽然不能指望你 4G 小显存硬刚 4K 20 秒,但对大多数创作者来说,门槛确实比以前低多了。
速度这块,也算有诚意。 以前跑个几秒小视频,都能把显卡烤到起飞,人坐在旁边怀疑人生。 现在模型本身做了轻量化,推理效率提升,你的等待时间能肉眼可见地缩短。 对做短视频、广告 Demo 的同学来说,就是一天能多试好几版创意。
4K 画质加上动作、嘴型同步,会带来一个很现实的问题: 随便一个独立创作者,做出来的东西,观感上已经能和小工作室掰手腕了。 广告片、游戏概念视频、MV 试镜头、课程片头,统统可以自己拉。 真正拼的,慢慢就不是“谁会剪”,而是“谁想得更有意思”。
当然,爽归爽,坑也不会少。 声音是自动合成的,情绪、语气不满意,可能还得自己再处理一遍。 画面再丝滑,剧情拉胯也一样没人看。 模型帮你省的是体力活,脑力活和审美,还得你自个儿扛。
开源还有一个很可怕的加速器效果。 一旦权重放出来,社区这帮大佬肯定开始魔改: 有人做中文优化、有人做动漫风、有人加控制线、有人搞一堆预设 Prompt。 再过一阵,你在 B 站刷到的“电影感 AI 短片”,有很大概率都是 LTX-2 系列的亲戚。
对打工人来说,可能最真实的感受是: 以前一个项目要找导演、摄影、剪辑、配音、调音乐,现在很可能变成“一个人 + 一台电脑 + 一个模型”。 岗位不会一下子消失,但分工一定会重洗。 会用 AI 的视频人,和不会用的,差距只会越来越大。
说了这么多,大家可能更关心两件事: 一是,我现在这台电脑值不值得为它升级? 二是,我要不要立刻上手学? 我的建议是:显卡能跑就先玩起来,别急着一言不合就换 5090,先把提示词、镜头语言这些“软实力”练起来,升级硬件永远是第二步。
如果你已经迫不及待想整两条片子试试, 可以在评论区聊聊:你最想用开源版 Veo 3 做什么?短剧、MV、还是整点抽象整活?
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html