新模型Vidu直逼Sora,生数科技:还说“中国sora”就太没想象力了【内附Vidu逐帧拆解】
作者|
周一笑,
丸
丸柚贝
逐帧拆解对比Vidu与Sora
在今年3月12日的一次交流中,生数科技联合创始人兼CEO唐家渝曾对我们表示: “今年内一定能达到Sora目前版本的效果,但很难说是三个月还是半年”。 据我们了解,生数三月份就实现了8秒的视频生成,在四月份突破了16秒生成。今天的发布背后,短短两个月时间完成巨大进步。 这次的展示中,到底有哪些细节值得关注,我们第一时间逐帧对比了Vidu与Sora,话不多说,先来一起看一下。经典走路名场面
Sora这个街头美女走路的视频也是刷爆的各大社交媒体,Vidu一出来就贴脸开大!不光生成街头美女走路,街头帅哥走路就连街头熊都给整出来了! 首先从人物、背景来看,Vidu的生成效果真的和Sora不相上下,但是人物动作协调性与Sora相比还是稍弱一些。
Vidu
Sora
行驶中的越野车
越野车在丛林小道中穿梭,Vidu的丛林背景略有3D动画的效果,更像游戏中的一些场景,Sora的背景更具真实性一些。
Sora
中国龙
这一视频场景,二者生成的风格不太相同,Vidu展示的是现实中虚拟龙的形象,Sora是现实中舞龙舞狮真实存在的场景,但是二者对于龙的形象各种细节也都展现出了各自的特点。 另外,除了主体龙之外的背景两者都很真实,但是Sora的视频画面丰富度更高。
Sora
人物眼睛特写
这谁能分得清是真实拍摄还是AI生成啊!这一局我感觉Vidu真的不输Sora!
Sora
电视合集
Vidu确实是不怕对比的!这个画面丰富度和运镜真是一点不比Sora差。
Sora
狗狗
Sora生成的狗狗动态感、真实感更强一些,但是Vidu对狗狗游泳腿上的毛漂浮的细节处理的也相当不错。
Sora
Vidu所展现是“带珍珠的猫”,虽然有点玄幻,但是镜头旋转之后,毛发细节感也是表现不错。
Sor
a
船与“海”
Vidu 的波浪流动十分符合物理规则。可以说与 Sora 不相上下。 而且,这里两者都提供了Prompt,可以直接对比,也能看到很多有趣的不同。
宇航员
Vidu更突出的是宇航员在太空生活的状态,Sora则更突出宇航员的人物脸部特写。
Sora
Vidu如何炼成: 正确的技术路线+工程技术迁移
这次发布的视频,所有人肉眼可见的效果大幅进步,背后是如何做到的? 这看起来的突破其实是生数长期积累的结果。 OpenAI Sora的DiT架构融合了Diffusion和Transformer,不仅能够实现与GAN相媲美的图像生成质量,而且还具有更好的扩展性和计算效率。而通过使用Transformer结构代替传统Diffusion模型中常用的U-Net结构,DiT能够以更高效的方式处理数据,尤其是在处理大规模数据时,能够显著减少所需的计算资源,同时在视觉任务下展现出卓越的涌现能力。 在技术路线上,Vidu采用了和Sora完全一致的Diffusion和Transformer融合的架构。Vidu的底层基于生数自研的U-ViT架构,该架构由团队在2022年9月提出,实际上U-ViT是第一个融合了Diffusion 和Transformer的架构,比Sora的DiT架构更早。