硅谷一线观察:Sora小秀肌肉惊艳,但还不能理解物理世界
田渊栋:感谢你们对Sora的兴趣,最近这个方向确实很火,谈论的人很多。首先要声明我一直以来主要做优化,搜索和表示学习,还有可解释性,最近开始做一些大语言模型在训练和推理时的优化,包括算法和系统方面,并不是专业做文生图/视频的。因为Sora用了Transformer作为骨架,让我有一些兴趣,但我只是作为一个旁观的研究员看一下最近的进展,给一些比较外行的评论。
总体来说还是很惊喜的。过去的文生视频都比较短,但Sora能达到一分钟。这一分钟的视频基本上没有完全重复,包含大量视角转换,镜头拉近和拉远,以及物体的动作,动作也相当大,这是一个很大的进步。
在Sora发布之前,其他团队可能已经尝试过生成几秒钟的视频,不会太长。这几秒钟的视频通常也仅限于使用同一张照片,稍微调整镜头,让人物或物体产生一些动作,或者展示水的波浪等特效。相对而言,这种视频更像是动态图,而不是真实的视频。Sora这次生成的视频看起来像是真正的视频,这是一个很大的区别。
《知识分子》:按您过去的估计,AI生成视频达到Sora现在的水平需要多久?Sora的进展比您预期的快吗?
田渊栋:是的,Sora的进展比我预期的快。我原本认为按照正常速度,达到现在这个水平可能需要一两年,但他们做得很快很好,出乎意料。
《知识分子》:Sora和过去的AI生成视频相比优势在哪里?
田渊栋:Sora的优势在于它并不是简单地预测下一帧,而是一次性预测整个视频序列。这种方式其实很有趣,它与通常的预测方式有所不同。
过去很多AI生成视频的做法是先有照片,然后再预测照片的下一帧,把照片扩展成一个视频。实际上很多时候根据照片做预测效果和能力有限,而像Sora将整个视频通过扩散模型(Diffusion Model)一起生成,可以保证前后的连贯性和一致性达到最佳状态。
一致性指的是,如果视频第一帧中有一个人,最后一帧也应该有这个人,在整个时间段内这个人是连贯的。举个例子,在Sora的某个视频中一个女士在东京街头漫步,她的表情、特征等应该在整个过程中保持一致。
实现这种一致性并不容易,因为如果仅仅预测下一帧,特别是在视频很长的情况下,会出现compounding error(累计误差),可能导致变形、失真,甚至出现画面模糊等问题,这些都是之前的模型面临的挑战。从一张照片扩展成一个视频,一定会遇到一致性的问题。另外一个问题是视频不能太长,太长的话整个视频的质量都会下降。
但是现在通过一次性生成整个视频,让视频的一致性有了空前的提高,这是一个空前的进步。这次Sora视频出来之后,虽然还不像人类做的视频那样有情节,但一致性表现得非常好。
《知识分子》:这是通过什么技术或原理实现的?
田渊栋:Sora采用了Transformer架构加扩散模型进行视频生成,它的做法是将输入的三维视频先逐帧转换为潜在的Token表示,形成一个Token序列,然后用Diffusion Transformer结构,从随机噪音开始,逐渐生成整个视频序列的所有帧的Latent Tokens表示。这种做法的好处是它并不是逐帧预测,而是一次性生成整个视频序列,这种方法很有意思,现在看起来能保证整个视频长程的一致性。
Sora的视频生成过程借鉴了扩散模型在图像生成领域的思路。扩散模型能够通过逐步去噪的方式,从纯噪音图像开始,通过逐步去噪并引入条件信息,让图像向着指定方向进行演化,一步步生成清晰的目标图像。视频实际上就是三维的图片,通过将视频视为三维的图像数据,Sora采用类似的去噪过程逐渐生成整个视频。每一步生成的信息取决于给出的条件信息也就是文本描述(prompt),文本描述不一样,视频的内容和结构也不一样。
这种方法生成视频不需要以具体的某张照片作为基础。这倒不是什么特别令人惊讶的事情,因为文字生成图片也是类似的过程,是根据文字提示无中生有直接生成图片。当然在训练阶段是利用了大量图片,记录了很多文字和图片结构的对应关系,才能在生成阶段从文字直接生成图片。
现在图片生成文字或者视频生成文字已经有了相对成熟的内部应用模型,有了这个模型之后就能把视频转化成大量的文字数据,再逆向训练文生视频。Sora团队也利用了这些模型,这在他们的技术报告里也有体现。
《知识分子》:在人工智能的生态里,Sora处于一个什么位置?
田渊栋:每个工作在人们心目中的地位是不同的。有些工作是基础性的,而有些工作则是在拓展边界。我觉得Sora属于拓展边界的工作,它让人们认识到这项工作是可以实现的,就会有更多的人愿意在上面花时间,把它做得更好。
Sora起了一个非常好的示范效果,它可能有巨大的影响力,让人们相信人工智能是有前途的。人们愿意投入时间和精力来从事这项工作,资本市场也愿意进行投资,而人们也愿意购买相关产品。这当然对整个领域起到了很大推动作用。就算现在生成视频还比较贵,但我相信以后推理成本是会大幅度下降的。
《知识分子》:即使是不在人工智能行业的人,对于2016年火爆的AlphaGo也记忆犹新。最近出圈的大模型ChatGPT和Sora,也得到了普通人的关注。作为一个从业者,对于AI发展的进程,您的内部观察是怎样的?
田渊栋:其实有很多水面下的工作没有被关注,所以大家会觉得AlphaFold、Sora都是技术上的爆发。实际上背后一直有许多技术工作在做,很多不错的工作也会在圈内受到关注,只是这些工作没有像Alphafold、Sora那么火。等到Sora这些成果火出圈了,大家才突然发现那些低调的技术工作对行业的贡献。
比如,过去已经有预测蛋白质结构的比赛了,但直到AlphaFold的出现,这些比赛和它的成果才真正引起轰动。AlphaFold本身也用了Transformer,用了类似BERT那样的先加噪音然后重建的损失函数,没有前人把比赛建立起来,把数据集做出来,把计算的框架和深度学习的工作都做好的话,这些成就是不可能实现的。这些工作都是逐步积累、一步步完成的,Sora的工作也是如此。
Sora用到的Diffusion Transformer (DiT)是谢赛宁(加州大学圣地亚哥分校博士,曾是Meta的研究员,现任纽约大学报计算机科学助理教授)和实习生一起做的工作,主要发现是它的scaling的能力不错。但之前DiT在计算机视觉领域没有那么火。后来DiT的一作成为了Sora的核心成员,自然会想到用之前的工作,有效果之后就突然就火起来了。对圈内人来说,Sora的技术都是有历史积淀的。
包括Sora这套方法,先把视频转化成三维token阵列,然后把这些latent space里的token连在一起放进Transformer里面,然后用diffusion process来从噪音开始重建。这个方法其实以前也有人试过,我们的一些过去的文章也有这种做法,不过主要的目标不是图像/视频生成,而是用来建模智能体将来可能会走的路径(也就是所谓的“世界模型”),然后来做决策,比如说最近我们在ICLR’24上发表的H-GAP[2]及Diffusion World Model[3],等等。这些方案的共同优点是能保持整条路径的长程一致性,不会因为路径很长产生compounding error。
所以Sora利用的技术过去都有,如果没有OpenAI做出来,迟早也会有另外团队做出来。只是这个方式可能没有那么激进,会用一些温和的方法做出来,效果没那么好,但慢慢也能做出来。技术是一直在进展,只是说这些工作现在出圈了,让大家觉得有很厉害,但是它其实是继承在过去大量的技术积累基础上产生的。
《知识分子》:之前的模型没有做到这一点,是技术上无法达到,还是思路上存在盲区?
《知识分子》:在Sora出现之后,国内AI领域有一些反思的声音认为国内对AI的信念不够,在没有先例之前只敢做小规模的探索。您怎么看待这种说法?
田渊栋:容错性确实是个问题。追赶者往往会觉得我什么事情都要听,最好是到各种渠道听到别人怎么做的,我就跟着做,这样其实永远追不上别人。
另外一点是心态上的问题,国内有些的公司可能确实资源不够,但更多时候问题出在想法上。很多公司第一的想法是我一定要追上前面的人,但是这个思路其实不对的,做研究不能天天想着追上前面的人,我觉得应该换种想法,想想我能不能做出我们这边有特色的东西,
Sora那几个领头的人本身就是顶刊顶会论文的一作,他们是有自己的研究方向的,做模型的时候当然会沿这个方向去想,并不会去照抄之前的那些人的工作。所以他们跳出了思维的局限,用更多的资源,一下子把整个视频生成出来,这和过去的生成视频是非常不一样的东西。
OpenAI目标似乎不是赚钱,他们的目标很远大,想搞AGI。搞AGI是个大方向,可以有很多发展。至于要不要赚考虑商业化,现在他们有钱,也许以后会考虑商业化。他们可以考虑提供服务,给人付费生成视频。以前拍电影需要整个团队,现在你说几句话就能做个短片,这个就效率很高了,只要成本够低,肯定会有人愿意去买。
《知识分子》:在美国有很多像OpenAI这样的公司吗?这类并不急于追求商业化,而是有着更宏大的目标,而且持续有资金支持它们的目标的公司。
田渊栋:是的,在美国有很多这样的公司。问他们在做什么的时候,他们会说要做AGI。也有很多公司不缺钱,找了一些大佬来投资,之后很长时间不干预很正常。相比之下,国内可能更加希望回报快一些,给了钱就希望立刻翻倍。
《知识分子》:Sora在国外的热度似乎没有国内这么高?
田渊栋:国内可能有一两个点特别火,突然间大家都在谈论这个问题,像Sora就是一个例子。相比之下,国外就比较多元,有的人就不管什么热门,他就好好做自己的,不会去跟着热点跑,所以相对来说热门不会有那么大的影响力。
《知识分子》:OpenAI的成立有9年了,一直在烧钱。国内也有一些AI领域的投资机构,但很少有坚持这么久的,甚至有投资多年的机构突然解散的。这一点还挺不同的?
田渊栋:对,这可能是中美之间的区别。在美国,公司对自己提出的承诺应该要遵守的,这从某种程度上来说是一个招牌,会持续不断地吸引人过来。如果因为公司的一些原因,导致原来做研究的部门的员工去做产品了,那样公司的声誉就会受到影响,比如说2014年的时候,微软突然把硅谷研究院裁撤了,这就导致很长一段时间微软失去了信誉,很多顶级的人不愿意过去了。
之前在公司比较艰难的时候,我们公司也问过我们(研究组)要不要去产品组,但我们都坚持要留着做研究,公司也不能把我们怎么样。这种坚持也是会给公司带来很大收益的,比如LLaMA就是让公司能够在关键时刻拿出来的成果。所以不会出现上面让你干什么,你就得干什么这种情况,还是有相当的自主性的。
《知识分子》:在美国,公司不遵守规则你可以选择离开,还有其他的选择。在国内,研究人员好像没有这么多选项。要么就进研究机构,要么就进高校,能够支持你做基础研究的公司并不多。
田渊栋:国内做人工智能的机构,整体上还是没有像美国这种规模这么大,提供这么多机会。最顶尖的研究员在市场上有各种选择,公司必须顺应这些研究员的选择,因为没有他们的工作,公司的估值就会下降。如果一些公司做出出格的事情,可能就招不到好的研究员了,那公司会迅速滑落到第二甚至第三梯队,这是公司不能接受的。
这样的环境下,在这些最顶尖的人里面,能够坚持自己理想的人是多的,他不愿意为放弃这个理想去做其他东西。相比之下,在国内竞争激烈,个人可能会面临为了生计而不得不妥协的情况,也缺乏话语权表达自己的诉求。
另外,在美国,各方都在进行博弈,包括员工与老板、老板与大老板、公司与员工之间的博弈,最终会找到一个平衡点。这种平衡点有助于避免侵犯对方权利,维持良好的工作环境。我们经常会看到美国各种乱,各种公开吵架,其实正是这种博弈的体现。
在国内情况可能不同,因为个人可能难以形成团体,没有团结起来做一件事的能力,大家也宁愿听别人的,而不是自己去独立思考问题,尤其是从第一性原理出发去思考问题,形成独到见解和观点。这就会导致在一些问题上可能会一边倒。
《知识分子》:大模型和Sora引起了各公司和机构复刻的热潮,可以说它们指出的方向是现在AI研究的主流吗?
田渊栋:肯定有很多人愿意去做。但并不是说硅谷所有人都愿意跟这两个方向,或者说愿意跟最火的方向。大模型确实很多人在跟进(包括我自己),可以算渐渐成为主流;但要是说Sora是主流,估计很多人都不会赞同的。在自己的方向上坚持很多很多年,这正是创新的源泉所在。深度学习之所以能在2012年开始爆发,代替了以前广泛使用的特征工程和线性分类器,也是因为有“一小撮”研究员们长达十几年的坚持。
在人工智能领域还有许多其他方向值得做,可供选择,例如大型模型面临着多方面的挑战,包括高效训练,快速推理,还有安全性等问题;如何提升模型的安全性、推理能力,如何解决一些现有方案难以解决的多步推理问题,如何与已有的推理和求解器高效结合以达成最优决策,等等。这些我们都在做,像我们最近发布的省内存预训练方案GaLore[4],仅用350M参数进行预训练并有不错效果的MobileLLM[5],还有能让Transformer学会通过搜索和规划来解决难题,并以比传统算法更快的方式得到最优解的Searchformer[6],等等。
[1]https://freedomandsafety.com/en/content/blog/how-has-ai-developed-over-years-and-whats-next
[2]https://arxiv.org/abs/2312.02682
[3]https://arxiv.org/abs/2402.03570
[4]https://arxiv.org/abs/2403.03507
[5]https://arxiv.org/abs/2402.14905