Geek Savvy

多维度分析Sora | 通往AGI之路已经找到?

Image

Sora有啥意思没?含义?

Sora 在日语中是“天空”,引申含义还有“自由”。

Image

在Sora的官方介绍页面上,你会看到一幅令人着迷的画面:无数纸飞机在空中翱翔,它们似乎拥有自己的意志,自由地探索着无垠的天际。这或许正是OpenAI对于实现AGI(通用人工智能)的愿景——一种既自由又充满探索精神的存在。

自从Open AI 推出Sora世界模型,这玩意儿简直就是AI界的新宠儿。Sora的视频效果简直逼真到让人难以置信,就像是在科技界扔了一颗深水炸弹,一下子就把大家的热情点燃了。看来这么多关于Sora的文章、视频,今天,跟大家一起来多维度聊聊Sora!

Image

你可能会想,视频生成模型这事儿听起来好像也不是什么新鲜事,但Sora可不一样。《每日经济新闻》的记者们做了个测试,他们用OpenAI给的提示词,试了试Pika、Runway和PixVerse这些其他模型,然后再看看Sora的表现。结果呢?Sora在视频的长度、流畅度和细节上都秒杀了对手,简直就是降维打击!

那么,OpenAI是怎么做到一次又一次地推出这种颠覆性的产品呢?有个叫SIY.Z的知乎作者,他是加州大学伯克利分校的计算机科学博士,他说了一个词:scaling law。意思就是,OpenAI知道怎么让模型越大、数据越多,效果就越牛。从GPT文本生成,到DALL·E图像生成,再到Sora视频生成,OpenAI似乎已经找到了一条通往通用人工智能(AGI)的路线。

所以说,OpenAI这帮人,他们不仅仅是在玩科技,他们是在重新定义科技的边界。这就像是在说,想要打败OpenAI?可能只有他们自己能做到了。

5大场景实测:Sora实现降维打击

尹烨,华大集团的CEO,他在一篇文章里说,这就像是数字孪生世界开始融入我们的现实生活,他觉得这标志着AI发展的一个新时代,就像牛顿时代一样重要。

那么,Sora到底牛在哪里呢?因为Sora还没开放给大众测试,所以《每日经济新闻》的记者们就用OpenAI公布的那几条提示词,试了试Runway、Pika和Pixverse这几个模型,然后在街头、卡通、人物特写、动物特写和电影预告片这几个场景下做了个对比测试。结果呢?Sora在视频时长、连贯性和视觉细节上都表现得特别棒,简直就是秒杀其他模型。

许彬,英国皇家工程院的国际院士,也说Sora在生成高清长视频方面是顶尖的,无论是清晰度还是时长,目前都是第一名。OpenAI这次真的是专注于照片写实主义的技术,虽然现在说它会不会引领新潮流还太早,但至少在视频生成这块,Sora目前是无敌的。

不过,得说明一下,这次测试只是基于五个场景的提示词,而且场景和提示词的数量都有限,不同模型生成的结果也可能有随机性。还有,虽然Sora的表现很惊艳,但也有可能OpenAI是从多次生成的结果中挑了最好的一条来展示,所以看起来效果特别好。

作为AI创业者,我觉得这真是个激动人心的时刻。Sora的出现,不仅仅是技术上的突破,更是对我们这个行业的一次巨大鼓舞。我们得跟上这波潮流,看看我们自己的技术能怎么利用这些新工具,创造出什么新的可能性。

Image

视频时长、连贯性、视觉效果遥遥领先

首先,Sora能生成的视频长度是真的长,平均能达到16秒,最长的甚至能到20秒。这比其他几个模型强多了,它们生成的视频也就3到4秒。而且,Sora还能做出长达一分钟的视频,这对于做短片、广告这些内容来说,简直就是个福音。

再来说说连贯性。Sora的视频,那叫一个流畅,画面转换自然,摄像机移动得就像真的在拍摄一样。角色的动作也很自然,不会让人觉得突兀。相比之下,其他模型的视频就有点问题了,画面可能会突然跳转,或者动作不够流畅,看着就没那么舒服。

许彬院士也提到了,Sora的视频视角变换做得特别棒,能从小特写平滑过渡到大全景,而且画面中的人物或物品始终保持一致性。这在视频生成领域可是个技术难题,但Sora处理得相当不错。

最后,视觉细节方面,Sora也是做得相当出色。物体的纹理清晰,色彩逼真,整体视频质量杠杠的。比如,它生成的“女人眨眼睛”的视频,眼部的特写做得非常细致,眉毛、睫毛、眼皮的褶皱、眼袋、卧蚕和细纹,这些都做得跟真的一样,让人看了都分不清真假了。

总的来说,Sora在视频生成这块,无论是时长、连贯性还是视觉细节,都表现得相当给力。这不仅仅是技术上的进步,也是对整个视频内容创作领域的一次革新。作为AI创业者,我觉得这真的挺让人兴奋的,咱们得好好想想怎么利用这些新技术,创造出更多的可能性。

Image

从GPT、DALL·E到Sora,似乎打通了AGI的技术栈

Sora这个视频模型,它的逼真度和流畅性简直让人难以置信。这背后,Sora有两个关键的技术突破。

首先,我们得聊聊Sora的底层架构,它用的是Diffusion Transformer(DiT),也就是扩散型Transformer。你们可能知道,OpenAI的GPT-4用的是Transformer模型,而传统的文本到视频模型通常用的是扩散模型。Sora的DiT架构,就是把GPT和扩散模型的优点结合起来了。

OpenAI的官网上公布了Sora的技术报告,里面提到了一篇关键的学术论文,叫做“Scalable diffusion models with transformers”,这篇论文是去年12月由伯克利大学的William (Bill) Peebles和纽约大学的谢赛宁共同发表的。

论文地址:https://arxiv.org/abs/2212.09748

Sora发布后,谢赛宁在X平台上分享了他们的想法。他说,他们在DiT项目上并没有追求创新,而是专注于简洁性和可扩展性。他强调,可扩展性是论文的核心,优化后的DiT架构运行速度比UNet快多了。而且,Sora证明了DiT的缩放定律不仅适用于图像,现在也适用于视频。Sora复制了DiT在视觉缩放行为上的表现,这可是个大突破。

简单来说,Sora的成功不仅仅是技术上的飞跃,它还展示了OpenAI在AI领域的深厚积累和前瞻性。作为AI创业者,我觉得这给了我们很多启示,那就是在追求技术创新的同时,我们也要注重技术的简洁性和可扩展性。

再来看看Sora的另一个创新亮点——Spacetime Patch。这个概念和GPT-4的设计思路是相通的。

想象一下,Patch就像是Sora的积木块,每个Patch都是视频的一个小片段。整个视频就是由这些Patch按照特定的顺序拼接起来的。这和GPT-4的Token有点像,Token是文本的小块,GPT-4就是通过处理一连串的Token,然后预测下一个Token来生成文本。Sora也是这个逻辑,它处理一系列的Patch,然后预测出下一个应该是什么Patch。

许彬院士对记者说,通过把视频数据分割成小块,Sora就能像GPT处理文本那样理解图像。GPT对文本的语义理解是非常精细的,把这种能力用在视频上,就能让数据更灵活,同时也增强了模型的表达能力。

简单来说,Sora通过这种小块处理的方式,不仅提高了视频生成的灵活性,还让模型能够更精准地捕捉和表达视频内容。这对于我们这些AI创业者来说,是个很好的启示:在设计我们的模型时,也可以尝试这种分块处理的方法,可能会有意想不到的效果。

Image

图片来源:Sora技术报告

正如谢赛宁提到的“可扩展性”,知乎上的一位加州大学伯克利分校的计算机科学博士,同时也是知乎作者的SIY.Z,他这么说:“如果要我用一个词来形容OpenAI的核心技术,我会说是scaling law——就是说,模型越大,数据越多,效果就越棒。用一句话来总结Sora的贡献,那就是在充足的数据、高质量的标注和灵活的编码的基础上,scaling law在结合了Transformer和扩散模型的架构上依然有效。”

他认为,数据、标注、编码和底层架构都是从之前的大模型实践中积累的经验。谢赛宁在X平台上也提到,Sora有两个关键点还没被广泛讨论,一个是训练数据的来源和构建,另一个是长视频生成的技术细节。

对于全力投入AGI研究的OpenAI来说,从GPT文本生成模型,到DALL·E图像生成模型,再到Sora视频生成模型,他们可能已经摸索出了一条自己的通用技术路径。

而且,基于这些成功经验的Sora,很可能会成为未来文生视频模型的新标准。早在今年1月,一位前阿里的AI专家就在X平台上表示:“我认为,Transformer框架和大型语言模型(LLM)的路线,将会是AI视频领域的一个突破和新标准。这将使得AI视频更加流畅、一致,而且能生成更长的视频。目前的Diffusion+Unet路线(比如Runway、Pika这些),可能只是过渡的解决方案。”

Image

图片来源:X

资本狂欢——800亿美元市值

OpenAI最近的风头正劲,他们的估值在短短9个月里翻了两倍,达到了惊人的800亿美元。这背后,是他们一连串引人注目的产品发布,从ChatGPT聊天机器人到DALL·E图像生成模型,再到最近的Sora视频生成模型,每一款都在资本市场上引起了轰动。

虽然视频生成模型这个领域已经有不少玩家,比如Stability AI的Stable Video Diffusion、Runway的Gen-2 Video、谷歌的Lumiere、Meta的Make-A-Video、Pika和PixVerse等,但OpenAI的Sora一出,似乎预示着这个领域的格局即将发生巨变。

技术上,OpenAI的Diffusion Transformer和Spacetime Patch虽然不是新鲜概念,但他们是唯一成功将这些技术转化为Sora这样的产品的公司。而且,从实际测试对比来看,Sora的表现确实领先于其他模型。

资金方面,OpenAI背靠微软,融资规模和估值都在AI初创公司中遥遥领先。他们的产品之所以能够快速迭代并震撼行业,很大程度上得益于雄厚的资金支持。

Image

图片来源:每经制图

OpenAI的CEO Sam Altman在瞄准半导体领域,计划融资7万亿美元来打造自己的芯片帝国。

与此同时,Runway累计融资超过2.5亿美元,估值达到15亿美元,投资者包括谷歌、英伟达、Salesforce等行业巨头。Pika虽然只有四人团队,但估值也接近2亿美元,投资人名单同样星光熠熠。Stability AI的估值一度达到10亿美元,但近期面临财务压力,甚至传出寻求出售的消息。在这样的背景下,OpenAI似乎已经准备好在AI领域继续保持领先地位。

内容创作监管迫在眉睫

Sora的问世,预示着内容创作领域的一场革命。从电影、广告到游戏开发,再到社交媒体和教育科技,Sora的影响力将波及众多创意产业。

许彬指出,最直接的变革将在视频制作领域。无论是大片还是短视频,AI都能帮我们完成那些高风险或难以拍摄的场景。这不仅改变了视频创作的逻辑,还降低了创作的门槛。现在,即使没有视频拍摄技能的人,也能通过想象力成为出色的视频创作者。

Sora和其他AI视频模型在多个行业展现出巨大的商业潜力。媒体、娱乐、金融、零售、医疗等行业都将从这些技术的进步中受益,优化营销、改善服务、加强产品开发和风险管理。许彬甚至预测,这些技术可能为各行业创造高达2.6万亿至4.4万亿美元的价值。

然而,随着AI技术的飞速发展,监管问题也日益紧迫。Sora发布后,Adobe、Shutterstock和谷歌等公司的股价应声下跌,市值蒸发近480亿美元。这表明,AI技术对现有市场的冲击已经开始显现。

同时,AI技术的潜在风险也引起了广泛关注。视频生成技术可能被用于诈骗,人脸识别等技术的安全也面临挑战。为了降低这些风险,建立道德准则、严格的数据隐私措施和确保AI模型的透明度变得至关重要。

各国政府也在积极行动,加强AI监管。美国白宫发布了AI行政令,中国、美国、英国、欧盟等在首届全球人工智能安全峰会上签署了《布莱切利宣言》。

许彬认为,未来的重点将是增强AI的能力,同时确保其以道德和负责任的方式被开发和使用,以最大化其对各行业的积极影响。AI视频模型正朝着更负责任的AI实践方向发展,需要通过研发投资来增强AI应用的安全性和保障,采取积极主动的方法来解决社会和伦理问题。

从旧架构实现突破,Open AI 远不止于此

OpenAI的每一次创新都似乎在科技界掀起波澜。虽然视频生成模型并不是新鲜事物,但Sora无疑标志着一个重大的进步,它在视频时长、连贯性和视觉细节上的提升都是前所未有的。

令人印象深刻的是,尽管Sora的底层架构,如DiT和Patch,并非全新概念,但OpenAI却能在这些已有的基础上取得突破。这表明OpenAI以及AI算法的潜力远未被完全挖掘。

Image

Sora不仅展示了AI技术的广阔前景,也可能预示着行业变革的再次来临。然而,也有技术专家指出,文生视频模型的使用门槛相对较高,需要用户具备较强的描述能力和审美眼光,才能创作出高质量的作品。

当然,随着技术的进步,我们也不能忽视AI带来的潜在风险。更高级的技术可能为诈骗等犯罪活动提供便利,因此,建立和完善监管措施,确保AI技术的正当使用,成为了一个亟待解决的问题。

未来已来,将至已至!

Image