1、OpenAI推出文生视频
2024年2月16日,OpenAI推出一款名为Sora的文字生成视频的新模型。虽然没有召开新闻发布会,但迅速引爆互联网和朋友圈。
为啥?因为过于逼真,就像是真实摄像机拍摄出来的。虽然在很多示列中发现有bug,这个我们后面会说。
OpenAI还特别强调,所有视频均由Sora直接生成,未经修改。我们先来感受下这段60秒的视频,行走在东京街头。
提示词:“一位时尚女性走在充满温暖霓虹灯和动画城市标牌的东京街道上。 她穿着黑色皮夹克、红色长裙和黑色靴子,拎着黑色钱包。 她戴着太阳镜,涂着红色口红。 她走路自信又随意。 街道潮湿且反光,在彩色灯光的照射下形成镜面效果。 许多行人走来走去。”
2、Sora是什么?
简单说,Sora是一个 AI 模型,可以根据文本指令创建现实且富有想象力的场景。目前,OpenAI展示了Sora生产视频的能力,肯定还有其他的能力没有展示。
Sora可以创建长达 60 秒的视频,其中包含高度详细的场景、复杂的摄像机运动以及充满活力情感的多个角色。
提示词:“一只猫叫醒熟睡的主人,要求吃早餐。 主人试图忽视这只猫,但猫尝试了新策略,最后主人拿出了秘密藏匿的零食。”
接前文中说的bug,细心的网友发现这段视频中,猫咪有两只左前爪,就像是ChatGPT 刚发布时,它不会算数等等,但我们见证了大模型的进化速度。
还是以视频为例,这段画面过于逼真,很多人惊呼,现实不存在了,你认为呢?
提示词:“与中国龙一起庆祝中国农历新年的视频。”
OpenAI称,Sora能够生成包含多个角色、特定类型的运动以及主体和背景的准确细节的复杂场景。该模型不仅理解用户在提示中所要求的内容,而且还理解这些事物在物理世界中的存在方式。
4、Sora是如何工作的?

OpenAI官方称,Sora是一个扩散模型(diffusion model),它从看起来像静态噪声的视频开始生成视频,然后通过多个步骤消除噪声来逐渐改变视频。该技术的工作原理与 ChatGPT 提供支持的 GPT 语言模型类似,它们都使用“变压器”架构(transformer architecture ),一种接受输入并将其“转换”为输出的神经网络。他们还融入了 DALLE-3 的元素,例如recaptioning system。关于更详细的资料,可以访问参考2,小编我也在学习中。OpenAI表示,目前只有一小部分视觉艺术家、电影制作人和设计师获得了Sora的访问权限,但并没有公布开放时间。
OpenAi考虑到生成如此逼真的视频,还需要经过充分的安全测试,在正式发布之前,他们需要采取重要的安全措施,目前正在与红队成员合作,他们是错误信息、仇恨内容和偏见等领域的专家,他们正在对抗性地测试该模型。OpenAI 还表示,它正在开发一种人工智能视频检测分类器,可以识别视频是否由 Sora 制作。[1]https://openai.com/sora
[2]https://openai.com/research/video-generation-models-as-world-simulators[3]https://tech.co/news/what-is-sora