快刀青衣

AI教母李飞飞空间智能产品亮相,首次展示沉浸式场景生成系统,把照片变成3D世界

大家对李飞飞教授肯定不陌生。之前我曾推荐过她的自传《我眼中的世界》,也很多次提到过她,因为李飞飞教授在生成式人工智能领域占据着举足轻重的地位。

今年四月,她从斯坦福大学离职创业,之前她是斯坦福大学计算机科学系教授,同时也是美国国家工程院、美国国家医学院和美国艺术与科学院的三院院士。她擅长的是计算机视觉领域,并在2023年入选《时代周刊》100位最具影响力的AI人物。

01
李飞飞教授简单介绍

我跟还不了解她的同学再简单介绍一下,李飞飞教授最为人知的,是在2009年发布了当时人工智能史上最大的人工编辑图像数据集ImageNet。

这个数据集有1500万张图片,涵盖了2.2万个不同类别,筛选自10亿张候选图片,来自167个国家的4.8万名全球贡献者对其进行标注。要知道当年连智能手机都还是个稀罕的东西,要组织这么多人干一件这样很苦的事情,可以说是创举。

这样的数据集设计干嘛用的呢?我们都知道对于在线教育产品,题库非常重要,而这个数据集,就相当于给AI算法的题库,让不同的算法看看能不能认出来图里面哪些是猫,哪些是狗。

除了做出一个非常有用的数据集,李飞飞还在2010年创办了一项挑战赛,搭起台子让全球各大做视觉识别算法的科研团队来展示自己,后来诺贝尔物理学奖得主辛顿的算法小组就是在这个比赛中脱颖而出,才有了后来这波生成式AI的爆发。

在2019年,李飞飞在斯坦福大学成立了一个名为“以人为本人工智能研究院”的机构。今年,她更引起了业内的关注,因为4月,她开始离开学校,投身创业,专注于一个名为“空间智能”的领域。

到了9月份,她的公司正式亮相,名字非常霸气,叫做World Lab,翻译成中文就是“世界实验室”。最开始说这个企业的愿景是致力于开发世界模型。只不过大部分普通人,其实并不能理解什么叫作世界模型。

通常情况下,这种基础模型的开发需要经过长时间的研发,两到三年才推出产品都非常正常。然而令人震惊的是,从4月创业、9月公司亮相到现在,仅仅几个月,他们就在12月3日推出了首款最新的AI系统。

02

该AI系统功能

这个AI系统的功能我给同学们描述一下,用户上传一张照片后,AI就可以生成一个真实且可互动的3D场景。与现有的一些AI生成图像或视频不同,那些生成物大多是静态的,比如山洞、一辆车或一条马路。而这个新系统则能创造出持久的3D环境,就让用户拿到一张照片,就可以如同在游戏中一样进行操作和探索。举个例子,如果我上传一张北京胡同的照片,它就能生成一个沉浸式的北京胡同体验。你可以在胡同里前行、后退,视角左右移动,就像真的在北京胡同中探索旅游一样。

World Lab在官网上提到,大多数生成式人工智能工具主要用于制作图片或视频等2D内容,而他们的三维生成技术则提升了控制力和一致性。这项技术是一个重大突破。官网还介绍了几个优势,其中之一是持久性:一旦生成3D场景,它将一直存在。例如,你生成一个北京胡同的场景,从胡同走到前门大街,再返回时,场景不会改变。虽然听起来简单,但只要经常用AI工具的同学都知道,在AI领域要保持这种一致性非常困难。同样的一张图片或文字,让AI第二次生成时,很难与第一次完全相同。

另一个优势在于实时控制。生成场景后,你可以像身临其境般在其中自由移动。就像我之前提到的例子,在北京胡同中漫步,你可能会看到胡同旁边有个四合院,四合院门口有一朵花。你可以停留在花前,或者绕到另一个角度去寻找新的发现。

这种实时控制还赋予了图片强烈的纵深感。官网上展示了许多演示视频和动画,它们可以进行景深调整和推拉变焦。这有点像给我一张图片,我为你生成一个探索短视频。虽然目前无法生成音频,但已经可以调节灯光和动画效果了。

作为一家新公司,在如此短的时间内推出第一个系统,实在令人震惊。李飞飞教授也在社交平台上对此进行了评价。她表示,虽然现在很难完全通过一句话或一张图片就能生成3D场景,但这个系统确实带来了全新的感受。

03
激发更多落地场景想象力

这第一个版本的系统,重点在于激发了很多人的想象力。之前有人提到要做空间智能时,大部分人并没有具体的概念,只知道这是一个新颖的想法,但不清楚空间智能究竟能实现什么。现在看到这个系统的第一个版本,我们就能想到很多可以结合的落地场景。

例如,这个系统在教育场景中显得尤为合适。传统上,我们在学习课文时,大多数内容都是二维平面的,比如电路图、化学反应,甚至旅游景点介绍中的名山大川。然而,如果这项技术能够实现,那么未来课本中的许多内容都可以变成真实动态的3D动画。

以往,要了解一个分子式,老师需要花费大量时间制作化学反应的动画或者视频,并且需要学习复杂的软件,才能生成一个简陋的课件。而现在,这个过程将大大简化。如果有了这套系统,我只需将化学反应的平面图输入其中,就能生成一个真实的桌面场景。在这个场景中,你可以拿起烧杯,模拟倒入化学试剂并观察反应。这种体验能让学生不再依赖死记硬背来记住化学反应式。

在物理和数学领域,这种技术同样适用。比如,在物理实验中,我们可以拍摄一张电路的照片,然后生成一个真实的电路场景。这样就能直观地看到电路是否通电,系统是否有效,或者是否存在短路。

这些应用场景自然而然地延伸出来,不仅仅能用于学生的学习环境,还可以进入职业培训领域。例如,医学生或医生在查看病例时,可以通过一张图片生成立体影像。这对于骨科影像或其他医学影像来说,能够提供更为立体的视角,从不同的角度观察X光片。

当然,这只是教育领域的一部分应用。想象一下,在娱乐、休闲、游戏和电影制作中,如果一张照片就能生成全方位体验,那么开发流程将大大简化,不再需要复杂的3D建模和程序构造工作。在设计领域,我们可以举个例子:如果我拍摄了一张建筑的照片,建筑设计师就能通过这个系统立即生成该建筑的立体图像。无论是向顾客展示,还是向企业主展示,这种立体效果都能带来截然不同的感受。这就是传统平面图片无法达到的效果。这样一来,我们传统意义上的虚拟现实场景门槛就降低了,许多普通人也能体验到。

这让我想起李飞飞教授在一次媒体专访中提到的观点。她说,此刻我们正处于一个类似寒武纪大爆发的时代,因为不仅仅是文本内容,而视频和音频领域也在涌现出大量的AI应用和模型。这是一个令人振奋的时刻。

未来,空间智能技术进一步提升,将推动图像和视频生成技术蓬勃发展。比如,我用AI生成一张图片,这张图片可以立即转化为3D模型,甚至成为他人可以体验的对象。这意味着,我拍摄的所有旅行照片都可以让你以我的视角去体验秦始皇兵马俑,埃及金字塔或者埃菲尔铁塔等名胜古迹。我把他们官网的链接放在文稿后面,强烈建议大家去看一下,去理解一下这个“空间智能”的强大之处,也许你看了之后,就从你的身边想到不少新的应用场景。

【相关链接】

World Lab官网:

https://www.worldlabs.ai/blog

这篇内容依然是我在得到AI学习圈里的日更内容,这是第325篇。除了每天的AI资讯外,里面更多的是各种实操教程,从AI设计海报到AI做PPT、写文案,可以快速把AI用起来。感兴趣的话可以领下面的一张周卡去看看⬇️

Image