哔哩哔哩技术

上交胡强老师受邀分享生成式智能媒体的最新进展

哔哩哔哩技术

今年B站1024程序员节,举办了一场别开生面的B站技术主题分享演讲活动。在分享会现场,特别邀请到多位重量级技术嘉宾阵容亲临,与程序员小伙伴分享技术知识,共同探讨应用与趋势。

在元宇宙和生成式智能媒体技术方向,我们有幸邀请到了上海交通大学未来媒体网络协同创新中心的胡强老师,亲临公司为B站小伙伴分享了该领域内的最新进展。胡强老师所在团队与中央广播电视总台国重实验室紧密合作,他还担任 8K 3D视频增强制作及显示项目负责人,在该领域有丰富的科研和实践经验,下面是胡强老师精彩的分享内容。

Image

大家好,非常感谢B站的邀请,能够参加这次的程序员节活动非常荣幸,我很高兴能够站在这里,与大家分享一些关于神经辐射场与生成式智能媒体技术的一些研究进展。

一. 自由视点场景的神经辐射场

这次的分享主要分为两个部分,第一个部分是用于自由视点场景的神经辐射场。那什么是自由视点呢?自由视点是建立在多视角视频数据采集的基础上的,通过利用图形渲染技术,使用户能够以自由、交互和沉浸的方式体验虚拟场景。

Image

为了实现自由视点,通常需要依托三维重建技术,通过建立场景的三维表示来实现。这个表示可以分为显示的和隐式的两种方式。显示的表示包括图像、视频、网格、点云、体积、八叉树等。而隐式的表示包括 SDF、NeRF、神经光场等。还有一种混合的表示方式,例如 PlenOctrees、Plenoxels、TensoRF、Instant NGP等。而基于NeRF场景表示方法的主要优点在于生成的三维模型质量高,逼真度高,具有高交互性,并且能够以真实的物体纹理细节在任意角度呈现。

Image

为了更好地理解NeRF,让我们回顾一下NeRF的基本原理。NeRF是2020年ECCV会议的最佳论文,它致力于解决新视图合成的问题。NeRF提出使用隐式神经场来表示场景或物体,然后利用体渲染公式将颜色场和体密度场渲染为图像。

Image

NeRF的主要优化过程其实就是当你给定我一个有限级的各个视角的图像,那么我可以基于这样一个图像进行采样,可以得到很多的坐标以及它的一个方向,从而构成一个5D输入。

这样的一个5D输入会直接投入到一个多层感知机(MLP)中,MLP的权重就可以用于表示一个场景或物体。 那MLP的输出是什么呢?MLP的输出其实就是这个位置在这个入射光线方向下的颜色和体密度。

然后呢,我们将使用体渲染的方法,对于我们刚刚得到的这样的一个颜色和密度进行渲染,得到一个图像。因为我们有原始图像,同时我们还得到了一个渲染图像,那我们就可以对二者进行损失的计算,那这样的话其实就可以完成NeRF的一个训练。一旦完成了NeRF的训练,该模型就可以用来合成具有新视角的场景或物体。

Image

NeRF之所以能够实现出色的渲染效果,有以下几个关键因素。 

首先,深度神经网络通常倾向于学习图像中的低频信息,而难以处理高频信息。为了解决这一问题,NeRF采用位置编码的方法,将位置信息映射到高频空间,从而有效提高了渲染图像的清晰度。

其次,NeRF以连续的3D模型来表示场景,这意味着它可以更好地捕捉场景的细节。它不仅能够生成逼真的外观,还能够呈现出场景中的微小结构和纹理,使渲染结果更真实。 

它的另一个优点是,一旦训练完成,NeRF能够根据任意视角生成2D图像。这意味着用户可以以自由的方式在不同视角下观察和呈现场景,实现了高度的交互性和自由视点浏览。 

最后,NeRF的渲染过程计算量很大,每条光线需要采样多个点,但实际上,光线上的大部分区域都是空区域或者被遮挡的区域,对最终颜色贡献有限。因此,NeRF引入了“coarse to fine”分层采样策略,通过同时优化coarse网络和fine网络,有效减少了计算负担,提高了渲染效率。

Image

然而,尽管NeRF在渲染中表现出色,它也存在一些局限性需要解决。

首先,对于有大量动态内容和复杂反射的物体呢,NeRF可能无法处理得很好。

其次,3D场景数据量巨大,高效的数据压缩对于体积视频的应用至关重要。这有助于减小数据传输和存储成本,特别是在需要实时流式传输和渲染时。

最后,训练和渲染NeRF模型需要大量的计算资源,导致终端呈现困难。

为了解决这些问题,接下来将介绍在自由视点场景的高质量生成、实时呈现和交互等方面的一些研究工作。

首先,关于生成质量,提出了一种端到端的神经网络渲染方法,它可以从低精度的三维点云中生成高质量的自由视点图像和视频。

当我们生成了高质量的场景模型后,我们怎么来呈现给用户呢?或者说怎么样让更多没有高端显卡的用户也能体验NeRF的效果?一种技术路径就是云渲染的方法,通过借助NeRF高效的表征能力以及云平台强大的计算能力,来实现更高效、更出色的云辐射渲染能力。渲染的画面会经过低延时编码和使用WebRTC协议进行低延迟传输,最终呈现给用户。

当完成了静态场景的表达和呈现后,很自然的就会想到如何来对动态场景进行建模,从而以实现跨设备的实时流式传输和渲染。现有方法都是在本地将整个动态场景全部加载到显存进行渲染,只能支持几十帧的动态场景,且不支持流式传输。最新有效的方法则将动态场景表示为一个关键帧和后续若干帧间的残差信息,然后将这些信息经过dct、量化、熵编码后传输到终端进行解码和渲染。而解码和渲染仅仅只需要依赖于前一帧重建的数据就可以完成,通过这样的设计,可以实现紧凑且可流式传输的长序列动态场景神经辐射场。

最后,在自由视点视频的实时呈现与交互上,还提出了边云协同自适应编码与传输的系列方法,使自由视点视频在呈现质量、交互延迟、传输带宽和计算资源等方面具有显著优势。

二. 生成式智能媒体

在计算机视觉领域,NeRF技术架起了一座基于数据驱动的桥梁,将2D图像与3D场景相互联系。与此同时,在自然语言处理领域,近年来也爆发了一场同样基于数据驱动的重大变革。从文本到图像再到多模态,从学习先验知识走向了生成智能。

Image

生成式AI,国内通常称之为AIGC,除了ChatGPT文本生成外,图像、视频领域的AIGC也在快速发展,例如Open Ai的图像生成DALE-2,  AI绘画Midjourney,文生视频VideoGPT,以及内容编辑等。

Image

文生图指的是输入一段文本和提示词(prompt)给模型,模型生成一张符合文本描述的图片。Stable Diffusion 是其中的一个代表性的开源模型。他使用CLIP预训练模型作为编码器,将输入的提示词编码到特征空间中,通过添加噪声、去噪进行自回归的学习。

Image

文生视频的任务和文生图类似,给定一句提示词文本,生成一段符合描述的视频。目前直接的想法是将文生图扩散模型推广到视频上,叠加合成多帧,但效果目前并不理想。一方面目前用于文生视频的数据集较少,并且用文字来描述一段视频这件事情本身很难,导致用于训练的视频都很短。另一方面图像生成直接推广到视频生成,短期的帧间连续性和长期的时间连续都很难保持稳定。

Image

另一项重要研究领域是文生3D,最具代表性的工作之一是Google与伯克利合作的DreamFusion。这是一篇大佬云集的工作,它的作者包括了NeRF原始论文的作者和DDPM原始论文的作者。

DreamFusion可以简单定义为NeRF加上Diffusion。这个图呢,我们不用管它左边画的一些模块,比如打光、shading这些东西,我们把左边的所有的一部分都当做NeRF就好了,那NeRF的作用是什么呢?它的作用就是当给定一个随机初始化的NeRF之后就进行训练,然后渲染一个对应场景的图像。那一旦NeRF在训练过程中得到了一个对应场景的图像,我们可以向这个图像添加高斯噪声。有了这样的一个加噪图片之后,就可以输入到Diffusion模型中。那Diffusion模型在这里角色是什么呢?它在这里的角色可以理解为一个Teach model,用来指导NeRF的训练,也就是说它是用来打分的或者说用来计算损失的,扩散模型的参数实际上是不更新的,是block掉了的。那么,我们具体要更新什么呢?实际上我们要利用Diffusion模型,基于NeRF生成的带有噪声的图像以及目标文本来计算损失,这个损失实际上将用于计算NeRF的梯度,也就是说我们要在反向传播中使用Diffusion模型计算的损失值来更新NeRF的参数。

Image

现在,介绍一下上海交大团队与中央广播电视总台国家重点实验室在生成式智能媒体领域的创新研究成果和初步探索。 

首先是基于扩散模型的人脸修复增强,对于以往拍摄的老电影、老电视剧,场景退化问题复杂且多样,比如说人物模糊、雪花噪声等。过去的人脸增强模型处理效果不佳。为了克服这一问题,我们采用了一种融合了两种模型的创新方法。我们利用Diffusion模型对输入图像进行去噪处理,这一步骤有效降低了图像中的噪声水平。随后,我们应用增强模块对去噪后的图像进行处理,以获得高质量的人脸图像结果。 

Image

Stable Diffusion 模型在LAION-5B大数据集上进行训练,积累了强大的图像分布先验知识。图像增强领域中,已经积累了一些特定场景数据集,需要将大模型迁移到这些小规模数据上继续学习。但直接迁移整个参数量为175 billion 的模型,训练代价是十分高昂的。为了解决这个问题,我们采用了 LoRA 技术,以实现对超分模型的快速微调。我们观察到,大模型在处理小任务时通常是过度参数化的。对于特定任务,模型的参数无需进行大规模改变,因此这种改变是低秩的,并可以用降维矩阵 A 和升维矩阵 B 来表示。最终,模型可以表示为 W+AB,只需要更新 A 和 B 参数即可。

Image

从实验结果可以看到,我们的模型在保留图像细节方面取得了显著的改进,在处理头发、皮肤、胡须、墨镜等细节方面表现出更高的质量。

目前,文本引导的生成模型主要集中在图像生成任务上,我们希望能将文生图进行动态的拓展:实现绘画故事生成。在这一任务中,我们的目标是根据提供的文本故事线,生成与之连贯匹配的图像。在这项工作中,我们花了很大部分的精力,制作了一个高质量大型数据集,形成了2000本故事书,一共3万张图文对。数据来源于视频,电子书和合成数据。在大模型时代,模型的能力很大程度上取决于数据的规模和质量,所以还有很大工作量和探索空间可以继续挖掘。

Image

分享结束之后,B站小伙伴就分享内容向胡老师提出了一个问题:

神经辐射场技术有哪些应用场景,现在有哪些实际落地案例,在实际应用中的技术限制和难点是什么?

胡老师做出了精彩的回答:

神经辐射场技术的应用领域涵盖了虚实融合内容制作、智慧城市中大场景的建模以及物体的神经资产等。这些神经资产可以用于在社交媒体平台上展示和推广比如小红书,也可在电商平台上实现引人入胜的6DoF展示。已经出现的落地案例包括上海人工智能实验室发布的城市级NeRF实景三维大模型“书生·天际”,上科大NeuDim 团队的云景重建平台,以及国外Luma AI的三维重建和渲染平台。然而,实际应用中仍存在一些技术限制和挑战,包括大规模计算资源的需求、多视角数据的采集成本、模型大小的挑战,尤其是在处理动态场景时,以及实时性方面的挑战。

分享活动结束后,胡强老师接受了我们的采访,一起来看看老师受邀参与本次活动的体验如何吧~