收获不止数据库

小朋友都能懂的人工智能⑫从画师到视频大师(无名带来的六一惊喜)

小朋友都能懂的人工智能⓵
小朋友都能懂的人工智能⓶ -卷积神经网络初探
小朋友都能懂的人工智能⓷ -惊世骇俗的狗故事

小朋友都能懂的人工智能⓸ -狗大师的修仙之路

小朋友都能懂的人工智能⓹ -不可思议的大模型

小朋友都能懂的人工智能⓺ -注意,句中高能!

小朋友都能懂的人工智能⓻ 无名故事与GPT4训练

小朋友都能懂的人工智能⓼无名故事与GPT4推理

小朋友都能懂的人工智能⓽ Hi AI, Database is all you need

小朋友都能懂的人工智能⓾大白话数据库

小朋友都能懂的人工智能⑪一滴墨汁成就一代画师

第12集导读

一个小男孩的翻页画给老智带来了灵感,让老智瞬间明白了视频和图片并无本质区别,只是增加了一个时间维度。

于是老智准备了大量视频供无名学习,这些视频被分解成每秒若干帧的图片,以像素数据的格式被输入到无名的深度学习网络内部,通过分析这些帧学习到物体运动规律,最终具备了生成栩栩如生视频的能力。

无名学成出关之际,正是六一儿童节即将来临之时,于是老智有了一个有趣的想法,给孩子们准备了一个大惊喜。

到底是什么惊喜?快来一探究竟吧.....

45

小男孩画的有趣作品

L:无名成为一代画师后,大模型村的粮食业务宣传效率显著提高,同时意外地激发了小朋友们的绘画热情。这不仅因为小朋友们把无名当作偶像,还因为只要他们向老智展示作品,就会得到一个小礼物作为奖励。
一天,一个小男孩兴冲冲地找到老智,给他展示自己的作品。老智一看,是一个小本,翻开第一页是一个小人玩篮球的简笔画,随后的每一页也大致内容差不多。看到小男孩如此有耐心,老智送给孩子一大盒巧克力,以示鼓励。
Image
小男孩看出老智并没有发现其中秘密,让老智开始快速翻页,老智不明就理的照做了,结果让老智大吃一惊,画面在连续翻页中动起来了,从第一页小人把篮球拿在手上,到往上抛,一点一点越抛越高,最后落下来砸到小人身上,小人摔倒在地,球从地上越滚越远,直至消失不见。这连贯的过程如同看电影一般一气呵成。

Image

小男孩笑着说他想把自己学篮球的经历画出来了,可一幅画无法体现自己学球的过程。好在自己忽然在翻书时受到启发,想到这种方式。
老智摸了摸孩子的头,为其创意赞赏不已,又拿了一个玩具递给孩子。小男孩左手巧克力,右手玩具,自己的小本也忘拿了,就这样蹦蹦跳跳地离开了。老智起身正要追上去,忽然望着手中的小本,陷入了沉思......
A:怎么了,老智有啥发现吗?

46

视频=系列图片+时间线

L:是的,无名从一滴墨水中领悟到扩散模型,成为一代画师后,老智开始规划进一步训练无名,让其从一代画师到视频大师。正当老智苦苦思索之时,小男作品的出现让老智猛然醒悟过来,顿时明白了视频的实现思路。

A爸:是什么思路?

L:其实视频和作画的过程没有本质上的区别,视频=一系列图片+时间线。对无名来说他,具备了绘画的能力,实现做视频的能力就已经成功一大半了。我们来看一个猛犸象奔跑视频,如下所示。

大家都知道现在已经没有猛犸象了,这视频肯定是机器模拟出来的而非真实拍摄的。看这个效果是不是仿佛现场拍摄出来一般真实。

A爸:是啊,效果还真是炸裂啊!

L:我们来拆解一下这个视频是如何制作出来的,这个视频是由多张连续动作的照片组成的,和小男孩打球类的图片类似,以单张图为例,这是一个二维的结构,如下所示。

Image
要形成视频,则需要多了一个时间维度,将其变成三维结构,即时间轴,如下所示。
Image
在这个时间轴下对应着一系列图片,可能对应着猛犸象的各种连续的形态,如下所示。
Image
前面和大家说过,无名的作画是从一滴墨水得到的灵感(详见小朋友都能懂的人工智能⑪一滴墨汁成就一代画师)没错,用的是扩散模型,即逆向扩散,如下所示。
Image
这个时间维度轴下的每一张图片,都是逆向扩散而来的。
Image
就这样,视频就制作好了,是不是无名学会了绘画,离实现做视频已经成功一半了。
A爸:是啊,您的这个系列图解还真是形象生动,如此看来绘画与视频的实现确实没有本质的区别。

47

AI是如何学会做视频的

L:虽说视频和做图没有本质区别,实际上要让AI做出视频的难度还是不小的!无论是打球的男孩还是奔跑的猛犸象,都是由一系列连贯的画面组成,问题在于AI如何掌握了预测下一个画面的能力,大家知道吗?

C:是不是看了很多视频后,学习出来的能力。

L:说得太对了!其实这种视频学习训练模式和之前所描述到的识图、下棋、绘画能力的学习训练模式,又是没有本质的区别!

C:没本质区别?

L:是的,咱们一起回顾一下先前的知识。AI在欣赏了无数图片后记住了世间万物的向量特征后,比如就能识猫了(详见小朋友都能懂的人工智能⓶ --卷积神经网络初探),类似的棋局也是图形,在总结了无数棋型特征后,开始碾压人类顶尖棋手(详见小朋友都能懂的人工智能⓸ -狗大师的修仙之路);在阅读了无数的书籍后记住了词的向量特征后,就能学富五车无所不知了(详见小朋友都能懂的人工智能⓹-不可思议的大模型)。这些大家都还记得吗?

众人纷纷点头称是。

L:OK,同样的道理,AI在观看了无数的视频后,自然是有可能了解到物体运动规律的,比如看了无数篮球比赛的视频后,就能在球员跳起投篮时预测到接下来的篮球如何飞行、如何命中、球如何落地等一系列动作。也就是说AI明白了打篮球的场景应该是怎样的。就这样,在AI观看了各式各样的,足够多的视频后,AI开始明白几乎所有领域的场景应该怎样的。

A爸:有趣,大道至简,方法都是相通的啊,都是在训练数据的规模足够大,在深度学习网络参数足够多的情况下,水到渠成的实现了。

L:是的,A爸的总结非到位!

A爸:对了,AI观看视频是如何观看的,和识别图片和文字一样吗?

L:对于计算机而言,只能识别0和1的数字组合编码的输入,这点识别视频和是识别文字、图片是一样的。不过视频有一个视频分解的过程,这是明显的差异。比如观看篮球视频,会把打篮球的每个动作根据时间进行切片,一个切片就是一个帧。这个帧等同于小男孩画自己打篮球的每一页。假如每秒取30帧图片,观看1分钟视频就是得到了1800张图片。

C妈:原来如此,我明白了,AI进行视频训练的工作量比图片处理要大多了啊。

L:是的,不仅AI视频训练过程的工作量很大,训练完毕进行视频生成时,工作量也非常巨大,同样假设每秒生成30帧图片,那一分钟也得处理1800张图片哦。其实无论训练还是生成阶段,即便一张图片的生成都需要投入巨大的计算资源的。

当视频被分解成每秒若干帧的图片后就进入了视频输入阶段,即将这些帧的图片以像素数据的格式被输入到AI模型里;然后进入模型学习阶段,即模型通过分析这些帧,学习到球员打球的动作规律,比如腿部和手臂的摆动等;最后是预测生成阶段,当模型看到一帧球员开始打球的图片时,AI可以根据之前学到的规律,预测并生成下一帧的图像,直至生成一个完整的打篮球视频。

Image
A爸:L老师,您这一梳理,我们可算是明白了。近期Open AI推出的SORA的视频演示惊艳全球,就是这训练出来的啊。

L:说到SORA,先来看一下最近刷屏的一段视频,根据下面这段文本生成:“一位时尚的女士走在东京的街道上,街道上充满了温暖的霓虹灯和生动的城市标志。她穿着黑色皮夹克、红色长裙和黑色靴子,手里拿着一个黑色钱包。她戴着太阳镜和红色口红。她走路自信而随意。街道潮湿且反光,形成了彩色灯光的镜面效果。许多行人走来走去。”

C妈:哇,这段高清视频堪称完美呈现了文字中所描述的内容!

48

SORA视频的惊艳与自注意力机制

L:是的!其实SORA训练的机制大抵也是如此。当然了,关于AI视频实现的细节远比我们描述的要复杂的多,这里只是让大家从逻辑上有一个宏观的认识。

Sora生成的视频具有长距离的一致性和物体永恒性。通俗地说就是可以在人、动物和物体被遮挡或离开画面时保持它们的持续存在,比如当路人经过时,下面的狗狗一直完整地存在视频中。同样,可以在单个样本中生成同一角色的多个镜头,保持他们在整个视频中的外观,如下所示。

甚至,视频中可以存在类似于真实世界的互动。例如,一位画家可以在画布上留下持续一段时间的新笔触,这真的看不出来是真画师还是假画师了,如下所示。

Sora生成的视频,就能做到汉堡被吃掉的部分就没了,并留下咬迹,如下所示。

C妈:不可思议!和真实世界如此接近,这怎么做到的啊?

L:怎么做到的?这里依赖一个之前我们反复强调过的关键技术。

C妈:什么技术?

L:自注意力机制(Self-attention),大家还记得吧。这正得益于自注意力机制,允许模型在处理当前帧时,不仅考虑与当前帧相邻的帧,还能关注视频中更远的帧。能够在全局范围内捕捉到不同时间点和空间位置的相关性,从而实现时间连续性和逻辑一致性。大家可以回顾一下之前小朋友都能懂的人工智能⓺- 注意,句中高能!

A爸:L老师,今天咱们聊AI视频,您居然翻出了那么多之前讲过的知识点,看来AI视频是各种技术综合应用的产物啊。

L:是的,新突破往往是站在巨人的肩膀上。

众人点头称是,也颇有感悟。

49

孩子们难忘的六一儿童节

L:咱们继续说故事吧,话说老智顿悟后立即采取行动了,打造了一个超级大会议室,里面摆放了数以千计的大屏幕,每个屏幕都在播放来自几乎所有领域的各式视频。同时老智让无名戴上特制的编码转换器眼镜和自注意力机制头盔,然后,无名同时盯着所有的大屏,开启了不分昼夜的视频训练模式。很快,无名看完了全部视频,出关了!

Image
老智立即对无名展开了测试,结果发现无名真的可以依据他所提的任何条件,随心所欲的生成各种流畅惊艳的视频。看来真多的是练成了!老智开心地蹦蹦跳跳起来。

激动不已的老智当即就想到给村民们报喜,不过转念一想,有没有更有趣的方式来制作惊喜呢?他看着墙上的日历,马上六一了,心中顿时有了主意。

A:啥主意?

L:老智叫来了大模型村的孩子们,分给他们许多糖果和玩具,小朋友们个个开心极了,接着老智便问孩子们最喜欢听什么样的故事。孩子们更兴奋了,纷纷说出了自己想听的故事,老智认真的记录着。

六一儿童节当日,老智组织了一场大模型村儿童户外活动,画画、游戏、烧烤,孩子们玩得非常开心。晚餐过后,正当孩子们以为活动结束准备互相道别时,老智猛然揭开一块巨幅布帘,一个精心准备的露天电影院出现了!

小朋友们惊呆了,于是惊喜地坐在草坪上观看起电影。电影一开播,引起了孩子们此起彼伏的快乐惊叫声。

原来,这个电影是无名依据老智的陈述做的视频,内容正来自孩子们想听的故事,无名将这些故事巧妙的串联成一个精彩的童话,并制作成一部生动有趣且极为流畅的动画大片,更让孩子们意想不到的是,无名把每个小朋友形象都搬到银屏上,让他们成为了小小演员,和童话故事的情节融为一体。

Image

村民们也是惊喜不已,因为有了无名这种制做视频的逆天能力,粮食业务的宣传还需要担心吗?

C妈:精彩精彩,听得我都激动无比。

小朋友们:我们也要像大模型村小朋友一样,看到这样的电影。

L:当下,即便SORA也不具备这么强的能力,不过相信故事很快就会变成现实。实际上这种制作视频的能力远不止是宣传、娱乐、教育这些用途,还有更大的作用,将会极大的改变这个世界。

A爸:改变这个世界,这么厉害?

L:是的,今天就先到这里,咱们下回分解。


预告:《超融合数据库》即将出版,关注梁老师公众号,敬请期待。

Image