小朋友都能懂的人工智能⑫从画师到视频大师(无名带来的六一惊喜)
小朋友都能懂的人工智能⓸ -狗大师的修仙之路
小朋友都能懂的人工智能⓺ -注意,句中高能!
小朋友都能懂的人工智能⓽ Hi AI, Database is all you need
小朋友都能懂的人工智能⑪一滴墨汁成就一代画师
第12集导读
一个小男孩的翻页画给老智带来了灵感,让老智瞬间明白了视频和图片并无本质区别,只是增加了一个时间维度。
于是老智准备了大量视频供无名学习,这些视频被分解成每秒若干帧的图片,以像素数据的格式被输入到无名的深度学习网络内部,通过分析这些帧学习到物体运动规律,最终具备了生成栩栩如生视频的能力。
无名学成出关之际,正是六一儿童节即将来临之时,于是老智有了一个有趣的想法,给孩子们准备了一个大惊喜。
到底是什么惊喜?快来一探究竟吧.....
45
小男孩画的有趣作品
46
视频=系列图片+时间线
L:是的,无名从一滴墨水中领悟到扩散模型,成为一代画师后,老智开始规划进一步训练无名,让其从一代画师到视频大师。正当老智苦苦思索之时,小男作品的出现让老智猛然醒悟过来,顿时明白了视频的实现思路。
A爸:是什么思路?
L:其实视频和作画的过程没有本质上的区别,视频=一系列图片+时间线。对无名来说他,具备了绘画的能力,实现做视频的能力就已经成功一大半了。我们来看一个猛犸象奔跑视频,如下所示。
大家都知道现在已经没有猛犸象了,这视频肯定是机器模拟出来的而非真实拍摄的。看这个效果是不是仿佛现场拍摄出来一般真实。
A爸:是啊,效果还真是炸裂啊!
L:我们来拆解一下这个视频是如何制作出来的,这个视频是由多张连续动作的照片组成的,和小男孩打球类的图片类似,以单张图为例,这是一个二维的结构,如下所示。
47
AI是如何学会做视频的
L:虽说视频和做图没有本质区别,实际上要让AI做出视频的难度还是不小的!无论是打球的男孩还是奔跑的猛犸象,都是由一系列连贯的画面组成,问题在于AI如何掌握了预测下一个画面的能力,大家知道吗?
C:是不是看了很多视频后,学习出来的能力。
L:说得太对了!其实这种视频学习训练模式和之前所描述到的识图、下棋、绘画能力的学习训练模式,又是没有本质的区别!
C:没本质区别?
L:是的,咱们一起回顾一下先前的知识。AI在欣赏了无数图片后记住了世间万物的向量特征后,比如就能识猫了(详见小朋友都能懂的人工智能⓶ --卷积神经网络初探),类似的棋局也是图形,在总结了无数棋型特征后,开始碾压人类顶尖棋手(详见小朋友都能懂的人工智能⓸ -狗大师的修仙之路);在阅读了无数的书籍后记住了词的向量特征后,就能学富五车无所不知了(详见小朋友都能懂的人工智能⓹-不可思议的大模型)。这些大家都还记得吗?
众人纷纷点头称是。
L:OK,同样的道理,AI在观看了无数的视频后,自然是有可能了解到物体运动规律的,比如看了无数篮球比赛的视频后,就能在球员跳起投篮时预测到接下来的篮球如何飞行、如何命中、球如何落地等一系列动作。也就是说AI明白了打篮球的场景应该是怎样的。就这样,在AI观看了各式各样的,足够多的视频后,AI开始明白几乎所有领域的场景应该怎样的。
A爸:有趣,大道至简,方法都是相通的啊,都是在训练数据的规模足够大,在深度学习网络参数足够多的情况下,水到渠成的实现了。
L:是的,A爸的总结非到位!
A爸:对了,AI观看视频是如何观看的,和识别图片和文字一样吗?
L:对于计算机而言,只能识别0和1的数字组合编码的输入,这点识别视频和是识别文字、图片是一样的。不过视频有一个视频分解的过程,这是明显的差异。比如观看篮球视频,会把打篮球的每个动作根据时间进行切片,一个切片就是一个帧。这个帧等同于小男孩画自己打篮球的每一页。假如每秒取30帧图片,观看1分钟视频就是得到了1800张图片。
C妈:原来如此,我明白了,AI进行视频训练的工作量比图片处理要大多了啊。
L:是的,不仅AI视频训练过程的工作量很大,训练完毕进行视频生成时,工作量也非常巨大,同样假设每秒生成30帧图片,那一分钟也得处理1800张图片哦。其实无论训练还是生成阶段,即便一张图片的生成都需要投入巨大的计算资源的。
当视频被分解成每秒若干帧的图片后就进入了视频输入阶段,即将这些帧的图片以像素数据的格式被输入到AI模型里;然后进入模型学习阶段,即模型通过分析这些帧,学习到球员打球的动作规律,比如腿部和手臂的摆动等;最后是预测生成阶段,当模型看到一帧球员开始打球的图片时,AI可以根据之前学到的规律,预测并生成下一帧的图像,直至生成一个完整的打篮球视频。
L:说到SORA,先来看一下最近刷屏的一段视频,根据下面这段文本生成:“一位时尚的女士走在东京的街道上,街道上充满了温暖的霓虹灯和生动的城市标志。她穿着黑色皮夹克、红色长裙和黑色靴子,手里拿着一个黑色钱包。她戴着太阳镜和红色口红。她走路自信而随意。街道潮湿且反光,形成了彩色灯光的镜面效果。许多行人走来走去。”
C妈:哇,这段高清视频堪称完美呈现了文字中所描述的内容!
48
SORA视频的惊艳与自注意力机制
L:是的!其实SORA训练的机制大抵也是如此。当然了,关于AI视频实现的细节远比我们描述的要复杂的多,这里只是让大家从逻辑上有一个宏观的认识。
甚至,视频中可以存在类似于真实世界的互动。例如,一位画家可以在画布上留下持续一段时间的新笔触,这真的看不出来是真画师还是假画师了,如下所示。
C妈:不可思议!和真实世界如此接近,这怎么做到的啊?
L:怎么做到的?这里依赖一个之前我们反复强调过的关键技术。
L:自注意力机制(Self-attention),大家还记得吧。这正得益于自注意力机制,允许模型在处理当前帧时,不仅考虑与当前帧相邻的帧,还能关注视频中更远的帧。能够在全局范围内捕捉到不同时间点和空间位置的相关性,从而实现时间连续性和逻辑一致性。大家可以回顾一下之前小朋友都能懂的人工智能⓺- 注意,句中高能!
A爸:L老师,今天咱们聊AI视频,您居然翻出了那么多之前讲过的知识点,看来AI视频是各种技术综合应用的产物啊。
L:是的,新突破往往是站在巨人的肩膀上。
众人点头称是,也颇有感悟。
49
孩子们难忘的六一儿童节
L:咱们继续说故事吧,话说老智顿悟后立即采取行动了,打造了一个超级大会议室,里面摆放了数以千计的大屏幕,每个屏幕都在播放来自几乎所有领域的各式视频。同时老智让无名戴上特制的编码转换器眼镜和自注意力机制头盔,然后,无名同时盯着所有的大屏,开启了不分昼夜的视频训练模式。很快,无名看完了全部视频,出关了!
激动不已的老智当即就想到给村民们报喜,不过转念一想,有没有更有趣的方式来制作惊喜呢?他看着墙上的日历,马上六一了,心中顿时有了主意。
A:啥主意?
L:老智叫来了大模型村的孩子们,分给他们许多糖果和玩具,小朋友们个个开心极了,接着老智便问孩子们最喜欢听什么样的故事。孩子们更兴奋了,纷纷说出了自己想听的故事,老智认真的记录着。
六一儿童节当日,老智组织了一场大模型村儿童户外活动,画画、游戏、烧烤,孩子们玩得非常开心。晚餐过后,正当孩子们以为活动结束准备互相道别时,老智猛然揭开一块巨幅布帘,一个精心准备的露天电影院出现了!
原来,这个电影是无名依据老智的陈述做的视频,内容正来自孩子们想听的故事,无名将这些故事巧妙的串联成一个精彩的童话,并制作成一部生动有趣且极为流畅的动画大片,更让孩子们意想不到的是,无名把每个小朋友形象都搬到银屏上,让他们成为了小小演员,和童话故事的情节融为一体。
村民们也是惊喜不已,因为有了无名这种制做视频的逆天能力,粮食业务的宣传还需要担心吗?
C妈:精彩精彩,听得我都激动无比。
小朋友们:我们也要像大模型村小朋友一样,看到这样的电影。
L:当下,即便SORA也不具备这么强的能力,不过相信故事很快就会变成现实。实际上这种制作视频的能力远不止是宣传、娱乐、教育这些用途,还有更大的作用,将会极大的改变这个世界。
A爸:改变这个世界,这么厉害?
L:是的,今天就先到这里,咱们下回分解。
预告:《超融合数据库》即将出版,关注梁老师公众号,敬请期待。