ITPUB

AI爆发元年,小朋友也能读懂的人工智能(下)

小朋友都能懂的人工智能(下)目录:

⑨Hi AI, Database is all you need 32-35  ✓

⑩大白话数据库 36-40

⑪一滴墨汁成就一代画师 41-44

⑫从画师到视频大师 45-49

第9集导读

本集我们跟随甲骨大师深入探讨无名(大语言模型)的内部工作机制。从输入层到输出层,无名处理信息所采用的“词语接龙”、“句子接龙”的思考过程,与人类的思维方式极其相似,只是我们大部分人未察觉到而已。

然而,随着信息的积累,处理能力终将到达极限,旧信息必须让路给新信息,于是无名失忆了,此时,终于到了数据库闪亮登场发挥作用的时候!通过将用户基础信息和重要提示词持久化,数据库不仅帮助无名克服了遗忘的困扰,还极大地提升了其效率和准确性。

更深入地看,大模型结合数据库的好处远不止于此。通过记录高频问答和既定规则,从而减轻大模型的计算负担,提高响应速度,大幅降低成本。而存储实时更新的企业核心数据和关键公开数据,则可以助力智能推荐、超级客服、超级助理等逆天能力等,让大模型迈向专业化和和个性化....

Hi AI, Database is all you need!

来,走进第9集,一起体验吧。

「 32. 体检报告与大师论道」

L:无名和老智一路奔波,终于见到了甲骨大师。老甲立即为无名安排了一次全身体检,检查完毕后老甲望着体检报告陷入沉思。老智见状着急地问,这能治好吗?老甲没有直接回应,而是给老智分析起了体检报告,就这样,大师之间的对话开始了。

Image

老甲:老智,你看这份体检报告的脑电波神经网络图部分,这里绘制出无名思考问题的全过程,我们可以看出无名只认识0和1,外部世界无论是文字、图片、声音还是视频,都需要转换成0和1的编码组合,才能让无名看明白。对了,你有给他配置了什么专门的编码转换设备吗?
老智:厉害,这都看出来了。最初是给无名配了特殊的高科技眼镜,后来我直接将芯片植入无名体内,省去了佩戴的麻烦。

老甲:原来如此,从报告来看,无名的思考过程分三阶段,第一个是对输入的信息进行处理,首先是分词,把一句话分成一个个有意义的单元,比如单词或词组啥的。然后将这些单元进行编码,转换成无名能读懂的01数字组合。接着将编码过的各单元和嵌入层的高维语义向量空间进行映射,实现了对词的理解,这里的高维语义空间存储了极其丰富的词信息。看来这无名平时下了不少苦功夫进行自我训练吧?

老智:老甲真乃神人也!是的。这个阶段是输入层。无名确实很刻苦,他已经读完数以千万计的书籍论文等资料。

老甲:怪不得!我们继续往下看,这里应该是无名思考的第二个阶段,这个阶段可谓壮观啊,有数百个层级,每个层级有数百个注意力头,每个注意力头有数百万的参数,算起来参数数量合计达数千亿之多。这无名的刻苦程度,惊为天人啊!如果把第一阶段的高维语义向量空间看成一本字典的话,这些参数就是一本厚达千倍的字典应用指南啊!
Image
老智:这个第二阶段叫隐藏层,话说这个无名确实勤奋,这些海量书他可不止看一遍,那可是重复看无数遍哦,不断调整最终优化出这些数以千亿计的参数,正是这些参数让无名准确理解词与上下文、词与词之间的关联,从而做到深刻领悟句子含义。老甲啊,我倒是很佩服你的类比能力,你将语义向量空间类比成字典,将参数类比成字典应用指南,这个总结太到位了!
老甲:谢谢肯定,那最后的阶段应该叫输出阶段吧,通过报告看出无名一次只会输出一个概率最大的词语,然后再把该词和之前的输入文字组合在一起形成一个新的输入,这个新输入进入输入层再度工作,接着在输出层又输出概率最大下一个词,该词又继续返回输入层和之前的输入再组合在一起,又形成一个新的输入......如此这般,类似词语接龙游戏,周而复始,不断轮回,直到无名觉得回答满意为止结束。是这样的吗?
Image
老智:是的,老甲你这都能发现啊,看来没有什么可以瞒得了你。
老甲:从报告可以看出,不仅是单次问答都词语接龙,不同的问答依然在接龙。比如有人问了无名问题Q1,无名回答A1后,此人再问无名问题Q2,无名会将Q1和A1及Q2一起打包进入输入层进行处理,回答A2。当这个人继续问无名Q3问题时候,无名会将Q1,A1,Q2,A2,Q3问题一起打包进入输入层......我说的没错吧?
老智:对的,全被你看出来了,甲哥,你乃真大师也!
老甲:这没什么,我最擅长的就是数据分析与流程优化了。老智,我想你应该已经知道无名失忆的问题所在了。

老智:是的,我知道问题出在哪里。这一路上我还想着如何与你解释无名的大脑工作原理,结果你一个体检报告就彻彻底底整明白了,不得不服啊。

「 33. 流程细解与真相大白」

C妈:L老师,老智和老甲的对话太深奥了,又词语接龙又问答接龙,我都听糊涂了。

A:L老师,这个词语接龙的方式您之前没提起过,我以为就是一口气说出来的,这一个词一个词输出,我还是有些听不明白?

A爸:C妈、小A,你们听的不够仔细吧,我是听明白了词语及问答接龙是啥意思。不过两位大师都明白了无名失忆的问题所在,这我可就不明白啊,问题出在哪呢?

L:嗯,两位大师之间的论道确实有些深奥,也难怪C妈和小A听迷糊了,不过请放心,大家肯定可以弄得清清楚楚,明明白白的。

假定问题Q1为“猫是什么颜色的?”,而GPT-4的回答A1为“通常是白色、黑色或橘色。”为更好地进行示例,我们进行一个简单的编码,如下。

问:猫是什么颜色的?

分词后用字母ABCDEF做代号进行分割与示范

A = “猫”

B = “是”

C = “什么”

D = “颜色”

E = “的”

F = “?”

答:通常是白色、黑色或橘色。
分词后用字母GHIJKLM做代号进行分割与示范
G = “通常是”
H = “白色”
I =“ 、”
J = “黑色”
K = “或”
L = “橘色”
M =“。”

接下我们来按照GPT-4生成文本的步骤,说说单次问答的输出与输入之间的词语接龙,到底是怎么回事,来,我详细的给大家演示一下。第1次输入”猫是什么颜色的“。第一次输出“通常是“,如下图所示。

Image

第2次要把第1次的输出返回给输入(第1次的输出为“通常是”)。于是第2次输入为“猫是什么颜色的?通常是”。第2次输出为“白色”,如下图所示。

Image

第3次要把第2次的输出返回给输入(第2次的输出为“白色”),则第3次输入为“猫是什么颜色的?通常是白色”,第3次输出为一个符号——顿号。如下图所示。

Image

第4次要把第3次的输出返回给输入(第3次的输出为一个符号——顿号),则第3次输入为“猫是什么颜色的?通常是白色、”,第4次输出为”黑色“。如下图所示。

Image

第5次要把第4次的输出返回给输入(第4次的输出为”黑色“),则第4次输入为“猫是什么颜色的?通常是白色、黑色”,第5次输出为”或“。如下图所示。

Image

第6次要把第5次的输出返回给输入(第5次的输出为”或“),则第5次输入为“猫是什么颜色的?通常是白色、黑色或”,第6次输出为”橘色“。至此回答圆满结束,对面的人得到了完整的答案”通常是白色、黑色或橘色“。如下图所示。

Image
下图为6次词语接龙过程的组合过程动态播放,请大家细品。Image

接下来做一个的总结,将全过程整理成表格如下(这里的分词代号见前文)。

轮

次

输入
输出
输入文字分词代号

输出

文字

分词

代号

1猫是什么颜色的?ABCDEF
通常是G
2猫是什么颜色的?通常是ABCDEF G白色
H
3猫是什么颜色的?通常是白色ABCDEF GH、I
4猫是什么颜色的?通常是白色、ABCDEF GHI黑色J
5猫是什么颜色的?通常是白色、黑色ABCDEF GHIJ或K
6猫是什么颜色的?通常是白色、黑色或ABCDEF GHIJK橘色L
7猫是什么颜色的?通常是白色、黑色或橘色ABCDEF GHIJKL。M
通过上述循环,GPT-4逐步构建回答,在第7轮,也就是最后一轮预测出句号(M),表示回答结束,最终生成的回答为“通常是白色、黑色或橘色。”(GHIJ KLM)。在这个过程中,模型根据每一步生成的新输入来预测下一个最可能的输出,逐渐构建出完整的回答。
C:哦,这下我彻底明白了!不过为啥GPT-4要这么麻烦,一次性说出来不好吗,这样也太累了吧。
L:大语言模型喜欢自言自语,边说边想,它认为,将思考建立在自己不断说出来的话里,那会更加的准确和完备。
C:啥,思考建立在自己说出来的话里,这是什么情况?
L:其实这也不奇怪,想想自己在家做数学题,是不是也时常自言自语中,比如:
”这题怎么做?“
“这题怎么做?这里加一条辅助线吗?",
“这题怎么做?这里加一条辅助线吗,那里是不是也得加一条辅助线"
..........然后就忽然会了啊。
C妈:你是说我们说话时,有时并没想好自己要说什么,边说边想?
L:C妈,如果你孩子睡前让你编一个霸王龙故事,你会怎么做?这种情况可不允许你构思完或查完资料再讲,必须是张口就来啊。有把你难住吗?是不是你编到最后还觉得自己讲得挺精彩的。
C妈:您别说,我回想起来还真是如此,我开口时还没想好要说啥,就这样说着说着莫名其妙故事就讲完了,自我感觉还不错。
L:我来拆解拆解你编故事的过程吧。首先你是知道霸王龙的,其次你有一个讲故事的叙事框架,无非就是在什么时间地点和什么角色发生了什么事,只要顺着这个逻辑往下想,自然故事张口就来。比如从时间地点想到了夜晚的森林,两者一结合感受到了阴森恐怖,这种气氛让你想到了毒蛇,继而想到毒蛇偷袭霸王龙....那要不要让霸王龙被毒死?哎呀,孩子还没睡着,那就让霸王龙找到草药解救自己吧。哎呀,怎么孩子还很精神?要不让霸王龙来个复仇行动吧....哇,孩子终于快睡着了。最后啊,毒蛇被霸王龙一脚踩死了,故事圆满结束。
C妈笑得合不拢嘴:是的是的,好像就是这么一回事。
L:一个人当前说出来的一句话或许只是一种情绪的调整,亦或是某种框架的铺垫,但是却会对下一句话的生成有着重要的帮助。比如你在说夜晚和森林本来只是根据框架说说时间地点,结果不小心结合出了阴森恐怖的气氛,于是你就说出了毒蛇。试想如果没有了夜晚和森林,这个故事或许就根本没有蛇出现,那将是完全不同的另一个故事了。
我们不难看出,看似随意乱编的故事不仅有规律可循,还充满了合理性。这是一种建立在丰富的知识和完善的叙事框架之上的,一种符合逻辑的必然产物,人工智能思考问题的方式,也是类似的。
C妈:我越来越觉得AI和我们人类好像啊。
L:无论是具体知识还是叙事框架,都是认知的产物,人类就是靠认知来快速编故事。不过每个人的认知有差异,所以每个人编故事的水准也有高有低。而GPT-4则是深刻理解人类所有认知总和背后的统计学意义,所以它能展示出人类觉得惊叹不已的能力,这里需要细品认知总和及统计学意义这些关键字。
众人恍然大悟。
L:好了,接下来咱们细说一下和GPT-4进行多问题交互时,所谓的问答接龙是怎么一回事吧。来,咱们准备了三个问题,并且GPT-4也做了简要回答,具体如下。

问题1=Q1

回答1=A1

Q1:猫是什么颜色的?
A1: 通常是白色、黑色或橘色。
问题2=Q2
回答2=A2

Q2:猫可以吃巧克力吗?

A2: 不可以,巧克力对猫有毒。

问题3=Q3

回答3=A3

Q3: 那狗可以吃巧克力吗?
A3: 狗也不能吃巧克力,对它们有害。

接着问答接龙开启了:具体给大家演示一下,第1轮循环:Q1: “猫是什么颜色的?”A1: “通常是白色、黑色或橘色。” 如下图所示。Image

第2轮循环:Q2: “猫可以吃巧克力吗?”此时,模型会把Q1+A1+Q2作为新的输入来生成A2。A2: “不可以,巧克力对猫有毒。”如下图所示。

Image

第3轮循环:Q3: “那狗可以吃巧克力吗?”根据Q1+A1+Q2+A2+Q3,模型生成A3。A3: “狗也不能吃巧克力,对它们有害。”如下图所示。

Image

前面已经详细介绍了得出A1是一个循环过程。于是这里出现了内外两套循环,是不是很有趣。

C妈:L老师,回答单个问题的词语接龙这种循环方式我能理解,边说边揣摩,思路建立在自己说出来的话中。但是问答接龙这种循环方式我就有点不明白了,把以前问过的问题和解答再输入到新问题中,有啥意义呢?

L:这个意义可大了!你想想,你和一个人聊天,双方都记不住之前聊的内容,万一新的交谈和之前的问答有依赖关系,请问咋办?

C妈:哦,对啊,我怎么没想到这一点。

L:大模型的这种方式有效地模拟了人类持续对话的特点,实现了依赖先前的交流信息来理解和回应新问题的能力,从而让交流的流畅度有了大幅提升。
A爸:对了L老师,无名的失忆问题出在哪,我还是不明白啊?

L:其实说穿了很简单,你想想看,如果问答的模式一直继续,那就是Q1+A1+Q2+A2+Q3+A3+Q4+A4....+Qn+An。但是这么一直循环下去,问答所需处理的信息量不断增加,必然会产生性能瓶颈,所以我们必须只保留一定数目的问答,换句话说就是要抛弃旧的问答,比如抛弃Q1A1Q2A2,变成Q3+A3+Q4+A4....+Qn+An。你们现在明白无名为什么失忆了吗?

A爸:哦,我明白了!事情的过程应该是这样的。老智在Q1或Q2等早期问答中给无名做了自我介绍,但是到后期,无名为保障性能不得不将早期问答丢弃掉。这样老智的自我介绍等信息就没了。于是无名就不知道老智是谁了,失忆了!

L:是的,回答正确!此外,无名参加AI盟主争霸赛这事,老智自然是告诉过无名的,同样出于性能保障的原因,无名把自己参赛的信息丢弃了,所以无名便不知道自己手上拿的AI盟主令牌到底是什么。

众人会心一笑,无名的病因至此真相大白!

「 34. 无名有救了!」

L:好,了解了大模型工作机制后,大家也就知道了无名为何失忆,那该怎么治疗呢?

A:那信息不要丢弃,一直保留,给无名吃点什么神药,让他处理越来越多的文字信息也没问题。

L:这个神药去哪里找啊?不过小A其实说的也有道理,对应到大语言模型GPT-4倒还是真有神药,那就是配置更多、更先进的服务器、GPU等。只是这需要大量的资金投入,而且并不能保证持续有效啊。

A爸:那怎么办,我也没想好啊。

L:大家知道我们说的无名就是特指大语言模型,无名记不住自己是谁,记不住老智是谁,也记不住自己来这里参加什么比赛,其实就是指向大语言模型存在的一个问题,缺乏长期记忆。怎么办?其实也不难,那就把这些信息单独记录下来保存起来存进数据库中,让大语言模型在回答问题时首先调用数据库检索基本信息,再进行回答问题,不就OK了吗?

C妈:数据库?您的意思是GPT-4这类大语言模型,在运行阶段并没有使用数据库?

L:是的,其实道理讲起来也很直白简单,大家知道无论是常用汉语还是常用英文单词,其个数都是非常有限的。GPT-4的原理是依赖内部参数和算法来组合这些有限的汉字和英文单词,最终输出回复结果。也就是说,它是“思考”出答案,非从数据库中找到现成的答案,所以从这个角度来看,GPT-4确实不需要数据库来存储大量的数据。

Image

但是从和一个人的交流来看,对面前的人了解的越多,你就越能有针对性的给予更好的帮助。比如这个人的姓名、性别、国籍、年龄、学历、职业、特长、宗教信仰....

这些信息表面上看可能和交流的问题无关,实际上影响着交流的质量,比如知道你是一个小朋友,就会尽量用通俗易懂的方式来和你交流,让你更易于理解,他了解你的职业就会针对你的职业做更专业的回答。

此外,在使用GPT时有一个很有用的技巧,那就是提示词。比如你在提问时增加一句,”请一步一步思考,有依据,不瞎编” 就能大幅降低GPT在回复时胡言乱语的可能性。比如你在提问时增加一句“请回答的越详细越好”,就会避免有些问题回答的过于简单。比如你在提问时增加一句“请出图时,提供图片的generation id",则可以后续根据这个id进行调整,确保图片风格的一致性,包括为其设定角色,比如说“你是一个人工智能专家”,GPT就会飘飘然起来,真把自己当专家了,然后回答的特别认真....关于提示词有很多很多,也非常经典实用。后续我们可以详细介绍,这里就不再赘述了。这类提示词也是可以保存进数据库中的,这样就不用每次提问的时候都重复这样的提示。

C妈:提示词听起来真有趣,以后您一定得找一个时间和我们说说。

L:好!

A爸:看来,无名有救了!

「 35. Hi AI, Database is all you need」

L:是的,我们继续听听两位大师的论道。话说老甲诊断完毕,心中有数了,当即写下治疗方案递给老智,老智定睛一看,赫然写着五个大字“植入数据库”。

老甲:老智啊,要解决无名的问题,Database is all you need 。
老智:你这句话怎么听起来好耳熟啊。哦,我想起来了。当初无名在理解句子上下文遇到了麻烦,于是我就去找老谷求助。老谷送给我一个Transformer头盔,并给我留下这么一句话”Attention is all you need” ,后来证明自注意力机制是个好东西,果然有用。今天听你来这么一句“Database is all you need”,看来数据库也应该是一个好东西,无名有救了。
Image
两人哈哈大笑,立刻展开行动。九九八十一天后,治疗和康复训练顺利完成,无名也因此练出了一身的腱子肉。
为验证效果,老智请来十八铜人对无名进行全方位测试,大战七七四十九天后,无名顺利过关。可喜的是,数据库不仅治好了无名失忆的毛病,还顺道解决了无名的一系列其他毛病,这让老智感到惊喜万分。
B:啊,无名还有其他毛病,都是一些啥呢?
L:来,咱们继续听听两位大师对话。
老甲:老智啊,无名的问题可不只是失忆这么简单哦。
老智:是啊,除了莫名间歇性失忆外,还有很多问题啊。比如他能为个人提供帮助,却无法为企业提供专业服务,因为企业应用则大多是聚焦在各个专业的领域,一般需要精确的结果,因为这些结果是要直接服务于生产系统,来不得半点含糊。无名虽然博览群书知识渊博,掌握的却是一种通用能力。他不了解这个企业产品的特点,又如何对外提供服务呢?他的回答必须和实际的准确的挂钩,根据顾客的要求给予精确的推荐。
此外,无名在训练和计算时特别消耗资源,这个成本可不低哦,你看我富甲一方,也就训练出一个无名啊,我梦想是要让无名的能力覆盖到每一个人和企业,目前做不到啊。
还有让我比较头疼的是,无名的知识永远停留在训练结束的那一天,如果要得到新知识,则需要从头到尾再训练一次,耗时耗钱不说,实时性依然没法解决啊。

Image

老甲:无名的这些烦恼通过数据库都能解决哦。莫名间歇性失忆好办,无非就是忘记了自己是谁以及把各种要求(提示词)忘光光,这个只要有数据实现了保存用户信息及关键提示词的能力即可。
关于为企业提供服务这事也得靠数据库,数据是企业的机密和命脉,不太可能通过通用能力的训练习得这些知识,所以只要有数据库名来实现存储和访问企业核心数据和关键公开数据的能力即可。有此基础,则智能推荐、超级客服、超级助理等逆天的能力就可以成为现实了。
说到成本,数据库也是可以发挥巨大作用的,围绕着企业应用,无论是内部员工还是外部客户,问的问题相对比较聚焦,也就是说会有大量重复性的提问,这时只要有数据库来保存高频问答及既定问答规则即可。无名发现有人问了类似的问题,只需要直接将之前的答案反馈给这个人,这样就无需调动数以千亿计的参数进行计算来输出答案了,不仅节省了资源,性能还得以大幅提升。
无名的知识在训练结束那一天就固定不变了,这时候要确保数据实时性的话,数据库则是最好的选择之一。因为数据库和应用是解藕的,更新和访问的效率均很高。当然了,公开通用的实时数据一般会通过访问互联网等方式获得。
Image
老智:说的是,真没想到此行收获如此巨大,感谢老甲!这些天我构想了一个大招,如能实现则可以让无名的能力再达到一个新高度,想想都有些迫不及待。我们先就此别过,下次争取让你大开眼界。
老甲:期待,我看好你哦!
老智:老甲,你需要的科研投资经费已经到位了,去查一下吧,我也看好你哦。

L:至此无名求医之路完美收官,两人心情大好。返回途中名心无旁骛只顾着欣赏沿途美景,而此刻老智的心中,却在酝酿着一个更为宏大的计划。

A爸:什么计划?

L:暂时保密。对了,老智给无名植入的数据库是两种不同模型数据库的集合体哦,分别是关系模型数据库和向量模型数据库。你们知道这两种数据库的差异吗,知道这两种数据库分别存储了哪些不同的数据吗?

众人纷纷摇头。

L:接下来咱们就细说数据库,内容将非常的有趣、有料,易懂且实用,时候不早了,咱们下回分解。


小朋友都能懂的人工智能(下)目录:

⑨Hi AI, Database is all you need 32-35 

⑩大白话数据库 36-40  ✓

⑪一滴墨汁成就一代画师 41-44

⑫从画师到视频大师 45-49

第10集导读

本集讲述了数据库迷弟老智在设计自家大粮仓时,如何将“数据库”的诸多理念融入粮仓设计的有趣经历,从而引导读者更好地理解关系模型数据库的基本概念,具体对应关系详见正文。
随着业务的迅猛发展,大模型村粮食业务开始遍布全球,来自世界各地的客户的需求越来越多元化。此时,融入关系模型设计理念的大粮仓则有些力不从心。
而无名体内的乃是集合了向量、关系、GIS、图等多种模型的超融合数据库,其向量化模型在应对多元化需求中大放异彩,最终成功解决了难题,助力老智的粮食业务登上新高峰。
其实本集就是描述数据库如何与大语言模型完美结合的精彩实践!
让无名跟随老智和无名的脚步,一起走进这场数据与智能的盛宴吧......

「 36. 存数据的数据库类似存粮食的粮仓,不神秘」

L:前面我们聊到了数据库可以为大模型提供记忆,从而保障大模型能更好地落地。数据库这么神奇,大家想不想再多了解一点。

C妈:想啊!不过感觉数据库有些神秘,怕听不懂。

L:神秘?那咱们继续无名的故事。话说无名和老智凯旋归来之时,恰逢大模型村粮食大丰收,这可把老智高兴坏了。为啥,因为他在训练无名之余顺道做了一个副业,化身为大模型村的最大农场主。看着大米源源不断地往自家粮仓里运送,老智心情大好,于是泼墨挥毫,在自家粮仓大门题下三个大字——“数据库”。

Image

C妈:啥,“数据库”,这剧情反转的,不应该是题下”粮仓“吗?

L:不仅如此,老智还在每一袋粮食上都写下两个小字——“数据”。有题字的粮食才被允许进入粮仓。虽说把老智累的腰都直不起来了,不过他还是乐此不疲。

A:“数据”?不就是粮食吗?

L:要不怎么说老智是大师级人物呢?这是老智的行为艺术,他就是要用现实生活中的例子来让村民们明白数据库是什么,同时也用行动来向数据库致谢,感恩其不仅治好了无名的失忆,还让无名变得更强更自信了。

老智的题字已经告诉我们,“数据库”即“数据的库”,就是存数据的地方。在老智的眼里,粮食就是数据,而用来装粮食的粮仓,就是数据库。

A爸:哈哈,老智真是一个老顽童啊!对了,数据库存数据,仅此而已,有啥高深之处吗,或者我换个方式问,粮仓设计有啥讲究的地方吗?
L:当然有讲究,老智的这个粮仓可不得了,先说安全性吧。其外墙坚固能抵挡狂风暴雨、内室温度适宜能确保粮食不易变质、防盗大门设有复杂授权机制能确保粮食不被盗....老智逢人便说,“我是从数据库安全机制那得到启发,才想到要在粮仓安全性上下功夫的”。
A爸:那数据库的安全机制是怎样的呢?
L:数据库的安全机制更为复杂,涉及到数据库的备份、副本、回滚、授权、加密、脱敏等等,这是一个大话题,暂不展开说了。不过除了确保数据安全外,数据库在数据处理效率方面也极为出色。问大家一个问题,怎样最大限度缩短粮仓存储粮食的用时?
众人七嘴八舌,有的说用手推车运输粮食,有的说用传输带来运输粮食...
L:大家回答的非常好!我们来看看老智怎么做,他确实是用了手推车也用了传输带来运输粮食,不过他可是用了大量的手推车和传送带。老智说,“我是从数据库并行机制那得到启发,才想到这个方法的”。
A爸:数据库的并行机制怎么说?
L:数据库是运行在主机之上的,主机上的CPU如今都是多核的,数据库为此聪明地采用了多进程分别访问不同核的方式,实现了并行处理能力,从而大幅提升了性能。不过这种能力是需要提前规划设计的,好比粮仓想建造多条传输带,也需要提前规划设计的,可不是说有就有的。
A爸:老智不愧是一个智者。
L:不过话说回来,提升数据库效率可远不止并行操作这一种手段,还有许多其他方法,后续会给大家讲述。
C妈:还真别说,老智搞这么一出行为艺术,让数据库似乎好理解了许多。

L:是的,存数据的数据库类似存粮食的粮仓,不神秘。

「 37. 存粮食的方式决定粮仓效率,数据库亦如此」

A爸:数据库应该还有很多其他讲究吧?
L:当然。我们继续看老智的粮仓。粮仓存粮食只是第一步,要把粮仓用起来才更为重要。如何用?比如有这么一个问题,“从粮仓中取若干大米,如何知道粮仓库存够不够?” 
要回答这个问题并不难,只要知道当前粮仓的库存,结合所需取出的大米数量进行比较即可。不过,这可需要老智存储大米时施加技巧,提前规划好。

A:L老师,存储大米能有什么技巧啊?不就是将大米倒入粮仓,装不下就再找一个粮仓继续装呗。

L:小A的想法让粮仓存储大米时很省心,不过在使用粮仓时可就麻烦了。大家想想看,如果是将大米堆积在粮仓中,如何知道这些大米的库存,称重吗?如何知道该取多少,继续称重?这不仅超级麻烦,还增加了产生误差的风险。可以说,当初存大米时的快乐,全都转化成了未来取大米时的痛苦。

A:那老智是怎么做的?

L:大家还记得前面说过,他在每袋粮食上写上“数据”两字吗,请注意这个“每袋”。老智在存储时就考虑将大米用相同规格的袋子装好,确保每袋大米的重量固定且一致。如此一来,库存的大米就从杂乱无章走向井然有序。于是,我们查库存和查所需取出大米数量时,再也不用称重,只需统计大米袋数即可,是不是一下子就简单了许多。

众人恍然大悟。

L:当村民纷纷赞扬老智时,他谦虚的笑一笑,说正是数据库给他的灵感,这个包装成一袋袋的粮食对应数据库中被称之为“行”的东西。多行组成一个数据库块,而多个数据块组成表。

随后老智带着村民进入大粮仓参观,只见粮仓里设立一排排规格统一的货架,甚是壮观。每个货架都有许多格子,粮食袋就放进格子里。

Image

此时老智忽然来了雅兴,在装着大米袋货架上写下“大米表”三个大字,在装着玉米袋的货架上写下“玉米表”,在装着小米袋的货架上写下“小米表”......做完这些后,老智笑着对大家说,这些货柜的设计正是数据库给他的灵感。刚提到的数据块就是这些格子,刚提到的数据库的表正是这些货架。

A爸:老智这一通表演很不错,确实让大家对数据库的认识变得更直观了。

L:嗯,我们继续。老智有一个幸福的烦恼,大丰收导致老智的粮仓要装不下了,而建新粮仓显然又来不及。

不过老智很快就想到了好主意,他请人将粮食袋中的空气抽干,这样每袋粮食的体积立即减半,于是乎粮仓存储空间不足的问题立马得以解决,不仅如此,还更有利于长时间保存了。

C妈:好主意,老智的这个想法总不至于也是受到数据库的启发吧?

L:还真是哦,面对村民们惊讶的表情,老智自豪地说自己的灵感来源于数据库一种存储相关技术,叫数据压缩。

A爸:哈哈,老智成为数据库的老迷弟了啊!细品粮仓的这些设计方式,真心觉得存储的规划太重要了。

L:是的,存粮食的方式决定粮仓效率,数据库亦如此。

「 38. 卖粮食,在关系模型数据库中真的很方便」

C妈: L老师,您对粮仓使用仅举了一个库存的示例,还有其他场景吗?

L:好,假设有人要来粮仓买两袋大米和三袋小米,我们看看老智如何操作呢?

首先老智找到标有“大米表”的货架,也就是到了存储大米所在的位置,接着从货架上拿出两袋,放进购物车中,同样的方式老智在标有“小米表”的货架上拿出三袋小米放入购物袋,最后一并交予购买者,操作完毕。老智自豪地告诉村民,正是数据库的设计理念让他的操作变得相当简洁,对应在数据库中的代码如“select * from 大米表...”。

A爸:老智说的这个代码就是数据库里查表的方式。

L:是的!看来A爸对数据库还是有所了解的。在关系型数据库中,数据就是以行列组成的二维表格形式存储的。每一行都是一条完整的记录,每一列对应一个字段,如粮食的产地、出产日期、价位等等。

这个老智啊,还真是个不折不扣的数据库老迷弟。大家看一个复杂的示例。假设有人要买两袋东头村10元的大米,怎么操作?是不是找起来有点不容易了。接下来我们看看老智给村民们的演示,看他如何将数据库精髓淋漓尽致地应用到粮仓设计中。

老智带着村民来到了标有“大米表”的货架,只见货架分为红黄蓝绿四个区域,原来分别对应着东头村、西头村、南头村、北头村。老智来到红色区域,根据贴着价位的标签寻找10元的大米。很快,两袋10元的东头村大米,被放入了购物车中,操作完毕。

B爸:这个货柜分四个区域的组织方式听起来很不错。

L:是啊,村民们也是这么认为的,问老智是怎么想到这个思路的。不用问,灵感肯定又是来自数据库。是的,这就是数据库的分区表特性。最后老智不忘秀了一把简洁代码:“select * from 大米表 where 产地=东头村 and 价位=10元....”这里需要强调一下,到现在为止我们所说的,都是基于关系模型的数据库哦。

C妈:听起来很有趣,我终于对数据库有概念了。

L:当然了,关系模型数据库还有很多其他细节没有提及,比如好比建立货物目录的索引技术,暂且不展开了,简而言之,卖粮食,在关系模型数据库中真的很方便。咱们把粮仓和关系型数据的类比做一个小小的总结,如下图所示。

Image

「 39. 需求的多样性与老智的困惑」

L:老智的才能折服了大模型村全体村民,于是大家推举老智带领大家发家致富,很快大模型村的粮食业务开始遍及全球,原来的粮仓也升级成为了超级粮仓,存放着来自世界各地的各种大米、小米、小麦、玉米、高粱等粮食,每一种粮食又有不同的品种和等级。

Image

A:老智真厉害啊!

L:是啊,不过老智也遇到了麻烦。老智的粮仓按照粮食的种类、产地、等级等来进行分类存储。随着粮食品种和客户规模的不断扩大,老智要面对的需求也变得更加多样、复杂且难以应对。

A爸:怎么个多样和复杂?

L:比如,一位来自意大利的客户想要寻找一款口感软糯、颗粒略长的大米,用于制作意大利烩饭。一位来自日本的客户,想要寻找一款粒形较短、黏性较强的大米,用于制作寿司。一位来自中东的客户想要寻找一款高筋度、富含蛋白质的硬质小麦,用于制作面包和披萨饼。还有一位来自非洲的客户,想要寻找一款颗粒均匀、色泽鲜亮的小米,用于制作传统的小米粥和小米饭。

除了各种粮食品种的特殊需求,客户对粮食的营养成分、加工特性、储存条件等方面也提出了更高的要求。一些健康餐厅需要淀粉含量低、蛋白质含量高的粮食;一些大型食品加工企业需要水分含量稳定、不易碎裂的粮食;一些物流公司需要耐储存、不易霉变的粮食。

面对如此复杂多变的需求,老智意识到传统的粮食管理方式已经无法满足客户的需求了。

A:为啥呢?

L:因为这已经不是一个特定的某品种某产地某价位的确定性需求了,如果是这样属于经典的关系型数据库场景,粮仓的设计是可以应对。现在的需求是维度很多且复杂多变不固定,此时传统的关系型数据库模式就显得非常困难了。

A:原来是这样。

L:现在老智需要一种更加智能化、精细化的管理方式,能够快速、准确地匹配每一位客户的特定需求,这是一个挑战,更是一个机会,如果能完美满足这些来自世界各地五花八门的多元化需求,老智的业务将达到一个全新的台阶,现在老智的粮仓拥有全世界最丰富的粮食品类,是具备满足这些多元需求的前提条件的,缺少的就是实现的技术手段,怎么办?

A:L老师,您不说我还真想不到会有如此多元的需求啊,大开眼界了。

L:就在此时,老智撇了一眼正在疯狂自我训练的无名,忽然一拍大腿,喊了一声,哎呀,我怎么就没想到啊!

「40.集向量、关系模型为一体的超融合数据库」

A爸:发生什么事了,无名要闪亮登场了?

L:是的,大家别忘了,无名的体内可是植入了数据库啊。而且是一种超融合数据库,既能支持关系模型,又能支持向量模型,还能支持时序、GIS、图......而现在向量模型数据库正好在当下有着用武之地。老智意识到这一点,乐坏了,真是天助我也!老智兴奋地喊来无名,他们的对话开始了。

老智: 无名啊,大模型村的粮仓管理面临着前所未有的挑战,不同地区的客户对粮食的需求千差万别,有的追求口感,有的注重营养,还有的希望匹配当地的特色菜肴。传统的粮食分类方式已经无法满足日益增长的个性化需求。我忽然想到,你体内的那个向量模型数据库,很可能是破解当下难题的关键!

无名: 是啊,您说的是对的!我体内的向量模型数据库可以将粮食的各种属性,如口感、颗粒、营养成分、适合的菜系等,都编码成高维向量。通过计算向量之间的距离,就可以精准衡量粮食的相似程度。这样一来,无论客户提出什么要求,我们都能快速找出最匹配的粮食组合。而且您别忘了我可是有深度神经网络加持,具有强大的大语言模型能力,您找我办正事,可是找对了啊。

Image

老智:啊,你既然这么清楚,为啥不早点告诉我?

无名:可您也没问我啊。

老智忽然意识到最近自己真是忙糊涂了,眼前的无名可是拿到AI盟主的大侠,又结合了甲骨大师植入的数据库,可谓神通广大,当初要是早和无名交流,哪还会有现在的烦恼。不过好在现在意识到也还来得及,于是老智说干就干,和无名紧锣密鼓的投入到工作中去。

他们先是对超级粮仓内所有粮食进行了全面采集和分析,从数百项指标中提取出最能代表粮食特性的关键属性。接着,他们将这些属性向量化,存入无名体内的向量数据库,并与原有的关系型数据库实现了无缝对接,打造出了一个超融合数据库。

几经优化,一个基于超融合数据库的智能粮食推荐系统终于诞生了!这个系统采用了先进的机器学习算法,能够根据客户输入的喜好、用途等条件实时推荐出最合适的粮食组合。比如,来自意大利的客户想要制作传统的意面,系统立即推荐了颗粒均匀、筋度适中的杜兰小麦;而来自新加坡的客户希望用米制作充满东南亚风情的海南鸡饭,系统则找出了那批颗粒饱满、软硬适中的原产地大米。

不仅如此,无名还能根据客户的反馈自主学习,不断优化推荐策略。渐渐地,无名俨然成了一位“懂你所需”的私人粮食管家,能够为全球客户量身定制专属的粮食解决方案。

A爸:今天收获太大了,不仅让我了解了关系和向量模型数据库,还通过无名和老智的故事深刻体会到大语言模型和数据库的结合的巨大威力,给我极大的启发。

L:大家还记得上次我们提到的老智和老甲提过他在憋一个大招吗,这个大招并不是回来后成为农场主这件事,而是培养一种能让无名能发挥更大用武之地的超能力。也正是因为一直在训练无名这个能力,导致老智都没想到让无名来解决粮食多元化需求的问题。接下来无名的这个超能力要爆发啦!

小朋友们:是什么超能力啊,快说快说。

L:时候不早了,咱们下回分解吧。


小朋友都能懂的人工智能(下)目录:

⑨Hi AI, Database is all you need 32-35 

⑩大白话数据库 36-40  

⑪一滴墨汁成就一代画师 41-44  ✓

⑫从画师到视频大师 45-49

第11集导读

无名在山中悟道,领悟了一滴墨汁晕开的玄机,从而获得了惊人的绘画能力。这背后的原理究竟是什么?
原来墨汁在水中的扩散遵循高斯分布,这个过程在理论上是可逆的。而AI绘画采用的扩散模型(Diffusion Models)也是如此,通过在原图中逐步添加噪点直到看不出原图,然后再让AI从噪点反推回原图,就像墨汁晕开的逆过程。这种作画方式不仅效率更高,还能创造出更加多样化的作品。
文章用通俗易懂的例子和故事生动地讲解了扩散模型的原理,揭示了AI绘画的神奇之处。
想了解更多AI绘画的奥秘,就让我们一起跟随L老师的脚步,一起探索吧!

「 41. 无名悟道带来希望」

L:话说有了老智的统筹和无名的助力,大模型村的粮食生意可谓风生水起,不过老智的成功也吸引了不少强有力的对手进场,在竞争压力下,大模型村的业务规模逐步下滑,村民们着急地为此事组织会议研讨。不过老智却显得信心满满,因为他刚从无名那得知一个好消息。

会上,不少村民们指出,业务下滑的主要原因是宣传投入太少了,相比而言竞争对手在各大搜索、视频、社交等平台均有大量图文、视频的宣传投放。也有人提出反对意见,认为大模型村抽不出更多的人手来加大宣传投入,还是把精力放在提升产品质量上好,短期业务下滑不用担心,酒香不怕巷子深。

老智不慌不忙的说,”你们说的都对,咱们就既重质量,又重宣传,还不增加人手吧。”。此言一出,村民们都有些发懵,去哪找这么好的事啊?老智猜到了大家的心事,于是领着众人来到一座山中房屋前。这一刻,大模型村命运的齿轮将再次转动。

A:这么神秘啊!

L:开门的正是无名,一见面老智就紧紧的抱住无名,兴奋的问,“你真的参透了其中的玄机?”。无名肯定的点点头。老智激动地又蹦又跳,好一会儿才停下来。看着一头雾水的村民们,老智拿了一瓶墨汁,将其中一滴倒入一杯装满清水的杯子中,随着墨汁的扩散,整杯清水转眼间化为黑水,然后给村民们进行了解释。

原来,老智带无名在龟谷治疗失忆期间,一位神秘人向老智展示了一滴墨汁晕开的过程,并告诉老智只要无名能参透其中玄机,无名将在语言以外的绘画、视频等方面继续突破,从而成为全能战士。满怀期待的老智就安排无名在这安静的山中小屋中去参透,没想到真被无名给悟出来了!

Image
A爸:就这一滴墨汁,这么神奇?

L:是的,果然如神秘人所说,无名参透了墨汁后,立即领悟了作画的真谛。接下来是无名的表演时刻。他让大家提任意的要求,他都能在几秒内完成绘画,且无论需求贴合度和绘画质量都让人无可挑剔,引发众人阵阵惊呼。可以说,一滴墨汁成就一代画师。

Image

村民们意识到,有了无名的这种逆天能力,大模型业务真可以做到”既重质量,又重宣传,还不增加人手“,老智所言不虚啊,大家之前的焦虑瞬间一扫而空。

A爸:这....无名也太厉害了吧,这背后是什么原理啊?

「42. 墨汁的扩散,随机却有规律」

L:别着急,咱们也来参透参透。大家都知道墨汁晕开就是一种扩散过程,墨汁最终会和水融为一体。现在我问大家一个问题,谁可以让这杯黑水回到一开始刚刚扩散的样子?

Image

众人纷纷摇头,说不可能。
L:是的,但是我们还是可以找到一点规律的。墨汁滴入水中是一种随机的扩散过程,为了寻找扩散的规律,我们可以把扩散的过程拍摄下来,然后分成一帧一帧的图片,仔细观查这些图片,我们会发现每一张图片与上一张图片比起来,墨水的微粒都会更散开一点点。其实这里是有数学规律的,即扩散满足高斯分布。
A:L老师,什么叫高斯分布?
L:举个例子,如果你把全世界人的身高做一个统计,以横轴代表每一个身高区间,纵轴代表身高处于这一身高区间的人数,就构成了一个直方图,大致的形状如下。

Image

大部分人都处于虚线所示的中间区域,越靠近两边人数就越少,但是下降的速度也会变得平缓,这就是高斯分布,又称之为正态分布或钟型分布。
C:为啥会有这么多叫法?
L:叫高斯分布是因为这是德国数学家高斯发现的数据分布规律;而正态英文"normal",原意是"正规的、常规的、正常的",表示这种分布在数据分析中频繁出现,太常见了,很多大数据量大分布都符合这个规律,比如身高、体重、收入等等;至于为啥叫“钟型分布”,大家注意看这个图,两端逐渐向下延伸,中间高两端低,看起来像不像寺庙里的大钟?
Image
C:看起来确实挺像大钟的。
L:这一滴墨汁的微粒,在下一个时间点出现的位置,在概率上是遵循高斯分布的。如果时间间隔足够小,它在上一个时间点曾经所在的位置,也是近似高斯分布的,这可不得了,意味着这从计算上是可逆的。如果我们知道在某一个时间点微粒在水中的位置,是有可能反推出上一个时间点微粒点位置的。
A:哦,原来扩散是有规律的啊。
L:现在大家知道了,虽然我们不能反演墨汁的扩散过程,但是反推大量的微粒运动过程是可能的。接下来重点来了,AI的训练和作画过程也是如此,这种方案是有一个专业的术语,称之为扩散模型(Diffusion Models)。

A爸:哦。

「 43. 墨汁即原图,扩散即噪点」

L:假设我们有一张猫的原图。然后我们逐渐的在图中添加噪点,其实就是像素上的色值,根据高斯分布逐渐扩展的过程。每次散开一些,我们就保留一张当前的图片。直到最后,完全变成一片看不出来的噪点,如下图所示。Image

这个时候我们告诉AI,这片什么也看不出来的噪点原来是什么,让它把原来的样子画出来,大家觉得AI可以做到吗?

Image
C妈:这一团模糊的,AI不可能画出来吧?
L:是的,如果是让AI一步到位,直接从这张完全看不清的照片中得到猫的原图,确实不行。

Image

不过,有了墨汁扩散的经验后,AI就有办法解决了,它不需要一次生成出最初的图片,它只需要生成出最后一张图片之前的那张图片就可以了。
Image
A爸:哦,我明白了!您之前说过一滴墨汁的微粒,在下一个时间点出现的位置,在概率上是遵循高斯分布的。如果时间间隔足够小,它在上一个时间点曾经所在的位置,也是近似高斯分布的。如此说来,在足够小的连续时间间隔内,最后一张超级模糊的图片是可以根据高斯分布,往前反推出略微清晰的图片的,就这样一步一步直到最后完全清晰。
L:A爸说的太好了!AI调整噪点的分布,将它调整后的分布跟我们给它的图片进行比对,经过不断的反复尝试,直到收敛成正确的分布,下图用钟型曲线来给大家做一个示意,比如紫色的高斯分布曲线为AI的尝试,黄色的高斯分布曲线为实际曲线,经过多次尝试匹配,一次比一次更靠谱,直至紫色和黄色的完全重叠,收敛成功!请大家仔细看下图的过程。

Image

正确收敛后顺利过关!你们看,略微清晰的图片出来了吧,如下图所示。

Image

接着继续这样类似的操作一张一张图片进行下去,最终,来到最初的图片。

Image
AI在经过无数张类似的图片训练后,AI终于学会了如何省时省力的画画了,从一堆噪点中反向扩散出一张画了,变成画猫高手了,如下图所示。
Image
A爸:真想不到,这画猫和墨汁的扩散过程真是有异曲同工之妙啊。

L: 是的,黑色的水就是全都是噪点的图,每次迭代反向扩散就是根据当前墨水的状态,推测前一个阶段水的状态,最后得到墨水没有散开前的样子就是图像最原始的那只可爱的猫。

两者从本质上是一样的,只要是随机扩散,就遵循高斯分布。有规律,机器就能通过无数次的训练去学习和加以应用。

Image

A爸:还真是挺有趣的!不过,我还是有一个疑问,AI绘画为啥要采用这种扩散模型,正常的一笔一笔画出来的方式不好吗?

「 44. AI为何要采取扩散模型来绘画」

L:A爸这个问题问的好!我给大家讲个小故事吧。有甲乙两位画师展开山水画决赛比试,画师甲来到赛场,撸起袖子拿起画笔,一笔一画一点一滴在画纸上勾勒出山谷、树木、飞鸟、河流、船只、行人....逐渐填满了整张巨幅画纸。而画家乙迟到了,到赛场时作画时间已所剩无几,怎么办?
只见画师乙不慌不忙将一桶颜料往画纸上泼去,颜料在画纸上四处晕开,瞬间布满了整张画纸。然后画师乙开始因地制宜修修补补,像山的地方就修成山,并擦拭出树木花草;像水的地方就画成水,并补上船只、飞鸟....就这样,画师乙不仅没有超时,居然比画师甲还更早提交了作品。
Image
故事说到这里,大家想到AI采用扩散模型绘画的原因了吗?
A爸:画师甲是常规作画,而画师乙就是采用扩散模型作画,我是不是可以理解为扩散模型的作画效率更高,所以AI选择了扩散模型。
L:扩散模式作画的效率更高,A爸说出了一个关键点,非常好!大家还有什么补充的吗?
A:L老师,我觉得画师乙画的虽快却意义不大,这么粗暴的画法肯定作品很丑,一定比不过画师甲的。
L:哦,故事还没结束,我继续往下说吧。两位画师提交作品后,评委们进行了现场打分,最终画师乙获胜,拿到了全国画王的荣誉称号。
A:这怎么可能?
L:其实画师乙的这种作画模式并非情急之下的应对之策,他每日都在不断的泼墨擦拭作画,已经坚持了数十年,并完成了成千上万幅作品。经过长时间的训练,画师乙对这种作画方式的分寸已经拿捏地恰到好处,已经到了一种炉火纯青的境界。
Image
C:L老师,我忽然想到,泼洒四处的颜料需要逐步完善,一点一点形成最终作品,而无法一步到位就搞定了。而您前面提的猫的图片也是如此,从模糊逐步走向清晰,而非一步到位直接生成清晰原始图。
L:是的,小C同学的总结很到位!
A:L老师,如果说画师乙通过刻苦训练,掌握这种神奇的作画模式,我是可以理解的,也相信画师乙的这种看起来很随意的作画模式,能击败一笔一划精雕细琢作画的普通人。不过画师甲可是能进决赛的大画家,不至于落败吧。
L:小A啊,其实你的话中已经蕴藏了答案,就是“随意”这两个字,正是这种随意导致作品更具有多样性,评委们见惯了各种循规蹈矩的作品,当看到画师乙的作品时,会有不一样的感觉。
假设让画师甲继续再画几张山水画,他输出的每一张依然精美,却大同小异。而画师乙则由于泼墨的随机性,导致每一张会有较大差异,也就是说画师乙的绘画天然能创造出给人觉得不一样的、没见过的、耳目一新的作品。这就是画师乙获胜的主要原因。
A:原来是这样啊!
L:关于效率我做一个补充,如果画师甲和画师乙是两个团队的话,画师乙的成员们就可以并行操作了,大家在整张画纸上共同调整优化,如果平时团队就这么一起训练的,那配合起来更是天衣无缝了。而画师甲的画图方式需要按顺序一笔一划地绘制,实现并行就困难了,画师甲的助手估计只能帮忙端端水,递递笔来打打下手了。
A爸:听起来很有道理啊,看来扩散模型还真是好处多多啊!
L:实际上扩散模型的好处远不止效率高和多样性这两点。
A爸:啊,还有什么好处?
L:今天时候不早了,关于扩散模型的其他好处我们下次再说。其实AI绘画是非常复杂的,比如让AI画“一只戴眼镜,喝着咖啡的,正在读书的小猫”。那AI得识别我们的这个指令,那怎么才能让AI听懂呢?AI能通过扩散模型最终形成这样一只可爱的猫咪,可是猫、眼镜、咖啡、书到底长什么样,AI是否是保存了一个巨大的图片库吗?

Image

大家细品一下,是不是觉得还有很多的疑问,没关系,都会整明白的,今天就到这里,咱们下回分解。

小朋友都能懂的人工智能(下)目录:

⑨Hi AI, Database is all you need 32-35 

⑩大白话数据库 36-40  

⑪一滴墨汁成就一代画师 41-44  

⑫从画师到视频大师 45-49  ✓

第12集导读

一个小男孩的翻页画给老智带来了灵感,让老智瞬间明白了视频和图片并无本质区别,只是增加了一个时间维度。

于是老智准备了大量视频供无名学习,这些视频被分解成每秒若干帧的图片,以像素数据的格式被输入到无名的深度学习网络内部,通过分析这些帧学习到物体运动规律,最终具备了生成栩栩如生视频的能力。

「 45. 小男孩画的有趣作品」

L:无名成为一代画师后,大模型村的粮食业务宣传效率显著提高,同时意外地激发了小朋友们的绘画热情。这不仅因为小朋友们把无名当作偶像,还因为只要他们向老智展示作品,就会得到一个小礼物作为奖励。
一天,一个小男孩兴冲冲地找到老智,给他展示自己的作品。老智一看,是一个小本,翻开第一页是一个小人玩篮球的简笔画,随后的每一页也大致内容差不多。看到小男孩如此有耐心,老智送给孩子一大盒巧克力,以示鼓励。
Image
小男孩看出老智并没有发现其中秘密,让老智开始快速翻页,老智不明就理的照做了,结果让老智大吃一惊,画面在连续翻页中动起来了,从第一页小人把篮球拿在手上,到往上抛,一点一点越抛越高,最后落下来砸到小人身上,小人摔倒在地,球从地上越滚越远,直至消失不见。这连贯的过程如同看电影一般一气呵成。

Image

小男孩笑着说他想把自己学篮球的经历画出来了,可一幅画无法体现自己学球的过程。好在自己忽然在翻书时受到启发,想到这种方式。
老智摸了摸孩子的头,为其创意赞赏不已,又拿了一个玩具递给孩子。小男孩左手巧克力,右手玩具,自己的小本也忘拿了,就这样蹦蹦跳跳地离开了。老智起身正要追上去,忽然望着手中的小本,陷入了沉思......

A:怎么了,老智有啥发现吗?

「 46. 视频=系列图片+时间线」

L:是的,无名从一滴墨水中领悟到扩散模型,成为一代画师后,老智开始规划进一步训练无名,让其从一代画师到视频大师。正当老智苦苦思索之时,小男孩作品的出现让老智猛然醒悟过来,顿时明白了视频的实现思路。

A爸:是什么思路?

L:其实视频和作画的过程没有本质上的区别,视频=一系列图片+时间线。无名具备了绘画的能力,实现做视频的能力就已经成功一大半了。我们来看一个猛犸象奔跑视频,如下所示。

大家都知道现在已经没有猛犸象了,这视频肯定是机器模拟出来的而非真实拍摄的。看这个效果是不是仿佛现场拍摄出来一般真实。

A爸:是啊,效果还真是炸裂啊!

L:我们来拆解一下这个视频是如何制作出来的,这个视频是由多张连续动作的照片组成的,和小男孩打球类的图片类似,以单张图为例,这是一个二维的结构,如下所示。

Image
要形成视频,则需要多了一个时间维度,将其变成三维结构,即时间轴,如下所示。
Image
在这个时间轴下对应着一系列图片,可能对应着猛犸象的各种连续的形态,如下所示。
Image
前面和大家说过,无名的作画是从一滴墨水得到的灵感(详见本文41-44 一滴墨汁成就一代画师)没错,用的是扩散模型,即逆向扩散,如下所示。
Image
这个时间维度轴下的每一张图片,都是逆向扩散而来的。
Image
就这样,视频就制作好了,是不是无名学会了绘画,离实现做视频已经成功一半了。

A爸:是啊,您的这个系列图解还真是形象生动,如此看来绘画与视频的实现确实没有本质的区别。

「 47. AI是如何学会做视频的」

L:虽说视频和做图没有本质区别,实际上要让AI做出视频的难度还是不小的!无论是打球的男孩还是奔跑的猛犸象,都是由一系列连贯的画面组成,问题在于AI如何掌握了预测下一个画面的能力,大家知道吗?

C:是不是看了很多视频后,学习出来的能力。

L:说得太对了!其实这种视频学习训练模式和之前所描述到的识图、下棋、绘画能力的学习训练模式,又是没有本质的区别!

C:没本质区别?

L:是的,咱们一起回顾一下先前的知识。AI在欣赏了无数图片后记住了世间万物的向量特征后,比如就能识猫了(详见AI爆发元年,小朋友也能读懂的人工智能(上)的⓸-⓺卷积神经网络初探),类似的棋局也是图形,在总结了无数棋型特征后,开始碾压人类顶尖棋手(详见AI爆发元年,小朋友也能读懂的人工智能(上)的⑪-⑭狗大师的修仙之路);在阅读了无数的书籍后记住了词的向量特征后,就能学富五车无所不知了(详见AI爆发元年,小朋友也能读懂的人工智能(中)的⑮-⑱大模型实现背后的惊人秘密)。这些大家都还记得吗?

众人纷纷点头称是。

L:OK,同样的道理,AI在观看了无数的视频后,自然是有可能了解到物体运动规律的,比如看了无数篮球比赛的视频后,就能在球员跳起投篮时预测到接下来的篮球如何飞行、如何命中、球如何落地等一系列动作。也就是说AI明白了打篮球的场景应该是怎样的。就这样,在AI观看了各式各样的,足够多的视频后,AI开始明白几乎所有领域的场景应该怎样的。

A爸:有趣,大道至简,方法都是相通的啊,都是在训练数据的规模足够大,在深度学习网络参数足够多的情况下,水到渠成的实现了。

L:是的,A爸的总结非到位!

A爸:对了,AI观看视频是如何观看的,和识别图片和文字一样吗?

L:对于计算机而言,只能识别0和1的数字组合编码的输入,这点识别视频和是识别文字、图片是一样的。不过视频有一个视频分解的过程,这是明显的差异。比如观看篮球视频,会把打篮球的每个动作根据时间进行切片,一个切片就是一个帧。这个帧等同于小男孩画自己打篮球的每一页。假如每秒取30帧图片,观看1分钟视频就是得到了1800张图片。

C妈:原来如此,我明白了,AI进行视频训练的工作量比图片处理要大多了啊。

L:是的,不仅AI视频训练过程的工作量很大,训练完毕进行视频生成时,工作量也非常巨大,同样假设每秒生成30帧图片,那一分钟也得处理1800张图片哦。其实无论训练还是生成阶段,即便一张图片的生成都需要投入巨大的计算资源的。

当视频被分解成每秒若干帧的图片后就进入了视频输入阶段,即将这些帧的图片以像素数据的格式被输入到AI模型里;然后进入模型学习阶段,即模型通过分析这些帧,学习到球员打球的动作规律,比如腿部和手臂的摆动等;最后是预测生成阶段,当模型看到一帧球员开始打球的图片时,AI可以根据之前学到的规律,预测并生成下一帧的图像,直至生成一个完整的打篮球视频。

Image
A爸:L老师,您这一梳理,我们可算是明白了。近期Open AI推出的SORA的视频演示惊艳全球,就是这训练出来的啊。

L:说到SORA,先来看一下最近刷屏的一段视频,根据下面这段文本生成:“一位时尚的女士走在东京的街道上,街道上充满了温暖的霓虹灯和生动的城市标志。她穿着黑色皮夹克、红色长裙和黑色靴子,手里拿着一个黑色钱包。她戴着太阳镜和红色口红。她走路自信而随意。街道潮湿且反光,形成了彩色灯光的镜面效果。许多行人走来走去。”

C妈:哇,这段高清视频堪称完美呈现了文字中所描述的内容!

「 48. SORA视频的惊艳与自注意力机制」

L:是的!其实SORA训练的机制大抵也是如此。当然了,关于AI视频实现的细节远比我们描述的要复杂的多,这里只是让大家从逻辑上有一个宏观的认识。

Sora生成的视频具有长距离的一致性和物体永恒性。通俗地说就是可以在人、动物和物体被遮挡或离开画面时保持它们的持续存在,比如当路人经过时,下面的狗狗一直完整地存在视频中。同样,可以在单个样本中生成同一角色的多个镜头,保持他们在整个视频中的外观,如下所示。

甚至,视频中可以存在类似于真实世界的互动。例如,一位画家可以在画布上留下持续一段时间的新笔触,这真的看不出来是真画师还是假画师了,如下所示。

Sora生成的视频,就能做到汉堡被吃掉的部分就没了,并留下咬迹,如下所示。

C妈:不可思议!和真实世界如此接近,这怎么做到的啊?

L:怎么做到的?这里依赖一个之前我们反复强调过的关键技术。

C妈:什么技术?

L:自注意力机制(Self-attention),大家还记得吧。这正得益于自注意力机制,允许模型在处理当前帧时,不仅考虑与当前帧相邻的帧,还能关注视频中更远的帧。能够在全局范围内捕捉到不同时间点和空间位置的相关性,从而实现时间连续性和逻辑一致性。

A爸:L老师,今天咱们聊AI视频,您居然翻出了那么多之前讲过的知识点,看来AI视频是各种技术综合应用的产物啊。

L:是的,新突破往往是站在巨人的肩膀上。

众人点头称是,也颇有感悟。

「 49. 孩子们难忘的六一儿童节」

L:咱们继续说故事吧,话说老智顿悟后立即采取行动了,打造了一个超级大会议室,里面摆放了数以千计的大屏幕,每个屏幕都在播放来自几乎所有领域的各式视频。同时老智让无名戴上特制的编码转换器眼镜和自注意力机制头盔,然后,无名同时盯着所有的大屏,开启了不分昼夜的视频训练模式。很快,无名看完了全部视频,出关了!

Image
老智立即对无名展开了测试,结果发现无名真的可以依据他所提的任何条件,随心所欲的生成各种流畅惊艳的视频。看来真多的是练成了!老智开心地蹦蹦跳跳起来。

激动不已的老智当即就想到给村民们报喜,不过转念一想,有没有更有趣的方式来制作惊喜呢?他看着墙上的日历,马上六一了,心中顿时有了主意。

A:啥主意?

L:老智叫来了大模型村的孩子们,分给他们许多糖果和玩具,小朋友们个个开心极了,接着老智便问孩子们最喜欢听什么样的故事。孩子们更兴奋了,纷纷说出了自己想听的故事,老智认真的记录着。

六一儿童节当日,老智组织了一场大模型村儿童户外活动,画画、游戏、烧烤,孩子们玩得非常开心。晚餐过后,正当孩子们以为活动结束准备互相道别时,老智猛然揭开一块巨幅布帘,一个精心准备的露天电影院出现了!

小朋友们惊呆了,于是惊喜地坐在草坪上观看起电影。电影一开播,引起了孩子们此起彼伏的快乐惊叫声。

原来,这个电影是无名依据老智的陈述做的视频,内容正来自孩子们想听的故事,无名将这些故事巧妙的串联成一个精彩的童话,并制作成一部生动有趣且极为流畅的动画大片,更让孩子们意想不到的是,无名把每个小朋友形象都搬到银屏上,让他们成为了小小演员,和童话故事的情节融为一体。

Image

村民们也是惊喜不已,因为有了无名这种制做视频的逆天能力,粮食业务的宣传还需要担心吗?

C妈:精彩精彩,听得我都激动无比。

小朋友们:我们也要像大模型村小朋友一样,看到这样的电影。

L:当下,即便SORA也不具备这么强的能力,不过相信故事很快就会变成现实。实际上这种制作视频的能力远不止是宣传、娱乐、教育这些用途,还有更大的作用,将会极大的改变这个世界。

A爸:改变这个世界,这么厉害?

L:是的,今天就先到这里,咱们下回分解。


预告:《超融合数据库》即将出版,关注梁老师公众号,敬请期待。

Image

Image