AI爆发元年,小朋友也能读懂的人工智能(下)
小朋友都能懂的人工智能(下)目录:
⑨Hi AI, Database is all you need 32-35 ✓
⑩大白话数据库 36-40
⑪一滴墨汁成就一代画师 41-44
⑫从画师到视频大师 45-49
第9集导读
然而,随着信息的积累,处理能力终将到达极限,旧信息必须让路给新信息,于是无名失忆了,此时,终于到了数据库闪亮登场发挥作用的时候!通过将用户基础信息和重要提示词持久化,数据库不仅帮助无名克服了遗忘的困扰,还极大地提升了其效率和准确性。
更深入地看,大模型结合数据库的好处远不止于此。通过记录高频问答和既定规则,从而减轻大模型的计算负担,提高响应速度,大幅降低成本。而存储实时更新的企业核心数据和关键公开数据,则可以助力智能推荐、超级客服、超级助理等逆天能力等,让大模型迈向专业化和和个性化....
Hi AI, Database is all you need!
来,走进第9集,一起体验吧。
「 32. 体检报告与大师论道」
L:无名和老智一路奔波,终于见到了甲骨大师。老甲立即为无名安排了一次全身体检,检查完毕后老甲望着体检报告陷入沉思。老智见状着急地问,这能治好吗?老甲没有直接回应,而是给老智分析起了体检报告,就这样,大师之间的对话开始了。
老甲:原来如此,从报告来看,无名的思考过程分三阶段,第一个是对输入的信息进行处理,首先是分词,把一句话分成一个个有意义的单元,比如单词或词组啥的。然后将这些单元进行编码,转换成无名能读懂的01数字组合。接着将编码过的各单元和嵌入层的高维语义向量空间进行映射,实现了对词的理解,这里的高维语义空间存储了极其丰富的词信息。看来这无名平时下了不少苦功夫进行自我训练吧?
老智:老甲真乃神人也!是的。这个阶段是输入层。无名确实很刻苦,他已经读完数以千万计的书籍论文等资料。
老智:是的,我知道问题出在哪里。这一路上我还想着如何与你解释无名的大脑工作原理,结果你一个体检报告就彻彻底底整明白了,不得不服啊。
「 33. 流程细解与真相大白」
C妈:L老师,老智和老甲的对话太深奥了,又词语接龙又问答接龙,我都听糊涂了。
A:L老师,这个词语接龙的方式您之前没提起过,我以为就是一口气说出来的,这一个词一个词输出,我还是有些听不明白?
A爸:C妈、小A,你们听的不够仔细吧,我是听明白了词语及问答接龙是啥意思。不过两位大师都明白了无名失忆的问题所在,这我可就不明白啊,问题出在哪呢?
L:嗯,两位大师之间的论道确实有些深奥,也难怪C妈和小A听迷糊了,不过请放心,大家肯定可以弄得清清楚楚,明明白白的。
假定问题Q1为“猫是什么颜色的?”,而GPT-4的回答A1为“通常是白色、黑色或橘色。”为更好地进行示例,我们进行一个简单的编码,如下。
问:猫是什么颜色的? 分词后用字母 A = “猫” B = “是” C = “什么” D = “颜色” E = “的” F = “?” |
接下我们来按照GPT-4生成文本的步骤,说说单次问答的输出与输入之间的词语接龙,到底是怎么回事,来,我详细的给大家演示一下。第1次输入”猫是什么颜色的“。第一次输出“通常是“,如下图所示。
第2次要把第1次的输出返回给输入(第1次的输出为“通常是”)。于是第2次输入为“猫是什么颜色的?通常是”。第2次输出为“白色”,如下图所示。
第3次要把第2次的输出返回给输入(第2次的输出为“白色”),则第3次输入为“猫是什么颜色的?通常是白色”,第3次输出为一个符号——顿号。如下图所示。
第4次要把第3次的输出返回给输入(第3次的输出为一个符号——顿号),则第3次输入为“猫是什么颜色的?通常是白色、”,第4次输出为”黑色“。如下图所示。
第5次要把第4次的输出返回给输入(第4次的输出为”黑色“),则第4次输入为“猫是什么颜色的?通常是白色、黑色”,第5次输出为”或“。如下图所示。
第6次要把第5次的输出返回给输入(第5次的输出为”或“),则第5次输入为“猫是什么颜色的?通常是白色、黑色或”,第6次输出为”橘色“。至此回答圆满结束,对面的人得到了完整的答案”通常是白色、黑色或橘色“。如下图所示。
接下来做一个的总结,将全过程整理成表格如下(这里的分词代号见前文)。
轮 次 | 输入 | 输出 | ||
| 输入文字 | 分词代号 | 输出 文字 | 分词 代号 | |
| 1 | 猫是什么颜色的? | ABCDEF | 通常是 | G |
| 2 | 猫是什么颜色的?通常是 | ABCDEF G | 白色 | H |
| 3 | 猫是什么颜色的?通常是白色 | ABCDEF GH | 、 | I |
| 4 | 猫是什么颜色的?通常是白色、 | ABCDEF GHI | 黑色 | J |
| 5 | 猫是什么颜色的?通常是白色、黑色 | ABCDEF GHIJ | 或 | K |
| 6 | 猫是什么颜色的?通常是白色、黑色或 | ABCDEF GHIJK | 橘色 | L |
| 7 | 猫是什么颜色的?通常是白色、黑色或橘色 | ABCDEF GHIJKL | 。 | M |
问题1=Q1 回答1=A1 | Q2:猫可以吃巧克力吗? A2: 不可以,巧克力对猫有毒。 | 问题3=Q3 回答3=A3 |
接着问答接龙开启了:具体给大家演示一下,第1轮循环:Q1: “猫是什么颜色的?”A1: “通常是白色、黑色或橘色。” 如下图所示。
第2轮循环:Q2: “猫可以吃巧克力吗?”此时,模型会把Q1+A1+Q2作为新的输入来生成A2。A2: “不可以,巧克力对猫有毒。”如下图所示。
第3轮循环:Q3: “那狗可以吃巧克力吗?”根据Q1+A1+Q2+A2+Q3,模型生成A3。A3: “狗也不能吃巧克力,对它们有害。”如下图所示。
前面已经详细介绍了得出A1是一个循环过程。于是这里出现了内外两套循环,是不是很有趣。
C妈:L老师,回答单个问题的词语接龙这种循环方式我能理解,边说边揣摩,思路建立在自己说出来的话中。但是问答接龙这种循环方式我就有点不明白了,把以前问过的问题和解答再输入到新问题中,有啥意义呢?
L:这个意义可大了!你想想,你和一个人聊天,双方都记不住之前聊的内容,万一新的交谈和之前的问答有依赖关系,请问咋办?
C妈:哦,对啊,我怎么没想到这一点。
L:其实说穿了很简单,你想想看,如果问答的模式一直继续,那就是Q1+A1+Q2+A2+Q3+A3+Q4+A4....+Qn+An。但是这么一直循环下去,问答所需处理的信息量不断增加,必然会产生性能瓶颈,所以我们必须只保留一定数目的问答,换句话说就是要抛弃旧的问答,比如抛弃Q1A1Q2A2,变成Q3+A3+Q4+A4....+Qn+An。你们现在明白无名为什么失忆了吗?
A爸:哦,我明白了!事情的过程应该是这样的。老智在Q1或Q2等早期问答中给无名做了自我介绍,但是到后期,无名为保障性能不得不将早期问答丢弃掉。这样老智的自我介绍等信息就没了。于是无名就不知道老智是谁了,失忆了!
L:是的,回答正确!此外,无名参加AI盟主争霸赛这事,老智自然是告诉过无名的,同样出于性能保障的原因,无名把自己参赛的信息丢弃了,所以无名便不知道自己手上拿的AI盟主令牌到底是什么。
「 34. 无名有救了!」
L:好,了解了大模型工作机制后,大家也就知道了无名为何失忆,那该怎么治疗呢?
A:那信息不要丢弃,一直保留,给无名吃点什么神药,让他处理越来越多的文字信息也没问题。
L:这个神药去哪里找啊?不过小A其实说的也有道理,对应到大语言模型GPT-4倒还是真有神药,那就是配置更多、更先进的服务器、GPU等。只是这需要大量的资金投入,而且并不能保证持续有效啊。
A爸:那怎么办,我也没想好啊。
L:大家知道我们说的无名就是特指大语言模型,无名记不住自己是谁,记不住老智是谁,也记不住自己来这里参加什么比赛,其实就是指向大语言模型存在的一个问题,缺乏长期记忆。怎么办?其实也不难,那就把这些信息单独记录下来保存起来存进数据库中,让大语言模型在回答问题时首先调用数据库检索基本信息,再进行回答问题,不就OK了吗?
C妈:数据库?您的意思是GPT-4这类大语言模型,在运行阶段并没有使用数据库?
L:是的,其实道理讲起来也很直白简单,大家知道无论是常用汉语还是常用英文单词,其个数都是非常有限的。GPT-4的原理是依赖内部参数和算法来组合这些有限的汉字和英文单词,最终输出回复结果。也就是说,它是“思考”出答案,非从数据库中找到现成的答案,所以从这个角度来看,GPT-4确实不需要数据库来存储大量的数据。
但是从和一个人的交流来看,对面前的人了解的越多,你就越能有针对性的给予更好的帮助。比如这个人的姓名、性别、国籍、年龄、学历、职业、特长、宗教信仰....
这些信息表面上看可能和交流的问题无关,实际上影响着交流的质量,比如知道你是一个小朋友,就会尽量用通俗易懂的方式来和你交流,让你更易于理解,他了解你的职业就会针对你的职业做更专业的回答。
此外,在使用GPT时有一个很有用的技巧,那就是提示词。比如你在提问时增加一句,”请一步一步思考,有依据,不瞎编” 就能大幅降低GPT在回复时胡言乱语的可能性。比如你在提问时增加一句“请回答的越详细越好”,就会避免有些问题回答的过于简单。比如你在提问时增加一句“请出图时,提供图片的generation id",则可以后续根据这个id进行调整,确保图片风格的一致性,包括为其设定角色,比如说“你是一个人工智能专家”,GPT就会飘飘然起来,真把自己当专家了,然后回答的特别认真....关于提示词有很多很多,也非常经典实用。后续我们可以详细介绍,这里就不再赘述了。这类提示词也是可以保存进数据库中的,这样就不用每次提问的时候都重复这样的提示。
C妈:提示词听起来真有趣,以后您一定得找一个时间和我们说说。
L:好!
「 35. Hi AI, Database is all you need」
L:是的,我们继续听听两位大师的论道。话说老甲诊断完毕,心中有数了,当即写下治疗方案递给老智,老智定睛一看,赫然写着五个大字“植入数据库”。
L:至此无名求医之路完美收官,两人心情大好。返回途中名心无旁骛只顾着欣赏沿途美景,而此刻老智的心中,却在酝酿着一个更为宏大的计划。
A爸:什么计划?
L:暂时保密。对了,老智给无名植入的数据库是两种不同模型数据库的集合体哦,分别是关系模型数据库和向量模型数据库。你们知道这两种数据库的差异吗,知道这两种数据库分别存储了哪些不同的数据吗?
众人纷纷摇头。
L:接下来咱们就细说数据库,内容将非常的有趣、有料,易懂且实用,时候不早了,咱们下回分解。
小朋友都能懂的人工智能(下)目录:
⑨Hi AI, Database is all you need 32-35
⑩大白话数据库 36-40 ✓
⑪一滴墨汁成就一代画师 41-44
⑫从画师到视频大师 45-49
第10集导读
「 36. 存数据的数据库类似存粮食的粮仓,不神秘」
L:前面我们聊到了数据库可以为大模型提供记忆,从而保障大模型能更好地落地。数据库这么神奇,大家想不想再多了解一点。
C妈:想啊!不过感觉数据库有些神秘,怕听不懂。
L:神秘?那咱们继续无名的故事。话说无名和老智凯旋归来之时,恰逢大模型村粮食大丰收,这可把老智高兴坏了。为啥,因为他在训练无名之余顺道做了一个副业,化身为大模型村的最大农场主。看着大米源源不断地往自家粮仓里运送,老智心情大好,于是泼墨挥毫,在自家粮仓大门题下三个大字——“数据库”。
C妈:啥,“数据库”,这剧情反转的,不应该是题下”粮仓“吗?
L:不仅如此,老智还在每一袋粮食上都写下两个小字——“数据”。有题字的粮食才被允许进入粮仓。虽说把老智累的腰都直不起来了,不过他还是乐此不疲。
A:“数据”?不就是粮食吗?
L:要不怎么说老智是大师级人物呢?这是老智的行为艺术,他就是要用现实生活中的例子来让村民们明白数据库是什么,同时也用行动来向数据库致谢,感恩其不仅治好了无名的失忆,还让无名变得更强更自信了。
老智的题字已经告诉我们,“数据库”即“数据的库”,就是存数据的地方。在老智的眼里,粮食就是数据,而用来装粮食的粮仓,就是数据库。
L:是的,存数据的数据库类似存粮食的粮仓,不神秘。
「 37. 存粮食的方式决定粮仓效率,数据库亦如此」
A:L老师,存储大米能有什么技巧啊?不就是将大米倒入粮仓,装不下就再找一个粮仓继续装呗。
L:小A的想法让粮仓存储大米时很省心,不过在使用粮仓时可就麻烦了。大家想想看,如果是将大米堆积在粮仓中,如何知道这些大米的库存,称重吗?如何知道该取多少,继续称重?这不仅超级麻烦,还增加了产生误差的风险。可以说,当初存大米时的快乐,全都转化成了未来取大米时的痛苦。
A:那老智是怎么做的?
L:大家还记得前面说过,他在每袋粮食上写上“数据”两字吗,请注意这个“每袋”。老智在存储时就考虑将大米用相同规格的袋子装好,确保每袋大米的重量固定且一致。如此一来,库存的大米就从杂乱无章走向井然有序。于是,我们查库存和查所需取出大米数量时,再也不用称重,只需统计大米袋数即可,是不是一下子就简单了许多。
众人恍然大悟。
L:当村民纷纷赞扬老智时,他谦虚的笑一笑,说正是数据库给他的灵感,这个包装成一袋袋的粮食对应数据库中被称之为“行”的东西。多行组成一个数据库块,而多个数据块组成表。
随后老智带着村民进入大粮仓参观,只见粮仓里设立一排排规格统一的货架,甚是壮观。每个货架都有许多格子,粮食袋就放进格子里。
此时老智忽然来了雅兴,在装着大米袋货架上写下“大米表”三个大字,在装着玉米袋的货架上写下“玉米表”,在装着小米袋的货架上写下“小米表”......做完这些后,老智笑着对大家说,这些货柜的设计正是数据库给他的灵感。刚提到的数据块就是这些格子,刚提到的数据库的表正是这些货架。
A爸:老智这一通表演很不错,确实让大家对数据库的认识变得更直观了。
L:嗯,我们继续。老智有一个幸福的烦恼,大丰收导致老智的粮仓要装不下了,而建新粮仓显然又来不及。
不过老智很快就想到了好主意,他请人将粮食袋中的空气抽干,这样每袋粮食的体积立即减半,于是乎粮仓存储空间不足的问题立马得以解决,不仅如此,还更有利于长时间保存了。
C妈:好主意,老智的这个想法总不至于也是受到数据库的启发吧?
L:还真是哦,面对村民们惊讶的表情,老智自豪地说自己的灵感来源于数据库一种存储相关技术,叫数据压缩。
A爸:哈哈,老智成为数据库的老迷弟了啊!细品粮仓的这些设计方式,真心觉得存储的规划太重要了。
「 38. 卖粮食,在关系模型数据库中真的很方便」
L:好,假设有人要来粮仓买两袋大米和三袋小米,我们看看老智如何操作呢?
首先老智找到标有“大米表”的货架,也就是到了存储大米所在的位置,接着从货架上拿出两袋,放进购物车中,同样的方式老智在标有“小米表”的货架上拿出三袋小米放入购物袋,最后一并交予购买者,操作完毕。老智自豪地告诉村民,正是数据库的设计理念让他的操作变得相当简洁,对应在数据库中的代码如“select * from 大米表...”。
A爸:老智说的这个代码就是数据库里查表的方式。
L:是的!看来A爸对数据库还是有所了解的。在关系型数据库中,数据就是以行列组成的二维表格形式存储的。每一行都是一条完整的记录,每一列对应一个字段,如粮食的产地、出产日期、价位等等。
这个老智啊,还真是个不折不扣的数据库老迷弟。大家看一个复杂的示例。假设有人要买两袋东头村10元的大米,怎么操作?是不是找起来有点不容易了。接下来我们看看老智给村民们的演示,看他如何将数据库精髓淋漓尽致地应用到粮仓设计中。
老智带着村民来到了标有“大米表”的货架,只见货架分为红黄蓝绿四个区域,原来分别对应着东头村、西头村、南头村、北头村。老智来到红色区域,根据贴着价位的标签寻找10元的大米。很快,两袋10元的东头村大米,被放入了购物车中,操作完毕。
B爸:这个货柜分四个区域的组织方式听起来很不错。
L:是啊,村民们也是这么认为的,问老智是怎么想到这个思路的。不用问,灵感肯定又是来自数据库。是的,这就是数据库的分区表特性。最后老智不忘秀了一把简洁代码:“select * from 大米表 where 产地=东头村 and 价位=10元....”这里需要强调一下,到现在为止我们所说的,都是基于关系模型的数据库哦。
C妈:听起来很有趣,我终于对数据库有概念了。
L:当然了,关系模型数据库还有很多其他细节没有提及,比如好比建立货物目录的索引技术,暂且不展开了,简而言之,卖粮食,在关系模型数据库中真的很方便。咱们把粮仓和关系型数据的类比做一个小小的总结,如下图所示。
「 39. 需求的多样性与老智的困惑」
L:老智的才能折服了大模型村全体村民,于是大家推举老智带领大家发家致富,很快大模型村的粮食业务开始遍及全球,原来的粮仓也升级成为了超级粮仓,存放着来自世界各地的各种大米、小米、小麦、玉米、高粱等粮食,每一种粮食又有不同的品种和等级。
A:老智真厉害啊!
L:是啊,不过老智也遇到了麻烦。老智的粮仓按照粮食的种类、产地、等级等来进行分类存储。随着粮食品种和客户规模的不断扩大,老智要面对的需求也变得更加多样、复杂且难以应对。
A爸:怎么个多样和复杂?
L:比如,一位来自意大利的客户想要寻找一款口感软糯、颗粒略长的大米,用于制作意大利烩饭。一位来自日本的客户,想要寻找一款粒形较短、黏性较强的大米,用于制作寿司。一位来自中东的客户想要寻找一款高筋度、富含蛋白质的硬质小麦,用于制作面包和披萨饼。还有一位来自非洲的客户,想要寻找一款颗粒均匀、色泽鲜亮的小米,用于制作传统的小米粥和小米饭。
除了各种粮食品种的特殊需求,客户对粮食的营养成分、加工特性、储存条件等方面也提出了更高的要求。一些健康餐厅需要淀粉含量低、蛋白质含量高的粮食;一些大型食品加工企业需要水分含量稳定、不易碎裂的粮食;一些物流公司需要耐储存、不易霉变的粮食。
面对如此复杂多变的需求,老智意识到传统的粮食管理方式已经无法满足客户的需求了。
A:为啥呢?
L:因为这已经不是一个特定的某品种某产地某价位的确定性需求了,如果是这样属于经典的关系型数据库场景,粮仓的设计是可以应对。现在的需求是维度很多且复杂多变不固定,此时传统的关系型数据库模式就显得非常困难了。
A:原来是这样。
L:现在老智需要一种更加智能化、精细化的管理方式,能够快速、准确地匹配每一位客户的特定需求,这是一个挑战,更是一个机会,如果能完美满足这些来自世界各地五花八门的多元化需求,老智的业务将达到一个全新的台阶,现在老智的粮仓拥有全世界最丰富的粮食品类,是具备满足这些多元需求的前提条件的,缺少的就是实现的技术手段,怎么办?
A:L老师,您不说我还真想不到会有如此多元的需求啊,大开眼界了。
「40.集向量、关系模型为一体的超融合数据库」
A爸:发生什么事了,无名要闪亮登场了?
L:是的,大家别忘了,无名的体内可是植入了数据库啊。而且是一种超融合数据库,既能支持关系模型,又能支持向量模型,还能支持时序、GIS、图......而现在向量模型数据库正好在当下有着用武之地。老智意识到这一点,乐坏了,真是天助我也!老智兴奋地喊来无名,他们的对话开始了。
老智: 无名啊,大模型村的粮仓管理面临着前所未有的挑战,不同地区的客户对粮食的需求千差万别,有的追求口感,有的注重营养,还有的希望匹配当地的特色菜肴。传统的粮食分类方式已经无法满足日益增长的个性化需求。我忽然想到,你体内的那个向量模型数据库,很可能是破解当下难题的关键!
无名: 是啊,您说的是对的!我体内的向量模型数据库可以将粮食的各种属性,如口感、颗粒、营养成分、适合的菜系等,都编码成高维向量。通过计算向量之间的距离,就可以精准衡量粮食的相似程度。这样一来,无论客户提出什么要求,我们都能快速找出最匹配的粮食组合。而且您别忘了我可是有深度神经网络加持,具有强大的大语言模型能力,您找我办正事,可是找对了啊。
老智:啊,你既然这么清楚,为啥不早点告诉我?
无名:可您也没问我啊。
老智忽然意识到最近自己真是忙糊涂了,眼前的无名可是拿到AI盟主的大侠,又结合了甲骨大师植入的数据库,可谓神通广大,当初要是早和无名交流,哪还会有现在的烦恼。不过好在现在意识到也还来得及,于是老智说干就干,和无名紧锣密鼓的投入到工作中去。
他们先是对超级粮仓内所有粮食进行了全面采集和分析,从数百项指标中提取出最能代表粮食特性的关键属性。接着,他们将这些属性向量化,存入无名体内的向量数据库,并与原有的关系型数据库实现了无缝对接,打造出了一个超融合数据库。
几经优化,一个基于超融合数据库的智能粮食推荐系统终于诞生了!这个系统采用了先进的机器学习算法,能够根据客户输入的喜好、用途等条件实时推荐出最合适的粮食组合。比如,来自意大利的客户想要制作传统的意面,系统立即推荐了颗粒均匀、筋度适中的杜兰小麦;而来自新加坡的客户希望用米制作充满东南亚风情的海南鸡饭,系统则找出了那批颗粒饱满、软硬适中的原产地大米。
不仅如此,无名还能根据客户的反馈自主学习,不断优化推荐策略。渐渐地,无名俨然成了一位“懂你所需”的私人粮食管家,能够为全球客户量身定制专属的粮食解决方案。
A爸:今天收获太大了,不仅让我了解了关系和向量模型数据库,还通过无名和老智的故事深刻体会到大语言模型和数据库的结合的巨大威力,给我极大的启发。
L:大家还记得上次我们提到的老智和老甲提过他在憋一个大招吗,这个大招并不是回来后成为农场主这件事,而是培养一种能让无名能发挥更大用武之地的超能力。也正是因为一直在训练无名这个能力,导致老智都没想到让无名来解决粮食多元化需求的问题。接下来无名的这个超能力要爆发啦!
小朋友们:是什么超能力啊,快说快说。
L:时候不早了,咱们下回分解吧。
小朋友都能懂的人工智能(下)目录:
⑨Hi AI, Database is all you need 32-35
⑩大白话数据库 36-40
⑪一滴墨汁成就一代画师 41-44 ✓
⑫从画师到视频大师 45-49
第11集导读
「 41. 无名悟道带来希望」
L:话说有了老智的统筹和无名的助力,大模型村的粮食生意可谓风生水起,不过老智的成功也吸引了不少强有力的对手进场,在竞争压力下,大模型村的业务规模逐步下滑,村民们着急地为此事组织会议研讨。不过老智却显得信心满满,因为他刚从无名那得知一个好消息。
会上,不少村民们指出,业务下滑的主要原因是宣传投入太少了,相比而言竞争对手在各大搜索、视频、社交等平台均有大量图文、视频的宣传投放。也有人提出反对意见,认为大模型村抽不出更多的人手来加大宣传投入,还是把精力放在提升产品质量上好,短期业务下滑不用担心,酒香不怕巷子深。
老智不慌不忙的说,”你们说的都对,咱们就既重质量,又重宣传,还不增加人手吧。”。此言一出,村民们都有些发懵,去哪找这么好的事啊?老智猜到了大家的心事,于是领着众人来到一座山中房屋前。这一刻,大模型村命运的齿轮将再次转动。
A:这么神秘啊!
L:开门的正是无名,一见面老智就紧紧的抱住无名,兴奋的问,“你真的参透了其中的玄机?”。无名肯定的点点头。老智激动地又蹦又跳,好一会儿才停下来。看着一头雾水的村民们,老智拿了一瓶墨汁,将其中一滴倒入一杯装满清水的杯子中,随着墨汁的扩散,整杯清水转眼间化为黑水,然后给村民们进行了解释。
原来,老智带无名在龟谷治疗失忆期间,一位神秘人向老智展示了一滴墨汁晕开的过程,并告诉老智只要无名能参透其中玄机,无名将在语言以外的绘画、视频等方面继续突破,从而成为全能战士。满怀期待的老智就安排无名在这安静的山中小屋中去参透,没想到真被无名给悟出来了!
L:是的,果然如神秘人所说,无名参透了墨汁后,立即领悟了作画的真谛。接下来是无名的表演时刻。他让大家提任意的要求,他都能在几秒内完成绘画,且无论需求贴合度和绘画质量都让人无可挑剔,引发众人阵阵惊呼。可以说,一滴墨汁成就一代画师。
村民们意识到,有了无名的这种逆天能力,大模型业务真可以做到”既重质量,又重宣传,还不增加人手“,老智所言不虚啊,大家之前的焦虑瞬间一扫而空。
「42. 墨汁的扩散,随机却有规律」
A爸:哦。
「 43. 墨汁即原图,扩散即噪点」
L:假设我们有一张猫的原图。然后我们逐渐的在图中添加噪点,其实就是像素上的色值,根据高斯分布逐渐扩展的过程。每次散开一些,我们就保留一张当前的图片。直到最后,完全变成一片看不出来的噪点,如下图所示。
这个时候我们告诉AI,这片什么也看不出来的噪点原来是什么,让它把原来的样子画出来,大家觉得AI可以做到吗?
正确收敛后顺利过关!你们看,略微清晰的图片出来了吧,如下图所示。
接着继续这样类似的操作一张一张图片进行下去,最终,来到最初的图片。
L: 是的,黑色的水就是全都是噪点的图,每次迭代反向扩散就是根据当前墨水的状态,推测前一个阶段水的状态,最后得到墨水没有散开前的样子就是图像最原始的那只可爱的猫。
两者从本质上是一样的,只要是随机扩散,就遵循高斯分布。有规律,机器就能通过无数次的训练去学习和加以应用。
「 44. AI为何要采取扩散模型来绘画」
小朋友都能懂的人工智能(下)目录:
⑨Hi AI, Database is all you need 32-35
⑩大白话数据库 36-40
⑪一滴墨汁成就一代画师 41-44
⑫从画师到视频大师 45-49 ✓
第12集导读
一个小男孩的翻页画给老智带来了灵感,让老智瞬间明白了视频和图片并无本质区别,只是增加了一个时间维度。
于是老智准备了大量视频供无名学习,这些视频被分解成每秒若干帧的图片,以像素数据的格式被输入到无名的深度学习网络内部,通过分析这些帧学习到物体运动规律,最终具备了生成栩栩如生视频的能力。
「 45. 小男孩画的有趣作品」
A:怎么了,老智有啥发现吗?
「 46. 视频=系列图片+时间线」
L:是的,无名从一滴墨水中领悟到扩散模型,成为一代画师后,老智开始规划进一步训练无名,让其从一代画师到视频大师。正当老智苦苦思索之时,小男孩作品的出现让老智猛然醒悟过来,顿时明白了视频的实现思路。
A爸:是什么思路?
L:其实视频和作画的过程没有本质上的区别,视频=一系列图片+时间线。无名具备了绘画的能力,实现做视频的能力就已经成功一大半了。我们来看一个猛犸象奔跑视频,如下所示。
大家都知道现在已经没有猛犸象了,这视频肯定是机器模拟出来的而非真实拍摄的。看这个效果是不是仿佛现场拍摄出来一般真实。
A爸:是啊,效果还真是炸裂啊!
L:我们来拆解一下这个视频是如何制作出来的,这个视频是由多张连续动作的照片组成的,和小男孩打球类的图片类似,以单张图为例,这是一个二维的结构,如下所示。
A爸:是啊,您的这个系列图解还真是形象生动,如此看来绘画与视频的实现确实没有本质的区别。
「 47. AI是如何学会做视频的」
L:虽说视频和做图没有本质区别,实际上要让AI做出视频的难度还是不小的!无论是打球的男孩还是奔跑的猛犸象,都是由一系列连贯的画面组成,问题在于AI如何掌握了预测下一个画面的能力,大家知道吗?
C:是不是看了很多视频后,学习出来的能力。
L:说得太对了!其实这种视频学习训练模式和之前所描述到的识图、下棋、绘画能力的学习训练模式,又是没有本质的区别!
C:没本质区别?
L:是的,咱们一起回顾一下先前的知识。AI在欣赏了无数图片后记住了世间万物的向量特征后,比如就能识猫了(详见AI爆发元年,小朋友也能读懂的人工智能(上)的⓸-⓺卷积神经网络初探),类似的棋局也是图形,在总结了无数棋型特征后,开始碾压人类顶尖棋手(详见AI爆发元年,小朋友也能读懂的人工智能(上)的⑪-⑭狗大师的修仙之路);在阅读了无数的书籍后记住了词的向量特征后,就能学富五车无所不知了(详见AI爆发元年,小朋友也能读懂的人工智能(中)的⑮-⑱大模型实现背后的惊人秘密)。这些大家都还记得吗?
众人纷纷点头称是。
L:OK,同样的道理,AI在观看了无数的视频后,自然是有可能了解到物体运动规律的,比如看了无数篮球比赛的视频后,就能在球员跳起投篮时预测到接下来的篮球如何飞行、如何命中、球如何落地等一系列动作。也就是说AI明白了打篮球的场景应该是怎样的。就这样,在AI观看了各式各样的,足够多的视频后,AI开始明白几乎所有领域的场景应该怎样的。
A爸:有趣,大道至简,方法都是相通的啊,都是在训练数据的规模足够大,在深度学习网络参数足够多的情况下,水到渠成的实现了。
L:是的,A爸的总结非到位!
A爸:对了,AI观看视频是如何观看的,和识别图片和文字一样吗?
L:对于计算机而言,只能识别0和1的数字组合编码的输入,这点识别视频和是识别文字、图片是一样的。不过视频有一个视频分解的过程,这是明显的差异。比如观看篮球视频,会把打篮球的每个动作根据时间进行切片,一个切片就是一个帧。这个帧等同于小男孩画自己打篮球的每一页。假如每秒取30帧图片,观看1分钟视频就是得到了1800张图片。
C妈:原来如此,我明白了,AI进行视频训练的工作量比图片处理要大多了啊。
L:是的,不仅AI视频训练过程的工作量很大,训练完毕进行视频生成时,工作量也非常巨大,同样假设每秒生成30帧图片,那一分钟也得处理1800张图片哦。其实无论训练还是生成阶段,即便一张图片的生成都需要投入巨大的计算资源的。
当视频被分解成每秒若干帧的图片后就进入了视频输入阶段,即将这些帧的图片以像素数据的格式被输入到AI模型里;然后进入模型学习阶段,即模型通过分析这些帧,学习到球员打球的动作规律,比如腿部和手臂的摆动等;最后是预测生成阶段,当模型看到一帧球员开始打球的图片时,AI可以根据之前学到的规律,预测并生成下一帧的图像,直至生成一个完整的打篮球视频。
L:说到SORA,先来看一下最近刷屏的一段视频,根据下面这段文本生成:“一位时尚的女士走在东京的街道上,街道上充满了温暖的霓虹灯和生动的城市标志。她穿着黑色皮夹克、红色长裙和黑色靴子,手里拿着一个黑色钱包。她戴着太阳镜和红色口红。她走路自信而随意。街道潮湿且反光,形成了彩色灯光的镜面效果。许多行人走来走去。”
「 48. SORA视频的惊艳与自注意力机制」
L:是的!其实SORA训练的机制大抵也是如此。当然了,关于AI视频实现的细节远比我们描述的要复杂的多,这里只是让大家从逻辑上有一个宏观的认识。
甚至,视频中可以存在类似于真实世界的互动。例如,一位画家可以在画布上留下持续一段时间的新笔触,这真的看不出来是真画师还是假画师了,如下所示。
C妈:不可思议!和真实世界如此接近,这怎么做到的啊?
L:怎么做到的?这里依赖一个之前我们反复强调过的关键技术。
L:自注意力机制(Self-attention),大家还记得吧。这正得益于自注意力机制,允许模型在处理当前帧时,不仅考虑与当前帧相邻的帧,还能关注视频中更远的帧。能够在全局范围内捕捉到不同时间点和空间位置的相关性,从而实现时间连续性和逻辑一致性。
A爸:L老师,今天咱们聊AI视频,您居然翻出了那么多之前讲过的知识点,看来AI视频是各种技术综合应用的产物啊。
L:是的,新突破往往是站在巨人的肩膀上。
「 49. 孩子们难忘的六一儿童节」
L:咱们继续说故事吧,话说老智顿悟后立即采取行动了,打造了一个超级大会议室,里面摆放了数以千计的大屏幕,每个屏幕都在播放来自几乎所有领域的各式视频。同时老智让无名戴上特制的编码转换器眼镜和自注意力机制头盔,然后,无名同时盯着所有的大屏,开启了不分昼夜的视频训练模式。很快,无名看完了全部视频,出关了!
激动不已的老智当即就想到给村民们报喜,不过转念一想,有没有更有趣的方式来制作惊喜呢?他看着墙上的日历,马上六一了,心中顿时有了主意。
A:啥主意?
L:老智叫来了大模型村的孩子们,分给他们许多糖果和玩具,小朋友们个个开心极了,接着老智便问孩子们最喜欢听什么样的故事。孩子们更兴奋了,纷纷说出了自己想听的故事,老智认真的记录着。
六一儿童节当日,老智组织了一场大模型村儿童户外活动,画画、游戏、烧烤,孩子们玩得非常开心。晚餐过后,正当孩子们以为活动结束准备互相道别时,老智猛然揭开一块巨幅布帘,一个精心准备的露天电影院出现了!
原来,这个电影是无名依据老智的陈述做的视频,内容正来自孩子们想听的故事,无名将这些故事巧妙的串联成一个精彩的童话,并制作成一部生动有趣且极为流畅的动画大片,更让孩子们意想不到的是,无名把每个小朋友形象都搬到银屏上,让他们成为了小小演员,和童话故事的情节融为一体。
村民们也是惊喜不已,因为有了无名这种制做视频的逆天能力,粮食业务的宣传还需要担心吗?
C妈:精彩精彩,听得我都激动无比。
小朋友们:我们也要像大模型村小朋友一样,看到这样的电影。
L:当下,即便SORA也不具备这么强的能力,不过相信故事很快就会变成现实。实际上这种制作视频的能力远不止是宣传、娱乐、教育这些用途,还有更大的作用,将会极大的改变这个世界。
A爸:改变这个世界,这么厉害?
L:是的,今天就先到这里,咱们下回分解。
预告:《超融合数据库》即将出版,关注梁老师公众号,敬请期待。