小朋友都能懂的人工智能⓼--无名的故事与GPT-4运行(推理)流程
小朋友都能懂的人工智能⓸ -狗大师的修仙之路
小朋友都能懂的人工智能⓺ -注意,句中高能!
第8集导读
「 28. 万法自然」
L:话说无名神功练成,老智喜出望外,于是带上无名走出了大模型村,来到了一个被称之为龟谷的地方,目的是要拿到AI盟主的令牌号令天下。据说自令牌设立以来已有十余年,期间有无数的英雄好汉前来挑战,愣是没人成功过。不过老智可是信心满满,觉得此次AI盟主之位必是无名无疑了。
龟谷蜿蜒曲折,一只老龟驮着二人来到了一座大宫殿前。老龟用头顶开门,挑战开始了。眼前映出一道题目,第一关来了!老智定睛一看,请将下面这一段中文翻译成英文"在生命的果园里,每一个选择都像是摘下的一颗苹果,我们无法预知它的味道,但正是这未知赋予了生活无限的可能”。
啥,考翻译,瞬间回忆涌上心头,触及了老智最不愿回首的往事。当年,老智曾经带领团队从事过机器翻译的工作。当时的想法是机器翻译这活儿简单啊,“来是COME,去是GO,点头YES,摇头NO......”,就这么把中文和英文一一对应好,然后教会机器不就完事了。
A:是啊,我也觉得挺简单的。
L:实际上,中文和英文之间的语言习惯及语法等差的很远,就比如一个“打”字,中文可以有无数种组合,比如打水,打电话,打赏,打起精神,打心眼里,打那以后......,而在英文里似乎就只有一个beat,可恨的是好不容易找到的这个beat,居然还对不上,总不能beat water吧。是的,老智耗尽数年精力的机器翻译项目没有取得满意的成果,便草草收场了。想到这里,老智摇摇头,以前专门的团队训练了数年都失败了,如今压根儿就没训练过无名,咱就别指望了,回去吧。老智回头望向无名,刚要张口,只听清晰的话音传来,“恭喜您通过本关!”。啥,无名已经翻译好了,还过关了?
老智回头一看无名的翻译“In the orchard of life, each choice is like picking an apple; its taste remains unknown until we try it, yet it's this very uncertainty that endows our lives with endless possibilities.“。整句话既匹配英语的表达习惯,还保持了语言的流畅性,同时也保持了原意的深刻性,完全不像当初他做项目时翻译的那么生硬,老智惊讶的合不拢嘴,他除了有给无名大量的中英文书籍学习外,并没特别教无名翻译啊,为啥就具备了如此逆天的翻译能力呢?
A爸:我们国人是先学中文,然后对照着中文的模式去学英文。而无名似乎是一开始就同时阅读中文和英文书籍,并没有这个对照的过程,会不会和这个有关。
L:是的,A爸说到点子上了。在无名的世界里,中文和英文都是一串串0和1的数字编码组合,没有本质区别的。在中文书籍里发现的词语规律,在英文书籍中是一样存在的,所以无名其实根本就没有在学翻译,而是他本来就会翻译。
C妈:本来就会?
L:是的,无名对字词的理解能力怎么衡量,其实就是字词向量化后维度的多样性和维度值的准确性。为什么能回答出一连串看似合理的句子,那是因为组成句子的每个词的向量是可计算的,通过各种计算,发现连在一起的概率大,就连在了一起。而这样的逻辑,中文和英文是没有任何区别的。
举一个最简单的例子,比如句中的苹果能被翻译成apple,这是为什么?因为无名觉得,其实苹果和apple的向量空间非常接近,它们就是同一个东西。差异只不过一个是从海量中文书籍中学来的知识,一个是从海量英文书籍中学来的知识。
C妈:原来如此啊,不过不同翻译家由于风格不同,有时差异也挺大的啊,机器翻译时每次都是固定的输出吗?
L:C妈问的非常好,词有词向量,既然向量可以计算,那句就有句向量,词计算的汇集就是句向量最终的值,所以翻译最后会用这句中文的句向量和翻译好的英文的句向量进行比较,这种计算的结果能大致匹配,就表示翻译正确,可以输出了。大家还记得我说过的语言的多样性吗。“正确”,“很好”,“不错”,“你真棒” 意思差不多,扩展到句子也是如此,比如“我觉得你是班上数学学最好的小朋友”。和“我认为班上没有哪个小朋友的数学比你更好。” 这两句的向量值是非常接近的。
A爸:有意思,耗费大量人力和时间成本没能解决的机器翻译难题,居然被不学翻译的GPT-4给解决了。我们的外语学习是不是也可以借鉴GPT-4模式。
「 29. 升维思考」
孩子们:白色白色。
L:这在小朋友都能懂的人工智能⓺章节中讲过,看来孩子们都还记得。OK,我们继续往下说。老智还没把题目读完,无名就已经提交答案,白色。伴随着清晰的“恭喜您通过本关!”传来,无名再次取得了成功。
C:无名好厉害!
L:是的。关于推理过程之前已经介绍过了,也贴出了GPT-4的回答。这里我们用一种更本质的方式来给大家讲无名推理的过程。
无名在听到题目后,立即在一个巨大的向量空间里开始了他的推演过程,如下图所示。他先找到题目中的每一个词在向量空间的位置,通过词与词之间的连接与计算,最后发现了指向答案的空间概率最大的词,就是白色。于是找到了答案。接下来会详细的用空间向量来解释这个过程。
一开始的往南,往东,再往北的三个方向以及回到了原点(这里用三条白色的连线来表示)。空间向量关系如下图所示。
在往南,往东,往北,回到原点这四个词向量共同作用,通过自注意力加权后,大家共同指向附近概率最大的词就是极点(这里用四条红色的连线表示),空间向量关系如下图所示。
而极点加上熊(这里用一条深绿色的线表示)后,在极点和熊共同作用下(南极不会有熊),会指向空间概率最大的北极点(这里用两条浅蓝色的线来表示)。空间向量关系如下图所示。
而北极点和熊共同作用下,会指向空间概率最大的北极熊(这里用两条深蓝色的线来表示)。空间向量关系如下图所示。
而北极熊加上毛色(这里用一条棕色的连线表示)以后,在北极熊和毛色的共同作用下(这里用两条浅绿色的连线来表示),最后指向了白色。空间向量关系如下图所示。
「 30. 一战成名」
从第三层开始,模型进行更复杂的推理和情景构建(这里用1'',2'',3''来区分上一层的数字):注意力头1'':预测AI技术如何塑造未来人类工作和生活。注意力头2'':构建关于AI实现意识可能性的详细理论模型和实验预测。注意力头3'':模拟不同的人机共生模式,考虑它们对未来社会的具体影响。...…随着层数增加,每一层的注意力头在前一层的基础上继续深化理解,处理更加复杂和抽象的概念。
就这样层层递进,在模型的最后层,所有之前层次的分析、推理汇总,形成对问题的全面回答。这一层的任务是整合所有分析结果,优化信息表达,确保答案的准确性、深度和创新性。
最后进入全连接层,完成最终的结果输出,如下图所示。
从输入到输出,完整的全流程动态效果图如下: