收获不止数据库

小朋友都能懂的人工智能⓻--无名的故事与GPT-4训练流程

小朋友都能懂的人工智能⓵
小朋友都能懂的人工智能⓶ -卷积神经网络初探
小朋友都能懂的人工智能⓷ -惊世骇俗的狗故事

小朋友都能懂的人工智能⓸ -狗大师的修仙之路

小朋友都能懂的人工智能⓹ -不可思议的大模型

小朋友都能懂的人工智能⓺ -注意,句中高能!

L老师讲故事咯,讲述无名的飞速成长之路...

「 24. AI发展之忧」

L:刚听说各位对AI的飞速发展很是担忧,应该是GPT-4推理出北极熊的能力过于惊艳,把大伙儿给吓到了。这样吧,大家说说自己都担忧什么?

A:L老师,AI这么聪明,什么事不懂就问它,什么事都让它帮你做,那我们还需要学习吗?

A爸:L老师,AI会不会抢了人类的饭碗,让大部分人陷入失业危机?

C妈:L老师,我比较胆小,您说AI会不会产生意识,进而消灭人类?

Image

......

L:小A同学,假设真的不用学习,那可以天天玩了,你是该担忧还是开心呢?

小A笑出了声来。

L:A爸,假设AI把生产效率提升了成百上千倍,让人不用工作都可以做到衣食无忧,大家从此不再为生计发愁,可以天天做自己喜欢的事了。你是该担忧还是开心呢?

A爸也笑出了声来。

L:C妈的担忧听起来有些惊悚,AI到底会不会产生意识呢?我觉得我们还是需要对AI的工作机制有一个较为全面的认识,这样才更容易做出理性的判断。C妈你说是不是?

C妈:是啊。

L:前面已经初步介绍了GPT-4是如何理解语言的,接下我想对其训练和应用的全流程做一个简单的介绍,这样就能为全面认识AI打好基础。有了这个基础,后续各种深入的探讨就会更方面一些,比如AI是否会发展出意识等问题。

C妈:L老师,听说您出版的各类数据库书籍经常用故事来展示。您这么擅长讲故事,要不您用讲故事的形式给大家说说GPT-4训练和应用的全流程吧,这里小朋友这么多,肯定都是爱听故事的。

大家纷纷表示附和。

「 25. 无名1——数据收集与处理」

L:这.... 你们这是要难倒我啊。好吧,我试试吧,讲讲AI是如何训练的。

从前,有一个叫做大模型村的地方,住着一位孤苦伶仃还目不识丁的小伙子,他无法与人交流,只能靠捡垃圾和乞讨为生。因为没有人知道他叫什么,大家就管叫他无名。一些好心人想劝他读点书认些字以更好地生存。可是,无名根本听不懂对方在说什么。

一天,一位智者路过大模型村遇见了无名,感慨其骨骼惊奇千年一遇,当即决定留在大模型村,要将无名打造成一代宗师。这位智者不仅有拥有过人的才识,同时也拥有数之不尽的财富,我们就称其为老智。至此,无名命运的齿轮开始飞速转动。

无名的世界非常单纯,只认识0和1两个数字,其他数字或文字你教不会他,也没法教他。不过老智可不在乎这些,他在意的是无名惊人的记忆力和无穷的精力,认定他就是一位旷世奇才。就这样,老智开始了对无名的魔鬼训练,他首先斥巨资购进大量精挑细选的高质量书籍放进藏经阁,准备给无名学习。不过无名既看不懂文字也听不懂老智在说什么,怎么办?

Image

早有准备的老智将一款眼镜给无名戴上。这是非常神奇的高科技眼镜,戴上它就能将文字、语音进行分词处理与编码转换。啥叫分词,就是把整句话或者一段文本拆分成一个个单独的词或短语的过程。比如把“我爱吃苹果”分成“我”、“爱吃”、“苹果”这样单独的部分。这对理解和分析每个词的意思非常有帮助。那啥叫编码转化,就是在分词的基础上实现词向量化的过程。简单地说就是把文本中的每个字或词转换成特定一组0和1组合的数字,形成多维向量空间。这里相关细节知识可参考《小朋友都能懂的人工智能⓹》的“17.向量化是理解语言的第一步”与“18.如何完成向量化工作”这两个小节。

Image

神奇的是,眼镜不仅可以将这些0和1的数字组合输入给无名,让无名能看见或者听见,同时还可以将数字组合转化成文字输出给外界,让别人看懂或听懂。就这样,老智的眼镜神奇地实现了语言文字和01数字组合的映射关系。这里相关细节知识可参考《小朋友都能懂的人工智能⓶ 》的“ 04.计算机眼中的世界”小节。

果然,戴上眼镜后,奇迹出现了,书中的文字在无名眼中全都转化成一串串他熟悉的0和1。虽说无名暂时还不理解这一串串数字组合意味着什么,不过熟悉感还是让他倍感亲切,露出久违的一笑。

无名开始坐下来静静地看着书,不一会儿他的眉头紧锁,似乎遇到什么困惑,一会儿又瞪大眼睛,似乎发现了什么规律。就这样他越看越起劲,再也停不下来了,开启了通宵学习模式。

Image

第二天,老智带着早餐来找无名,望着满屋子的书,随口来了一句:“不知道无名啥时可以读完这些书?”

“我已经读完了”。

哇,无名居然第一次开口说话了,而且挑不出啥语法毛病。老智激动过的老泪纵横。等等,老智忽然有些发懵,无名回答的是啥,读!完!了!老智才反应过来,有些难以置信地又问了一句:“这数千本书你都读完了?”。

“是的。”

这阅读速度也太快了吧,看来我马上就要培养出一代宗师了,想到这里老智激动地抱着无名又蹦又跳。

那无名究竟能否成为一代宗师,老智接下来又会有哪些出人意料的训练手段呢,咱们下回分解。

小朋友们:继续,继续,继续下一集。
L:OK,在继续这个故事之前,我先总结一下,无名的这一集正是对应了大模型训练的第一阶段,即数据收集与预处理。包含数据的收集、数据的清洗及数据的预处理。具体如下,大家可以自行体会。
Image

「 26. 无名2——模型设计与初始化」

L:不过,老智很快发现无名在回答问题时经常缺少常识,比如不知道麦克斯韦方程式是什么,不认识爱因斯坦,不知道什么是万有引力,不知道什么是基因....大家知道这是啥原因吗?

A:是不是给无名读的书很少有这方面的内容?

L:回答得很好!正是因为先前的书籍以小说为主,缺少自然科学,于是老智继续斥巨资,精挑细选的购进天文地理历史数学物理化学生物财经诗歌维基百科等书籍文献论文给无名阅读,效果还是不错的,无名开始变得越来越博学,也就很少再出现缺乏常识的情况了。

老智的书籍采购持续不断地进行着,随着阅读量的不断增加,无名对语言的理解越来越深刻了,比如他看到苹果这个词后,不仅知道苹果是一种水果,还知道这种水果的颜色、大小、形状、味道、营养价值、生长特征,产地、品种等。而且他能识别苹果和梨子在向量空间的位置非常接近,属于类型相近的东西。它甚至还知道许多和苹果有关的故事,比如牛顿、白雪公主、图灵、伊甸园....

不过老智却发现无名表面上看掌握了丰富的苹果信息,当问题中涉及到苹果和手机、电脑、公司等词一起出现,形成如苹果手机、苹果公司、苹果电脑等,无名就会搞不清是品牌还是水果,往往回答的牛头不对马嘴。

类似的情况越来越常见,比如问到“这书很深,不容易理解。”,“这块布颜色太深,做夏天衣服不合适。”等问题时,无名的回答往往无法区分这个深到底长度还是难易还是深浅,经常答非所问。

老智为了进一步验证无名的问题,放了一个大招,写下了这么一行话给无名阅读,“人要是行,干一行行一行,一行行行行行,行行行干哪行都行,要是不行,干一行不行一行,一行不行行行不行,行行不行,干哪行都不行。"。结果,无名看后两眼一黑,口吐白沫,一头栽倒在地上,把自己送进了医院。

老智明白问题所在了,安顿好无名后便匆匆出门找他的好朋友老谷求救。老谷问明来意后便拿出了他祖传的镇宅之宝——Transformer头盔,交给了老智,并且语重心长地说了一句:Attention is all you need。接下来两位老兄弟在一起针对无名的特点对Transformer的头盔进行优化,探讨头盔内部设计多少层级合适,每个层级该设置多少个注意力头,参数该设置多少个....就这样,三天三夜后,一款针对无名的T头盔被量身定制出来了。

Image

当无名戴上这个T头盔后重新看书后,整个人都精神了,眼睛瞪得老大,看起来注意力比以前提升了100倍的样子。

无名确实发生了一个巨大的转变,当他阅读一句话时不再是仅关注被分词后的每个词的单读含义,还关注句子中相邻词之间的关系,词与句子中每个词之间的关系等,并对这些关系进行权重计算,从此变得对上下文非常的敏感。当他发现句中苹果和好吃、甜、梨等在一起时,会立刻注意到这些关键字,并分配了极高的注意力在这些词上,也就是权重,让自己瞬间便明白这是水果,当他发现句中苹果和公司、手机、电脑等在一起时,便瞬间明白了这是品牌。相关细节可参考《小朋友都能懂的人工智能⓺》的“21. 注意力即一切的T时代”和“T时代位置编码的巧妙创新”这两小节内容。

Image

很快,无名就将之前所有的书籍文献论文都重新阅读一遍,只戴眼镜阅读和戴着眼镜又戴着头盔阅读效果真是不一样啊,接下来老智就把让无名口吐白沫的问题再问了一遍,大家觉得无名能搞定吗?

C:肯定可以啊,之前是多义词无法有效辨别。无名无法有效的利用好上下文,现在这个Transformer模型就擅长这个啊。

L:小C真棒,回答的很有水平啊!来,无名看看无名是如何回答的,请看截图。

Image怎么样,厉害吧。
A爸:确实厉害,这个回答堪称完美!
L:无名真的就这么一帆风顺吗,在其训练中还会不会遇到新的麻烦,咱们下回分解。
小朋友们:继续,继续,继续下一集。
L:OK,在继续下一个集之前,我先总结一下,无名的这一集正是对应了大模型训练的第二阶段,即模型设计与初始化。包括模型架构设计和参数初始化两部分,其中模型架构设计就是基于Transformer的多层神经网络架构,而参数初始化就是决定训练数据的规模。具体如下图所示:

Image

「 27. 无名3——模型训练微调迭代」

L:无名通过自己埋头读书就可以飞速进步,实现了无师自通,可以说是一件很了不起的事啊,你看老智除了给个眼镜再给个头盔,也没见他操多少心啊,这到底是怎么做到啊?

A爸:L老师,词向量化实现了词的编码与语义识别,相当于认字了。Transformer实现了对词对上下文的识别,相当于能深刻理解句子了。这样无师自通不是很正常啊,让人来教不是也没法教啊,你跟无名或机器说话,他也听不懂啊。

L:词向量化认字,Transformer模型理解句子,A爸说得精炼且有水平,给A爸点赞。不过事实上可不是那么简单,无名的理解是需要一个反馈的,训练是一个不断逼近正确答案的过程,好比下围棋就很清晰明了,布局下在一二线地方老输棋,而下在三四线的地方就能赢棋,自然最后就会淘汰布局一二线的下法而选择了正确的三四线,这样围棋就可以实现无师自通。相关细节可参考《小朋友都能读懂的人工智能⓷ 》和《小朋友都能读懂的人工智能⓸》。
可学习语言就不一样了,无名怎么知道自己对句子的理解是否无误,自己的回复是否正确?大家觉得这有标准答案吗?
A爸:围棋、游戏竞技都有胜负,能赢就是对的。包括数理化学科知识也是如此,解出来就是对的,所以AI在这些领域现在都特别厉害。咱们语言的理解和语言的回复,似乎怎么回答都是可以的,并没有一个绝对的标准啊。
L:但是,没标准也必须要建立标准,否则训练就变成无头苍蝇了。那怎么建呢?话说这个无名还真是天纵之才,还真被他想到办法了。他可以把书中的文字直接就当成了标准答案来训练自己。给自己玩猜字游戏。比如:老王推开门,发现乌云密布,于是回到屋里拿了什么?这里有两个字被无名给遮盖住了。
会是什么字呢,无名想了半天,于是填入了"菜刀"两字。
引发一阵哄堂大笑。
L:是的,当被无数次啪啪打脸后,无名最终填入了"雨伞"两字,回答正确!得到了多巴胺奖励,乐开了怀。
A:L老师,感觉有点像完形填空啊。
L:是的,除了完形填空,还有句子续写,比如把前半段读完,把后半段遮起来,往下写,看看和正文的相似度有多高,相似度越高就越接近标准答案。就这样,无名把同一本书读了无数遍后,再用各种遮盖的方式做了无数遍的完形填空和句子续写,最后对文字和句子的理解就越来越深刻。随着阅读的书籍文献越来越多,最终就实现了对语言理解的飞跃。
A爸:L老师,我有一个疑问,您刚才说填入“雨伞”两字,得到了奖励。说明书中是雨伞两字。可是如果填入“雨衣”,似乎也是对的啊。
L:说得非常好,假设书中原文是“雨伞”,而无名填写的是“雨衣”,其实也有可能是对的,因为在无名的世界里,雨伞和雨衣的向量空间位置是非常接近的,所以用雨衣其实也是会形成一个通顺的句子的。比如雨伞正确的概率是99%,而雨衣正确的概率是98%,无名有时也会选择雨衣。因为他认为当概率超过某个标准的时候,基本都不太会出错了,所以选择更低的概率能够展示语言的多样性。
A爸:什么是语言的多样性?
L:比如你正确的回答了我一个问题,我答复“正确”,“很好”,“不错”,“你真棒” 其实意思都差不多,基本上怎么说都不会错,于是无名就选择随机来回复,就不会每次都说“正确”了,这也符合我们人类说话的特点啊。
A爸:这真是太有意思了。另外您说的续写其实也差不多,只要整句话的向量空间和原来的大体不差,就算和原文被遮挡部分一致,是吗?
L:是的,你真棒!
众人大笑。
A爸:我还有一个疑问,为啥会有同一本书无名读无数遍的情况,无名不是有超级记忆力吗,记一次不就记住了吗?另外自己遮盖住做完形填空和续写也很奇怪,只要之前读过了,不是都记住了,那还能考自己吗?
L:这个问题问得非常好!其实无名记忆力超群又什么都记不住,他存储下来的只有参数,而他反复读无数遍就是不断的调整自己的参数,各种遮挡和续写也是为了让自己的参数越来越优化。你们想起来之前说过的李白的静夜思不是背出来的,是创造出来的吗?这里相关细节知识可参考《小朋友都能懂的人工智能⓹》的“15 神奇参数替代了海量数据”这小节的内容。
A爸:哦,我明白了!
L:无名的故事还在继续。有一天,老智忽然发现了麻烦事,无名回答政治性相关的问题有些口无遮挡,比如随意评论国家领导人,话语中带有种族歧视等,甚至可以和人谈笑风生地探讨如何毁灭人类。这可把老智惊出了一身冷汗。虽说老智对购入的书籍资料已经是精挑细选了,但是这毕竟无法确保万无一失。现在无名已成这样了,该怎么办?
好在老智富甲一方,他想到了一个好办法,雇佣了成千上万个有道德有素养的人,形成评委团来共同调教无名。无名同时与这些评委们进行交流问答,评委们对无名的回答进行打分,符合人类道德规范的回答给予高分,反之则低分。聪明的无名通过这些分数,很快就明白了哪些话该说,哪些话不该说.....
Image
虽然取得了不错的效果,却还不够完美。因为每个调教无名的评委能力喜好各不相同,难免会有偏差。而且也还会存在一些失误,比如把本该打低分的回答打成了高分,把本该打成高分的回答打成了低分,从而误导了无名。那该怎么办?
老智简直就是一个天才,这不,又被他想出好主意了。他将无名的头盔做了改造,重新戴上后,无名忽然具有了一心二用的能力。一个还是原来的无名,我们姑且称之为学习者无名。另一个则是训练出来专门打分的无名,我们称之为打分者无名。其中打分者无名主要学习的是各种道德准则的相关内容,担任的是评委的角色。
Image
由于无名有着超乎常人的记忆力和精力,一心二用后两个角色的能力依然了得。这种左右手互搏模式,取得了非常不错的效果,这种模式和之前的评委团模式共同作用,让无名再次脱胎换骨。这下妈妈再也不用担心无名的口无遮拦了。
C妈:精彩,这个老智真厉害啊,左右手互搏都能想出来。
L:是的,至此无名神功练成,江湖即将掀起巨大的波澜,要知后事如何,且听下回分解。
小朋友们:继续,继续,继续下一集。

L:时候不早了,无名的故事今天就说到这里。我先总结一下,无名的这一集是对应了大模型训练的第三阶段,即模型的训练微调迭代。包含了模型训练迭代和参数微调迭代两方面,其中损失函数就是表示训练与标准答案之间的差距,而反向传播则是传递这种差异,通过调整参数进行不断优化反复迭代。具体如下图所示:

Image

至此,我通过无名的故事把大模型的训练流程给大体说完了,整体流程就三步如下图所示,是的,这正是GPT-4的训练全流程。

Image

接下来无名就要看看神功练成的无名大侠,是如何走出大模型村,在其运行推理征途中,实现君临天下,大杀四方的,咱们下回分解。