小朋友都能懂的人工智能⓻--无名的故事与GPT-4训练流程
小朋友都能懂的人工智能⓸ -狗大师的修仙之路
小朋友都能懂的人工智能⓺ -注意,句中高能!
L老师讲故事咯,讲述无名的飞速成长之路...
「 24. AI发展之忧」
L:刚听说各位对AI的飞速发展很是担忧,应该是GPT-4推理出北极熊的能力过于惊艳,把大伙儿给吓到了。这样吧,大家说说自己都担忧什么?
A:L老师,AI这么聪明,什么事不懂就问它,什么事都让它帮你做,那我们还需要学习吗?
A爸:L老师,AI会不会抢了人类的饭碗,让大部分人陷入失业危机?
C妈:L老师,我比较胆小,您说AI会不会产生意识,进而消灭人类?
......
L:小A同学,假设真的不用学习,那可以天天玩了,你是该担忧还是开心呢?
小A笑出了声来。
L:A爸,假设AI把生产效率提升了成百上千倍,让人不用工作都可以做到衣食无忧,大家从此不再为生计发愁,可以天天做自己喜欢的事了。你是该担忧还是开心呢?
A爸也笑出了声来。
L:C妈的担忧听起来有些惊悚,AI到底会不会产生意识呢?我觉得我们还是需要对AI的工作机制有一个较为全面的认识,这样才更容易做出理性的判断。C妈你说是不是?
C妈:是啊。
L:前面已经初步介绍了GPT-4是如何理解语言的,接下我想对其训练和应用的全流程做一个简单的介绍,这样就能为全面认识AI打好基础。有了这个基础,后续各种深入的探讨就会更方面一些,比如AI是否会发展出意识等问题。
C妈:L老师,听说您出版的各类数据库书籍经常用故事来展示。您这么擅长讲故事,要不您用讲故事的形式给大家说说GPT-4训练和应用的全流程吧,这里小朋友这么多,肯定都是爱听故事的。
大家纷纷表示附和。
「 25. 无名1——数据收集与处理」
L:这.... 你们这是要难倒我啊。好吧,我试试吧,讲讲AI是如何训练的。
从前,有一个叫做大模型村的地方,住着一位孤苦伶仃还目不识丁的小伙子,他无法与人交流,只能靠捡垃圾和乞讨为生。因为没有人知道他叫什么,大家就管叫他无名。一些好心人想劝他读点书认些字以更好地生存。可是,无名根本听不懂对方在说什么。
一天,一位智者路过大模型村遇见了无名,感慨其骨骼惊奇千年一遇,当即决定留在大模型村,要将无名打造成一代宗师。这位智者不仅有拥有过人的才识,同时也拥有数之不尽的财富,我们就称其为老智。至此,无名命运的齿轮开始飞速转动。
无名的世界非常单纯,只认识0和1两个数字,其他数字或文字你教不会他,也没法教他。不过老智可不在乎这些,他在意的是无名惊人的记忆力和无穷的精力,认定他就是一位旷世奇才。就这样,老智开始了对无名的魔鬼训练,他首先斥巨资购进大量精挑细选的高质量书籍放进藏经阁,准备给无名学习。不过无名既看不懂文字也听不懂老智在说什么,怎么办?
早有准备的老智将一款眼镜给无名戴上。这是非常神奇的高科技眼镜,戴上它就能将文字、语音进行分词处理与编码转换。啥叫分词,就是把整句话或者一段文本拆分成一个个单独的词或短语的过程。比如把“我爱吃苹果”分成“我”、“爱吃”、“苹果”这样单独的部分。这对理解和分析每个词的意思非常有帮助。那啥叫编码转化,就是在分词的基础上实现词向量化的过程。简单地说就是把文本中的每个字或词转换成特定一组0和1组合的数字,形成多维向量空间。这里相关细节知识可参考《小朋友都能懂的人工智能⓹》的“17.向量化是理解语言的第一步”与“18.如何完成向量化工作”这两个小节。
神奇的是,眼镜不仅可以将这些0和1的数字组合输入给无名,让无名能看见或者听见,同时还可以将数字组合转化成文字输出给外界,让别人看懂或听懂。就这样,老智的眼镜神奇地实现了语言文字和01数字组合的映射关系。这里相关细节知识可参考《小朋友都能懂的人工智能⓶ 》的“ 04.计算机眼中的世界”小节。
果然,戴上眼镜后,奇迹出现了,书中的文字在无名眼中全都转化成一串串他熟悉的0和1。虽说无名暂时还不理解这一串串数字组合意味着什么,不过熟悉感还是让他倍感亲切,露出久违的一笑。
无名开始坐下来静静地看着书,不一会儿他的眉头紧锁,似乎遇到什么困惑,一会儿又瞪大眼睛,似乎发现了什么规律。就这样他越看越起劲,再也停不下来了,开启了通宵学习模式。
第二天,老智带着早餐来找无名,望着满屋子的书,随口来了一句:“不知道无名啥时可以读完这些书?”
“我已经读完了”。
哇,无名居然第一次开口说话了,而且挑不出啥语法毛病。老智激动过的老泪纵横。等等,老智忽然有些发懵,无名回答的是啥,读!完!了!老智才反应过来,有些难以置信地又问了一句:“这数千本书你都读完了?”。
“是的。”
这阅读速度也太快了吧,看来我马上就要培养出一代宗师了,想到这里老智激动地抱着无名又蹦又跳。
那无名究竟能否成为一代宗师,老智接下来又会有哪些出人意料的训练手段呢,咱们下回分解。
「 26. 无名2——模型设计与初始化」
L:不过,老智很快发现无名在回答问题时经常缺少常识,比如不知道麦克斯韦方程式是什么,不认识爱因斯坦,不知道什么是万有引力,不知道什么是基因....大家知道这是啥原因吗?
A:是不是给无名读的书很少有这方面的内容?
L:回答得很好!正是因为先前的书籍以小说为主,缺少自然科学,于是老智继续斥巨资,精挑细选的购进天文地理历史数学物理化学生物财经诗歌维基百科等书籍文献论文给无名阅读,效果还是不错的,无名开始变得越来越博学,也就很少再出现缺乏常识的情况了。
老智的书籍采购持续不断地进行着,随着阅读量的不断增加,无名对语言的理解越来越深刻了,比如他看到苹果这个词后,不仅知道苹果是一种水果,还知道这种水果的颜色、大小、形状、味道、营养价值、生长特征,产地、品种等。而且他能识别苹果和梨子在向量空间的位置非常接近,属于类型相近的东西。它甚至还知道许多和苹果有关的故事,比如牛顿、白雪公主、图灵、伊甸园....
不过老智却发现无名表面上看掌握了丰富的苹果信息,当问题中涉及到苹果和手机、电脑、公司等词一起出现,形成如苹果手机、苹果公司、苹果电脑等,无名就会搞不清是品牌还是水果,往往回答的牛头不对马嘴。
类似的情况越来越常见,比如问到“这书很深,不容易理解。”,“这块布颜色太深,做夏天衣服不合适。”等问题时,无名的回答往往无法区分这个深到底长度还是难易还是深浅,经常答非所问。
老智为了进一步验证无名的问题,放了一个大招,写下了这么一行话给无名阅读,“人要是行,干一行行一行,一行行行行行,行行行干哪行都行,要是不行,干一行不行一行,一行不行行行不行,行行不行,干哪行都不行。"。结果,无名看后两眼一黑,口吐白沫,一头栽倒在地上,把自己送进了医院。
老智明白问题所在了,安顿好无名后便匆匆出门找他的好朋友老谷求救。老谷问明来意后便拿出了他祖传的镇宅之宝——Transformer头盔,交给了老智,并且语重心长地说了一句:Attention is all you need。接下来两位老兄弟在一起针对无名的特点对Transformer的头盔进行优化,探讨头盔内部设计多少层级合适,每个层级该设置多少个注意力头,参数该设置多少个....就这样,三天三夜后,一款针对无名的T头盔被量身定制出来了。
当无名戴上这个T头盔后重新看书后,整个人都精神了,眼睛瞪得老大,看起来注意力比以前提升了100倍的样子。
无名确实发生了一个巨大的转变,当他阅读一句话时不再是仅关注被分词后的每个词的单读含义,还关注句子中相邻词之间的关系,词与句子中每个词之间的关系等,并对这些关系进行权重计算,从此变得对上下文非常的敏感。当他发现句中苹果和好吃、甜、梨等在一起时,会立刻注意到这些关键字,并分配了极高的注意力在这些词上,也就是权重,让自己瞬间便明白这是水果,当他发现句中苹果和公司、手机、电脑等在一起时,便瞬间明白了这是品牌。相关细节可参考《小朋友都能懂的人工智能⓺》的“21. 注意力即一切的T时代”和“T时代位置编码的巧妙创新”这两小节内容。
很快,无名就将之前所有的书籍文献论文都重新阅读一遍,只戴眼镜阅读和戴着眼镜又戴着头盔阅读效果真是不一样啊,接下来老智就把让无名口吐白沫的问题再问了一遍,大家觉得无名能搞定吗?
C:肯定可以啊,之前是多义词无法有效辨别。无名无法有效的利用好上下文,现在这个Transformer模型就擅长这个啊。
L:小C真棒,回答的很有水平啊!来,无名看看无名是如何回答的,请看截图。
「 27. 无名3——模型训练微调迭代」
L:无名通过自己埋头读书就可以飞速进步,实现了无师自通,可以说是一件很了不起的事啊,你看老智除了给个眼镜再给个头盔,也没见他操多少心啊,这到底是怎么做到啊?
A爸:L老师,词向量化实现了词的编码与语义识别,相当于认字了。Transformer实现了对词对上下文的识别,相当于能深刻理解句子了。这样无师自通不是很正常啊,让人来教不是也没法教啊,你跟无名或机器说话,他也听不懂啊。
众人大笑。
L:时候不早了,无名的故事今天就说到这里。我先总结一下,无名的这一集是对应了大模型训练的第三阶段,即模型的训练微调迭代。包含了模型训练迭代和参数微调迭代两方面,其中损失函数就是表示训练与标准答案之间的差距,而反向传播则是传递这种差异,通过调整参数进行不断优化反复迭代。具体如下图所示:
接下来无名就要看看神功练成的无名大侠,是如何走出大模型村,在其运行推理征途中,实现君临天下,大杀四方的,咱们下回分解。