深度学习的第三波海啸:辛顿、杨立昆和本吉奥
那是最糟糕的时间点。其他人都在忙着做不同的事情。杰夫不知道怎么说服了他们。这笔数额不大的经费被用于组织一系列只有受邀才能参加的聚会,受邀人中有一些世界上顶尖的ANN研究者。本吉奥又讲道:
在广义的机器学习领域,我们有点像一群边缘人:我们的论文无法发表。聚会为我们提供了一个交换意见的地方。这项拨款后来被证明是一次结构性变革的开端。 2006年,辛顿和多伦多大学的西蒙·奥辛德洛 (Simon Osindero) 以及新加坡国立大学的郑宇怀发表了一篇革命性的论文。该论文标志着现在被称为深度学习 (deep learning) 的开端。文章描述了由3个全连接的隐藏层组成的网络。这个网络有太多的参数,用反向传播算法的方式进行训练会非常缓慢。为了解决这个问题,辛顿和他的团队设计了一种新的方法来加速训练。 通常,反向传播算法以随机参数值开始训练。但在这项新研究中,团队在反向传播之前插入了一个预训练阶段。这个新增阶段的目的是快速找到一组好的参数,以支持反向传播算法的启动。 反向传播算法是监督 (supervised) 训练的一个例子。这意味着训练要为网络提供输入和输出相匹配的示例。在这个新的初步阶段中,辛顿和其他共同作者建议采用无监督 (unsupervised) 训练。无监督训练只使用输入示例。 在无监督的预训练中,示例输入被提供给网络。通过算法调整网络参数,使ANN学会探测输入中的重要模式。不需要让网络知道这些模式与什么类相关——它学习的只是区分这些模式。对于手写文字识别,这些模式可能是线条的长度和方向,或者曲线的位置和长度。为了实现这一点,训练算法每次只更新一层的参数,从输入层开始。换句话说,该算法从输入向前构建出网络参数。该方法的计算复杂度明显低于反向传播算法。 一旦预训练完成,网络就能够在输入数据集中区分出最显著的模式。之后,用预训练得到的参数开始进行正常的监督训练。由于反向传播算法有了很好的起点,因此它用更少的迭代就能完成训练。 跟随贝尔实验室的脚步,辛顿的团队选择了以攻克手写数字识别问题为目标。这一次,有一个更大的数据集可供使用。该项目使用了由杨立昆 (图2) 、谷歌实验室的科琳娜·科尔特斯 (Corinna Cortes) 和微软研究院的克里斯托弗·伯吉斯 (Christopher Burges) 构建的MNIST数据集。MNIST收录了7万个手写数字,这些数字是从美国人口普查报告和高中考试答卷中获取的。
图2:
法国计算机科学家杨立昆(Yann André Le Cun),被称为卷积网络之父。
图源:
维基百科
深度学习的海啸分三波袭来:首先是 语音识别 ,然后是 图像识别 ,再之后是 自然语言处理(NLP) 。半个世纪的模式识别研究在短短3年内被淘汰出局。 60年来,科技界一直在努力将口语表达准确地转化为文本。最好的算法依赖傅里叶变换来提取谐波的振幅。然后利用隐马尔可夫模型 (Hidden Markov Model,HMM) ,根据观察到的谐波情况和声音序列在真实语音中已知的出现概率来判断发出的音素。 在辛顿实验室的实习生纳夫迪普·贾特利 (Navdeep Jaitly) 的帮助下,谷歌去除了他们语音生成识别系统的一半,用深度神经网络取而代之。他们得出的ANN-HMM混合体语音识别系统包含一个4层的ANN。该团队使用来自谷歌语音搜索的5 870小时的语音录音来训练ANN,并添加了来自视频网站YouTube的1 400小时的对话音频。新的ANN-HMM混合体比谷歌先前使用的基于HMM的语音识别系统性能高出4.7%。在自动语音识别的领域,这算是一个巨大的进步。完成了在谷歌的任务后,杰出的实习生贾特利返回多伦多大学去完成他的博士学位。 在接下来的5年里,谷歌逐步扩展和改进了他们基于ANN的语音识别系统。截至2017年,谷歌的语音识别系统达到了95%的准确率,这是前所未有的水平。 2012年,辛顿的团队报告了一种深度神经网络,旨在从静态图像中识别出真实世界的物体。这些物体是常见的东西,如猫、狗、人、面孔、汽车和植物。这个问题远不像识别数字那么简单。数字是由线条组成的,但识别物体需要分析其形状、颜色、纹理和边缘。除此之外,要识别的物体类的数量也大大超过了微不足道的10个印度—阿拉伯数字。 这个网络被以首席设计师亚历克斯·克里泽夫斯基 (Alex Krizhevsky) 的名字命名为“亚历克斯网” (AlexNet) ,包含65万个神经元和6 000万个参数。它整合了5个卷积层和其后的3个全连接层。此外,这项工作还引入了一种简单但却有效得惊人的技术。在训练过程中,随机选择少量神经元并使其沉默。换句话说,它们被禁止放电。这项技术被命名为丢弃 (Drop-out) ,它迫使神经网络将决策负载分散到更多的神经元上。这使网络面对输入的变化更加稳健。 该团队在2012年用这个网络参加了图像网大规模视觉识别挑战赛 (ImageNet Large Scale Visual Recognition Challenge) 。比赛的数据集包括大约120万张训练图像和1 000个物体类。克里泽夫斯基、伊利娅·苏特斯科娃 (Ilya Sutskever) 和辛顿的深度卷积网络大获全胜。亚历克斯网前5项识别结果的总准确率达到了84.7%。也就是说,真正的物体类落在这个ANN的前5大选择中的情况占比超过84%。该网络的错误率几乎是排名第二的系统的一半。 与此同时,在多伦多以东仅500千米的圣劳伦斯河河畔,蒙特利尔大学的一个团队正在研究如何将深度神经网络应用于文本处理。该团队由约书亚·本吉奥 (图3) 领导。
我们是否能够使用新方法创造出人类水平的智能,嗯,解决这个问题可能有50座山要爬,包括我们还看不到的那些山。我们目前只爬了第一座,也许是第二座。到目前为止,我们所拥有的只是复杂的模式识别引擎。然而,我们可以推测穿过这些大山的路径。目前,最好的猜测是我们需要一个ANN的网络。想要有显著的改进,可能还需要对ANN进行根本性的重新开发。现今的ANN只是对生物神经网络的一种大致的近似。也许我们需要一个更现实的模型。魔鬼很可能藏在细节中。 对于计算机科学界以外的人来说,深度神经网络的力量第一次显现是在2016年。那一年,一个人工智能登上了世界新闻媒体的头条。尽管这是在一个狭窄领域的努力,但这也许是人工智能第一次获得了超越人类的能力。
21世纪的今天,我们生活的方方面面无时无刻不在被算法影响和塑造。它们帮我们选择最佳的行车路线,向我们推荐我们可能购买的商品,为我们识别语音和图像,甚至给单身人士匹配婚恋对象。越发强大的算法也在不断突破极限,无论是打败围棋世界冠军柯洁,借助大语言模型与人类会话,还是在200秒内完成超级计算机1万年才能完成的计算。 然而,算法并非新近才开始影响人类社会,人类受益于算法已经有数千年的历史。在《算法简史:从美索不达米亚到人工智能时代》中,以算法发展过程中的关键人物和经典算法为主线,作者克里斯·布利克利绘出了一幅近4000年的算法发展简史:从镌刻在古巴比伦泥板上求2的平方根的算法,到刘徽和祖冲之父子对圆周率的精确计算;从查尔斯·巴贝奇和艾达·洛芙莱斯试图建造的机械数字通用计算机,到艾伦·图灵对算法的正式定义和他构想的图灵机;从第一台可编程的通用电子计算机ENIAC,到第一个人工智能程序“逻辑理论家”;从互联网的诞生,讯息的传输和加解密,再到亚马逊的推荐系统、谷歌搜索和社交媒体的动态排序,以及今天无处不在的人工神经网络……书中丰富的算法实例让读者充分感受到算法中蕴含的数学之美以及算法推动人类社会进步的强大力量。 全书语言通俗易懂,几乎没有使用一个公式,述及超过20位图灵奖——“计算机界的诺贝尔奖”——得主及其科学贡献,为没有专业背景但希望了解算法的读者提供了一个绝佳的窗口。 作者简介: 克里斯·布利克利(Chris Bleakley)。爱尔兰都柏林大学计算机科学学院教授,曾任该院院长,有超过40年的算法设计经验。除学术研究和教学外,布利克利在产业界也有丰富的从业经验,曾担任多家业内公司的顾问、高级研究员和副总裁。 星标《赛先生》 公众号, 不要错过我们每日为您精心准备的高质量文章!
欢迎关注我们,投稿、授权等请联系 [email protected] 合作请添加微信SxsLive2022