在后摩尔时代如何应对AI的算⼒焦虑
对话上海纽约⼤学教授Gene Wen:关于AI⾏业算⼒焦虑的应对策略,应从单纯追求规模扩张,转向对计算与智能的本质追问。这不仅是对技术路径的简单修正,更意味着对底层架构的深⼊反思和前瞻性架构。
访谈、撰文:朱振
“我们希望能通过回归本质来思考:在一定的芯⽚资源和功耗约束下,什么才是最好的AI模型?⽽不是先设计⼀个不计消耗成本的‘庞然⼤物’,再想办法让它跑在越来越贵的硬件上。”
在⽇前的⼀次对话中,谈到在“后摩尔定律时代”⼈⼯智能发展⾯临的根本性瓶颈,上海纽约⼤学教授Gene Wen如此表示。
⾯对⼈⼯智能产业⽇益凸显的三⼤瓶颈——算⼒增⻓的物理极限、数据供给的不可持续性以及能源消耗,Gene Wen教授领衔的课题《从新思考深度学习的训练与推理算法、架构和精度体系》,正在尝试从AI设计源头提供⼀种突破瓶颈制约的根本性解决思路。
这项研究基于⼀个判断:依赖半导体⼯艺持续迭代的算⼒增⻓模式,正在⾯临物理极限和⼯程经济学的双重约束。研究指出,以⾼能耗⼆进制通⽤计算模拟智能的⽅式,与⽣物智能的⾼效能之间存在百万倍的效率鸿沟,⽽其中的核⼼症结,来⾃于数据传输瓶颈以及彼此割裂的软硬件设计哲学。
对此,研究课题组尝试从“算法与硬件的协同设计”“通信范式架构”“数据危机化解”“向⽣物智能溯源”等维度出发,针对计算的效率问题提出系统性的解法框架。
对话围绕这项研究展开。Gene Wen指出,当下⾏业对算⼒焦虑的应对策略,应从单纯追求规模扩张,转向对智能计算第⼀性原理的追问和探索。这不仅仅是对技术路径的简单修正,更意味着在AI发展的关键时点,对底层架构进⾏深⼊反思和前瞻性的架构。
以下为访谈摘录:
FT中⽂⽹:就以您和清华⼤学联合研究的课题《重新思考深度学习的训练与推理算法、架构和精度体系》开始今天的对话吧。能否谈谈这个项目的初衷以及它所关注的核⼼问题?
Gene Wen:可以从⼏个⻆度来思考这个问题。⾸先,从⼯程和实际应⽤⻆度看,业界有很多讨论,⼀个共识是摩尔定律和Dennard Scaling已经到头:以前我们期望每18或36个⽉,芯⽚的密度能够翻倍⽽单位⾯积功耗可以基本不变,这个规律现在已经失效。现在有⼀些观点主张:摩尔定律其实并⾮物理定律,⽽是⼀种在业界共同努⼒下,达成的共识性⽬标。如果单靠“努⼒”就能让芯⽚的性能每18个⽉翻倍,那为什么不能“更努⼒”⼀点,让它翻三倍、四倍?这在逻辑上是说不通的。效率迭代的背后,其实是有⼀定的物理定律在驱动和约束的,那个物理世界并不在乎⼈有多努⼒。
前不久,⻩仁勋也提到摩尔定律的增⻓逻辑已经⾛到了尽头,现在需要为某个特定的应⽤,⽐如深度学习,设计专⽤架构,⽽不是做通⽤CPU。针对深度学习的芯⽚,性能提升要⽐摩尔定律预测的更快、更⾼。但这并不能说明摩尔定律的物理规律,而是把晶体管⽤在了不同地⽅,如同一个20年前生产的计算器可以比最新的固态硬盘有更高的计算能力一样。摩尔定律仍然是⼀个硬瓶颈。⽆论未来迈向AGI(通⽤⼈⼯智能)还是其他应⽤,器件物理的极限都会是⼀个难以突破的局限。
当然,也有⼈会提出量⼦计算、光计算等解决⽅法,但是这些新的技术,可能会在相当⻓的时间⾥⾮常昂贵,很难编程,很难做到⼤规模商⽤。
FT中⽂⽹:AI计算效率的提升所面对的物理性局限是一个很现实的问题。
Gene Wen:关于计算效率的问题,现在也有越来越多的观点会提到与⼈类⼤脑的对⽐。我也曾在大约5年前FT中⽂⽹的⼀次年会上谈到过这个问题:⼈脑功耗⼤约10-20瓦,但我们却能做很多事情。⽤今天能想象到的半导体技术去完成类似⼈类⼤脑的功能,功耗⾄少要2000万瓦。两者相差⼀百万倍。这是⾮常惊⼈的。为什么差这么多?核⼼原因有⼏个:⼀个来⾃数据传输的瓶颈。在今天的计算过程中,计算单元(如GPU)会有⼤量时间在等待数据。NVIDIA不同代GPU之间,计算能⼒差距有一些,但更大差距在数据传输能⼒和缓存大小。通信成了主要瓶颈,导致计算单元利⽤率低。
另⼀个是⼆进制计算的效率问题。我们⽤⼆进制和半导体可以实现通⽤计算,但效率很低。哪怕只是做⼀个8位的加法器,它的电路图都会⾮常复杂。⽽在⾃然界,两个数相加可能只是⼀个简单的物理过程。所以“通⽤性”是以巨⼤效率损失为代价的。
举个例⼦:李世⽯与AlphaGo下棋。AlphaGo⽤了约2000个GPU和200个CPU,⽽李世⽯可能早上只吃了⼀碗⻨⽚粥。但是在围棋这件由⼈类发明出来为难⾃⼰的、并⾮我们天⽣擅⻓的事情上,⼈类居然还能赢机器⼀场,这恰恰说明了⼈类的效率⾼得不可思议。
所以,我相信未来的⽅向在于借鉴这种⾼效能。⽽今天主流的、堆算⼒的路径眼看就要⾛到头了。斯坦福前校⻓、图灵奖得主,计算机架构的权威John Hennessey在前段时间也表示,“(在提升计算效率这件事情上)我们能想到的’花招’基本上都想完了,原来的路⾛已经⾛不通了”。微软CEO也说过,很多GPU都因为耗电太⼤⽽⽆法使⽤,只能放在那⾥落灰。
FT中⽂⽹:应该如何解决这些问题?对此您在研究课题层面的思考又是什么样的?
Gene Wen:传统计算机⾏业处理问题的普遍⽅式,就是把问题分解成不同的⼦问题,再单独逐⼀解决:⽐如做⽹络的就专⼼做好⽹络,然后留给CPU⼀个标准化的接⼝,CPU具体去做什么⽹络并不管。再⽐如,将⼀张照⽚压缩成JPEG格式,全世界都能看到,你不⽤去管这张照⽚是怎么拍、怎么压的。这就是各层独⽴优化的做法。
图灵奖获得者Don Knuth也曾经说过,计算机科学最重要的方法是separation of concerns,但现在我们需要联合的优化。必须重新思考深度学习的计算:算法是否需要这样设计?架构该如何设计?要让算法根据硬件架构来设计,同时硬件架构也根据算法的反馈进⾏优化。传统流程是:先设计⼀个庞⼤的算法模型,动辄会达到千亿的参数;⼀旦这个模型跑不动了,再去做“优化”——⽐如量化或者剪枝。
这就存在⼀个问题:如果早知道后⾯要“剪枝”,前⾯何必种那么多“树”?应该是从⼀开始就结合硬件约束来设计最优的模型。再打个⽐⽅,在iPhone出现前的那⼀代智能⼿机,它们的产品逻辑是对庞⼤的Windows系统进⾏裁剪,然后“塞”进⼀部⼿机,这注定不会得到最优的⽅法。相⽐之下,iPhone是软硬件联合设计的典范。所以我们的第⼀步,就是要在算法模型的设计和训练阶段,就建⽴一套通⽤的⽅法,能根据不同的硬件约束进行训练。
FT中⽂⽹:除了对软硬件进⾏系统性优化,是否还有其他的突破⼝?
Gene Wen:第⼆个⽅向是解决通信瓶颈。优化通信有两种路径:⼀是让通信更快,⽐如设计更快的⽹络。⼆是⼀个更根本的问题:这些数据是否必须传输?能否在训练过程中就加⼊约束条件,让模型中间结果对通信的依赖降到最低?这样,训练过程就可以⽤更便宜的GPU和通信⼿段来实现。今天⼀颗标价2000美元的GPU和⼀颗10万美元的GPU,算⼒可能只差两三倍,但价格差50倍。差别主要在于缓存⼤⼩和通信速度。如果我们能精准、有效地降低对数据存储和传输的需求,就能⽤成本低得多的硬件获得后发优势。
第三个⽅向是解决数据危机。今天⼤家常说可以⽤于AI训练的数据快⽤完了,中⽂语料尤其稀缺。但我们也在思考:是否真的需要那么多数据?新增的数据对于实现效率增⻓到底发挥着什么作⽤?我们在数学上分析,发现数据可能存在于某种⼏何结构上。如果是这样,我们就可以做“外推”:看到⼀部分数据,就能推断出整体的形状,从⽽⼤幅减少训练所需的数据量和训练时间。
总⽽⾔之,我们谈到的三个⽅向,主要解决的是三个问题:数据、能源和参数规模。我们现在的⼯作就是想在整个产业研发的更底层、更根本处去做变革和创新:从整个计算链条去审视,哪些是必需的,哪些是不需要的,哪些可以做联合优化。
FT中文网:刚才提到的,⼈类大脑所体现的高效特点,对您的研究有什么启示?
Gene Wen:我们的研究还有第四个⽅向的追问:为什么⽣物如此⾼效?今天AI擅⻓的事情,往往是⼈类需要后天“学习”的技能,⽐如翻译、开⻋、解数学题。这些都是⼈天⽣不会的东⻄。⽽对于⼈类天⽣就已经掌握的感知能⼒——⽐如触碰前就能预判物体的软硬、轻重;推开⼀扇⻔时能够预估所需的⼒道,今天的AI和机器⼈却很难做到。
即使在下棋这种“反⼈类”的计算任务上,也有⼀些有趣现象。国际象棋领域有⼀种⽐赛叫“⾃由式象棋”(Freestyle Chess),规则是⼈机组合团队对战。这项⽐赛中最后胜出的世界冠军,并不是最强的AI,也不是下棋最好的⼈加上最好AI,⽽是⼀位苏格兰的普通消防员带领的⼈机团队。他本⼈棋艺⼀般,但擅⻓战略规划,知道如何在⼈与机器之间分配任务。这个例⼦让我觉得,⼈类在战略、模糊决策、整合知识⽅⾯有本质的优势,与机器擅⻓战术、精确计算的特点结合后,能产⽣“1+1>2”的效果。所以,我们的第四个研究⽅向,就是尝试分析简单⽣物的神经连接结构,⽐如只有⼏⼗个神经元的草履⾍。在进化中,这样的结构能存活下来,⼀定是在优化某个关键⽬标,⽐如反应速度、危险识别。我们想⽤数学⼯具反向⼯程:给定⼀个⽣物神经⽹络结构,推断它优化的⽬标函数是什么。这能帮助我们理解智能的本质。
回归到谈话的开始,我们希望能通过回归本质来思考:给定有限的芯⽚资源和功耗约束,到底什么才是最好的模型?⽽不是先设计⼀个庞然⼤物,再想办法让它跑在越来越贵的硬件上。
FT中⽂⽹:“战略”和“战术”这个问题很有意思,能否再谈谈对这一对概念的理解?
Gene Wen:从学习⻆度看,我认为战略关乎⻓期、模糊的反馈;⽽战术更关注短期、准确的反馈。⽐如,在围棋中,某个局部的死活,它的答案是确定的,反馈也是⽐较即时的,这个就是战术;⽽某⼀⼿棋对于整盘棋局最终胜负的影响,它的反馈周期⽐较⻓,⽽且相对来说模糊不确定,虽然AI会给出胜率评估,但不确定性很⾼,这个就是战略。
再举⼀个我在⼀本书中读到的例⼦:泰格•伍兹和费德勒,他们都是各⾃体育项⽬中接近⼤神的选⼿。伍兹从⼩专攻⾼尔夫,这是⼀个反馈⾮常直接的项⽬,⾃⼰和⾃⼰打球,好坏结果⽴现,并不会受到太多外界因素⼲扰。⽽费德勒⼩时候尝试过各种球类,直到⽐较晚他才选择专攻⽹球,⽽⽹球是⼀种需要⾯对对⼿的运动,反馈更复杂、更间接。
有研究就发现,很多“早起步”的运动员,他们因训练早,在运动⽣涯的早期就取得了相对的优势,但后期会遇到瓶颈,甚⾄⽔平下降。这部分原因是他们过于依赖早期明确的反馈,导致在需要处理模糊、复杂局⾯时自身能⼒不⾜。这和AI的“幻觉”问题有相似之处——都是面对不确定性的处理出了问题。
⽬前深度学习的训练,依赖于⼀个明确的“损失函数”来提供准确反馈,调整参数。这恰恰是其局限所在:它难以处理反馈不明确、不即时的问题。⼈类不擅⻓战术计算,所以才发明了围棋、象棋这类游戏考验⾃⼰,并产⽣了⼤师。但这些⼤师的计算能⼒在机器⾯前⼜是不值⼀提。然⽽,⼈类的本性,既战略的能⼒与机器结合,却能发挥巨⼤威⼒。
FT中⽂⽹:您和团队根据当前的产业瓶颈提出了四个研究⽅向。这四个⽅面的研究,哪一个在当下是最难实现的?
Gene Wen:我们提出的四个问题,它们是循序渐进展开的,我们设计这四个问题的⽬的也是为了能⽆缝地接⼊到现有的⽣态当中去。⽐如,新的算法-架构协同设计,对于想挑战当前芯⽚霸主地位的公司就会很有吸引⼒。⾄于说更本质的问题,还是去“理解⽣物智能是如何运⾏的”。这个问题显然更困难,也更具基础科学意义。它也关乎⼀个紧迫的社会焦虑:⼈与AI如何共存?如果未来的AI要真正像⼈⼀样与物理世界交互,它必须解决今天机器所不具备、⽽⼈⼈都有的感知能⼒。我们的研究最终希望回答:芯⽚应该如何设计,才能帮助⼈,⽽不是替代⼈。
FT中⽂⽹: 目前的研究如何转化为实际的商业或社会应用?
Gene Wen:我们正推进两个很现实的⽅向。第⼀是推动半导体与新基建产业。我们正与多家顶级AI算法公司和芯⽚公司接触、测试合作,他们对我们的联合优化思路很感兴趣。除了合作,还有两个具体的科研项⽬:⼀个学⽣团队利⽤我们的技术,开发了⼀款在建筑⼯地⾃动捆扎钢筋的机器⼈,它解决了⾼空、⾼危、繁重的⼈⼒劳动问题;另个学⽣团队在与UC Berkeley等机构合作,探索将技术⽤于⾼楼外墙维护(如清洗玻璃等)和⾼架桥梁的检测,实现⾃动化、低能耗、全天候作业。
第⼆个⽅向就是抓住全球银发经济的发展机遇,在健康与养⽼领域有所作为。我们正在与上海纽约⼤学的吴蓓教授的⼀个研究项⽬展开跨界合作,针对⼝腔健康状况与衰⽼相关疾病有开发低成本,低功耗,可在边缘部署的个性化智能系统。这里面需要用到新的成像技术,机器学习和机器推理算法和架构,解决低光照、剧烈抖动下的实时视觉处理等问题,⽽处理这些挑战这正是我们新架构的优势所在。
我们也研发了⼀款可以应⽤于医疗微创⼿术的窥镜,已经与天坛医院展开了合作,并刚刚获得了两项中国专利。在脑部微创⼿术中,内窥镜的视野极其狭窄,医⽣看不⻅周围⾎管,切除肿瘤时⾮常危险。我们的技术能实时拼接窥镜路径上的画⾯,⽣成全景视图,⽽且延迟极低。这对硬件和算法都是巨⼤挑战,传统架构⽆法在安静、⼩巧的设备上实现。我们的系统已经在胸腔镜、腹腔镜、脑脂肪瘤治疗等方面得到验证。
FT中⽂⽹:您的研究体现了很强的跨学科性,在AI时代如何看待跨学科研究?
Gene Wen:归结到本质时,很多问题的解决⽅法⾃然⽽然就是跨学科的。加州理⼯⼤学的著名半导体教授Carver Mead说过:没有纯粹的理论研究,只有为了解决问题⽽寻找⼯具和⽅法的过程。解决问题是第⼀位的,把它归类为什么学科并不重要。许多获得诺奖的科研成果,⽐如CT扫描、隧道显微镜……包括神经网络,它们都是跨学科解决实际问题的典范。达芬奇并没有人为他研发颜料,突破性的科学创新有各种路径。
作者邮箱 朱振 zhen.zhu@ftchinese.com
图片来源 Getty Images
热门会员文章
策马新程开年大促 会员75折
开通会员后 访问会员专属平台或下载App解锁权益
往期精选
全球资讯 早上8:30见
锁定播客 热点即时听
商业财经 国际视角
关注FT中文网视频号