在中国的科技叙事中,AI并不是一个新词。2016年,谷歌AlphaGO战胜李世石,登上了全球新闻媒体的头条,国内的创业者开始蠢蠢欲动。第二年,谷歌又跑来乌镇与柯洁下了场棋。在这短短一年时间内,国内涌现了528家AI企业、371起AI投融资、9000多项AI专利[2]。当年的互联网大会上,官方发表了一份题为“乌镇指数”的报告,方方面面介绍了人工智能创业的盛况。然而,人工智能热潮只持续了三四年,便偃旗息鼓。因为在当时,AI多为参数量较小的小模型,只能处理定制化任务。面对某个具体任务,科技公司需要先收集并标注对应的数据,再用这些数据去训练,从而让AI获得特定的能力。举个例子,许多中式快餐店,都有自动识别菜品并计算金额的AI。为了打造这一系统,科技公司需要先收集小炒肉、番茄炒蛋等菜品的图像,并给每张图标注好菜名与价格,再用这些数据去训练AI。尽管小模型的技术含量不低,落地方式却和施工队无异,这让AI失去了光环。而打破这一瓶颈的,正是诞生于2017年的Transformer算法。它最大的变革,是解决了过往的RNN等算法,难以处理大规模参数的问题,从而打造出具备通用能力的AI。至此,大模型一词开始登上历史舞台。随着底层技术取得突破,科技公司的大模型迭代,呈现出了一条非常陡峭的曲线。外界对于大模型的认知,多始于2022年底发布的ChatGPT。但在水面之下,相关研究早已如火如荼。例如2019年,一批清华知识工程实验室的技术人员,走出象牙塔创办了智谱AI。从第二年开始,智谱AI开始专注于研究国产全自研、自主可控基座大模型,是国内第一批研究大模型算法的公司。2021年,智谱AI的7位研究员,共同发表了论文《GLM: General Language Model Pretraining with Autoregressive Blank Infilling》,提出了一种不同于谷歌BERT、OpenAI的GPT的预训练架构GLM。在自然语言理解、无条件生成、条件生成这三个主要任务上,GLM表现优异。以GLM架构为基础,智谱AI于2021年发布了第一款模型GLM-10B。此后三年间,GLM又历经多次技术迭代。2024年1月,智谱AI推出了新一代基座大模型GLM-4,在基础能力、指令跟随能力、中文对齐能力等方面全面看齐GPT-4,模型能力实现质的飞跃。不仅如此,GLM-4还拥有强大的上下文能力,可以在128k文本长度内做到百分之百精准召回,并具备多模态的能力。当然,智谱AI只是国内大模型研究的一个切面。这些年,几乎全世界的科技公司都撸起了袖子大搞创新,OpenAI的研究员甚至自发高强度内卷,每天研究到凌晨到1点多。2024年初,北京市人工智能产业投资基金参与智谱AI的新一轮融资,进一步加速大模型发展。AGI改变社会,不再是将来时,而是进行时。
[1] 深度学习革命,凯德·梅茨[2] 乌镇指数:全球人工智能发展报告(2017)[3] The Key To Winning The Global AI Race,NOEMA[4] Andrew Ng: Opportunities in AI - 2023,Stanford Online[5] Generative AI’s Act Two,Sequoia作者:陈彬编辑:张泽一视觉设计:疏睿责任编辑:张泽一