歸藏的AI工具箱

为什么说通用大模型是大厂游戏,这家公司给出了答案

随着ChatGPT月活下降,大洋彼岸的寒气很快传导到了中国,给炙手可热的大模型浇了一盆冷水,行业因此回归理性,一个共识逐渐形成,通用大模型注定是少数玩家的游戏,创业公司的机遇更多在于行业大模型。

然而,依然有很多初创公司醉心于做下一个OpenAI,讲着类似的故事,即通过曲线救国的方式徐徐图之。

大模型厂商开启人才军备竞赛,行业盈利曙光初现

8月初,腾讯混元大模型据传进入测试阶段,又一名通用大模型强力玩家即将入局。据不完全统计,目前中国10亿参数规模以上的大模型已达79个,大模型数量已超百家,进入真正意义上的“百模大战”。

目前,大模型厂商之间的军备竞赛正在如火如荼的进行中,其中竞争的关键便在于人才的争夺,相比大厂的招兵买马的诱惑,创业公司在福利、前景、稳定性等方面具不占优,继百度、阿里发出招贤令后不久,24日 360也发出了360智脑得最新招聘启示,涵盖算法、数据、推理引擎、训练框架等大模型相关九大岗位方向,囊括了通用大模型所需环节的所有工种,给抢人大战又加了一把火。

创业公司的劣势地位愈加明显。从大模型技术角度,创业公司往往有明星技术派创始人带队,其中以清华派系居多,在理论和实践方面深耕多年。即便如此,行业内一个普遍的观点认为,创业公司即便在某个方面达到了大厂水平,在未来依然难以胜出。

差距究竟在哪里?我们或许能够从360智脑的研发能力上窥见端倪。

在浩浩荡荡的大模型厂商中,真正布局千亿规模参数通用大模型的厂家寥寥。360属于其中反应速度和迭代速度最快,战略布局较为深入的一家。行业人士透露,360的大模型业务已经有营收入账,如果消息为真,无疑给行业注入了一针强心剂,是对大模型“降温论”和“落地难”的有力回击。

大模型行业竞争进入下半场,坚持长期主义是王道

360的大模型战略是“两翼齐飞”,简单理解是技术自研与场景落地并重。如今,“场景”已经取代“参数”,成为了大模型发展的新焦点。这方面,360无疑是行业的优等生。公开消息显示,360智脑已经率先为20多个行业提供大模型企业级解决方案。

打铁还需自身硬,硬核的技术实力是大模型场景落地的必要条件。因为企业级大模型需要在通用大模型基础上训练,而且最好是拥有亿级互联网用户、海量数据管理、工程化数据调度经验的企业来操刀,这些硬性条件对创业公司并不“友好”。

360智脑是国内首个通过信通院可信 AIGC 通用模型评估的大模型,并且在 SuperCLUE中文通用大模型基准评测上多维度领先。由于360在大模型技术和实践上的积累,360被工信部中国电子技术标准化研究院(简称“电子标准院”)授予“国家人工智能标准化总体组大模型专题组”组长单位,参与大模型国家标准制订。

凡此种种,不代表360智脑相比文心一言、通义千问、讯飞星火等大模型有巨大优势,用周鸿祎的话说,各家的能力“半斤八两”。来到大模型下半场,有志于打造通用大模型的厂商更加需要静下来,在如火如荼的竞争环境下,把时间拉长,以长期主义对抗外部喧嚣。

毕竟通用大模型的研发不可能一蹴而就,大模型在训练过程中存在许多不稳定性和误差,干扰因素众多,需要不断地优化和改进,且训练成本居高不下,这是摆在国产大模型厂商面前共同的难题。

通用大模型研发哪家强,360智脑团队与时间赛跑

360智脑业务负责人接受采访时称,360大模型技术自研分两条主线:文本大模型和多模态大模型。以文本大模型为例,360坚持自有模型研发,模型可分成 6B-code,10B,65B ,130B等多个版本,适用于不同的业务和2B场景。

众所周知,高质量的数据语料是大模型训练的重中之重,“垃圾近、垃圾出”是NLP训练的黄金法则。360文本大模型预训练语料包括20大类,80小类数据,总共8TB的数据。多模态大模型训练过程中则使用了12亿对中文图像文本。

这些数据大部分为360独有,对任何一家创业公司而言都是难以企及的。提及数据,就避不开拥有场景优势的大厂在发展大模型上的先天优势。这其中,又以搜索引擎厂商的为最。如果要把大模型作为一本武功秘籍,搜索引擎厂商无疑个个都是练武奇才。

搜索引擎厂商天然的技术特性,与大模型技术路径更加匹配。在国内,百度、360,包括搜狗创始人王小川创办的百川智能,都或多或少的具备这一优势。然而,光有数据远远不够,以360文本大模型训练为例,为了确保微调数据的高质量和多样性,360做了大量的算法和人工标注工作。

如果把大模型训练比喻为一场长跑,预训练阶段只是起跑,起跑优势再大也无法锁定胜局,真正的决胜因素是“耐力跑”阶段的微调与优化,这个阶段往往牵一发而动全身,并且稍有失误都有可能付出巨大的训练成本。

360智脑业务负责人透露,在文本大模型微调过程中,Batch Size(一次迭代中使用的样本量)、学习率、迭代步数等因素都会对结果产生较大影响。为减少干扰因素的影响,研发团队设计了一套缜密的训练机制,能够智能调整不同任务的训练阶段和迭代步数。

在大模型训练至关重要的人类反馈强化学习阶段,由于强化学习具有收敛难度大等特点,360做了学习率、剪枝参数、改进探索策略、引入噪声或正则化、改进回报计算、监控和早期停止、KL散度优化、采样参数调整等大量的优化工作,才使得训练效果和效率取都得到了大幅提升。

在众多算法工程师齐心钻研下,360智脑才得以不断的进化,并迭代了多个版本。背后是高昂的训练成本,以及众多算法、大数据专家在与时间赛跑。

除此之外,作为一家安全公司,为确保360智脑是业界最“安全”的大模型,360从一开始就将大模型安全作为重要考量因素,打造了包括数据构建、模型训练、红蓝对抗、安全评估、风险识别、安全管控、应急处置的完整安全方案。

相较之下,对于创业公司而言,不管是数据,还是需要大量资源投入的算力和人才,每个都是横亘在眼前的大山。更为重要的是,在企业级市场,随着产业落地进入规模化阶段,三分靠技术,七分靠体系化的服务能力。因此,未来大模型行业的头部效应将会越来越明显,赢者通吃,创业公司的机会将被进一步压缩。

过去半年,大模型经历了犹如Gartner曲线一样的过程,从迷茫、跟随到趋于理性。当大模型不再唯技术论之后,创业公司更应回归商业的本源,思考技术之外的竞争优势。以史为鉴,现在的“百模大战”就像当初的“百团大战”一样,最终活下来的毕竟是少数。