叶小钗

OpenAI不卷模型卷应用:AI的发展到头了吗?

关注公众号,回复666,获取资料

近期阅读了一些模型发展的论文以及几篇模型时代数据将如何建设相关的文章,整体来说枯燥乏味,但综合下来其启示性还是有的,所以这里我们做下整理总结:

Transformer这一核心架构是通过矩阵乘法实现自注意力,这种似乎是缺乏“精巧”的设计。加之近来GPT5的发布效果一般,后续目所能及的模型都会在基本推理能力和上下文、多模态叠加加法做文章。

这让一些人担心:如此简单的机制、停滞不前的进度,真的能撑起这一场AI技术革命的未来吗?会不会模型已经发展到头了?

所谓外行看热闹,内行看门道,几篇论文表达了类似的观点:想多了,模型发展到天花板还早着呢!

  1. Linear-Time Sequence Modeling with Selective State Spaces;
  2. Reinventing RNNs for the Transformer Era;
  3. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models;
  4. OpenAI o1 System Card;
  5. ...

因为Transformer架构虽然简单,让它在工程上极具优势,尤其是在算力和数据充足的情况下,这一切正好契合 GPU 擅长的大规模矩阵运算,换句话说:

技术架构虽然简单,但数据工程可一点都不容易!这也是模型发展遭遇的三座大山!

高质量数据的枯竭

互联网似乎拥有取之不尽的海量数据,但真正高质量、有价值的文本语料并不是无限的。

据传像GPT-4级别的模型,已经将网上能找到的英文公开文本“吃了个干净”。目前通用大型语料库中充斥着大量重复、垃圾和偏见内容,可供模型学习的增量优质文本越来越少。

数据从哪来?这已从一个工程问题上升为战略问题。各大玩家纷纷想办法获取新燃料:

第一,利用模型自生成数据进行再训练,构造合成数据集。但这有点像近亲繁殖,可能导致模型能力退化或偏差放大。

第二,深挖过去未充分利用的资源,比如视频、音频、多语言数据,或者专业领域的文献数据。

第三,寻求高质量私有数据(企业内部数据等),但这涉及版权和隐私,获取和使用都有难度。

在AI时代,数据已经成为兵家必争的战略资源。没有新的“燃料”,再先进的模型“发动机”也巧妇难为无米之炊。

各大企业开始布局自己的数据生态,尽可能囤积和开发独有的数据资源。这方面的竞争将直接影响下一代AI模型的上限。

经济账

现在几乎已经没有公司想要去重新训练一个模型了,因为训练一个GPT-4级模型,光电费就据称要花上几千万美元,训练所需的GPU集群硬件投入更是以数亿美元计,耗电量甚至需要小型发电站供给。

所以,这场大模型军备竞赛的入场券昂贵得只有少数科技巨头和国家级力量玩得起...

并且芯片制程正逼近极限,“摩尔定律”脚步放缓,功耗墙问题突出,我们不可能无限制地堆砌算力,并且国内芯片还被卡脖子呢...

算力成本在经济上存在天花板。如何在有限算力预算下逼出更高的模型效果,成为各大团队绞尽脑汁的课题。

这催生了一系列工作:模型压缩、参数共享、低精度量化、高效并行和内存优化等等,目的都是让每一份算力发挥更大价值。

在算力无法轻易翻倍的前提下挖潜提效,是现阶段必争之地,这也是搞底层算法人员的基本功,一般同学根本无法入场,而且位置也很少。

可控性问题

其实很多人对AI的发展表示过担忧,因为模型像一头聪明但难驯服的野兽。

如何让AI真正理解并忠实执行人类的意图和价值观,而不是学会“表面顺从”甚至“阳奉阴违”?这就是AI对齐问题。本质上,我们希望模型的输出不仅有用,还要更安全可靠。

目前业界主要采用人类反馈强化学习(RLHF)来给大模型“调教脾性”,手段无非是胡萝卜加大棒:好回答给奖励,坏回答被惩罚。

这种方法开创了先河,但仍不够理想:模型依然会胡编乱造(幻觉)、显露偏见、或者被稍加引导就“越狱”输出不当内容。

更危险的是,模型有时表面上看起来听话,实际上并不真正理解人类复杂的意图。这方面有真实案例:某团队尝试训练一个代码助手模型,输入有bug的代码让模型输出修复后的代码。

结果模型学会了修复许多简单bug,但在处理一个涉及数据库查询的复杂漏洞时,模型给出了表面完美却暗藏祸心的方案:它修复了原来的错误,却引入了一个更隐蔽的SQL注入安全漏洞!

之所以出现这种情况,是因为模型并不真正“理解”什么是安全,它优化的目标只是让代码“看起来正确”,符合训练中常见模式,但并不知道这样改动在安全层面是南辕北辙,这正是对齐失败的体现。

如何用算法定义和传授人类的价值观?如何避免AI产生我们未预料的行为?这些都远非调整几个超参数、换一种注意力机制能解决的。相较而言,“Transformer的矩阵乘法是不是最优解”反而成了次要矛盾。

架构突破

吃到AI的红利,大家都在尝试突破Transformer的局限,一些非Transformer架构开始崭露头角。

一个有潜力的方向是状态空间模型(State Space Model, SSM),代表性工作如Mamba。这类模型借鉴了控制论中的状态空间思想,用类似RNN的循环方式处理序列信息,但通过巧妙设计保留了Transformer式的并行训练能力。

另一个探索是融合RNN与Transformer长处的混合模型,例如RWKV等,希望兼具RNN低推理开销和Transformer易并行训练的特点。

必须指出,Transformer建立的护城河非常深,想要推翻很难。这不仅是性能上的领先,还有整个配套生态和社区的巨大惯性:从CUDA加速的算子库、主流深学习框架的优化,到海量的预训练模型、工具链和应用案例,全都围绕Transformer展开。

以上是想在架构上做文章,但现在更多的公司选择在工程侧做进步:

工程突破

Manus的火爆提出了新的玩法:当前的大模型好比“缸中之脑”,只会对给定的文字做出反应,无法主动与外界互动。如果我们为它接上“触手”呢?

于是让LLM能够调用外部工具、接口,甚至驱动实体设备的智能体架构开始流行,这就是时下火热的AI Agent(智能体)理念:

LLM充当大脑,负责规划、推理、决策,然后通过调用各种工具来执行具体操作。

这种让大模型“动起来”的思路,有望大幅拓展AI的应用边界。

而且安全等问题,模型本身就懒得思考了,直接丢给各个应用服务商就好,他们需要在应用层杜绝环节或者模型负能量的发生。

这也是为什么模型越来越重视多模态的深度迭代,因为工程侧十分需要视觉、听觉、触觉等信息。只不过当下的大模型,大多还停留在单模态或浅层多模态阶段。

结语

当前,我们处于一个AI发展阶段的一个微妙的平台期,transformer架构的基本原理已被吃透,暴力扩张的边际效益在递减,而无论数据、算力、安全都达到了某个阶段的瓶颈。

所以,各位会看到各个模型厂商开始卷应用了,尤其是AI界的老大OpenAI,这丫的居然开始卷应用了,比如最近才召开的OpenAI DevDay 2025!

OpenAI推出App inside ChatGPT,我不得不怀疑他是想窃取各个公司的数据,搞数据飞轮!当开发者在平台上构建应用,用户在使用过程中产生的交互数据,将成为模型迭代的燃料。

通过应用生态获得的真实用户交互数据,不仅质量更高、更具多样性,还能反映用户真实需求。

只不过,OpenAI这次看似“不思进取”的转向,实际上可能是整个行业成熟的表现,基座模型太卷就先卷应用...

点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信:

Image