梁博谈一谈:从函数拟合到世界建模,大模型的前世
大模型并不是突然“诞生”的,它是几十年机器学习思想在同一条逻辑链条上的自然结果。
作为一名长期从事人工智能研究的业内人,我始终认为:
如果不能理解大模型的“前世”,我们对它的“今生”和“未来”,就只能停留在叙事层面,而无法真正做出结构性的判断,更谈不上长期投资。
一、一切始于函数拟合:F(X)≈Y
最早期的机器学习、模式识别,本质上并不神秘。
我们从一个极其朴素、甚至带有工程意味的问题出发:
给定一组输入与输出的对应关系,能否学习出一个稳定的映射函数?
形式化地说:
- 输入: X(图像、语音、文本、信号)
- 输出: Y(标签、类别、语义、行为)
- 目标:寻找一个函数
F(X)≈Y
如果这个函数 F 不仅能在训练样本上工作,而且在此前从未见过的X′ 上,依然能预测出合理的Y′,并且这种正确性在统计意义上足够稳定,我们就认为:
这个模型学到的不是样本,而是规律。
这就是所谓的泛化能力(Generalization)。
从今天回看,这一阶段的 AI,其实并没有“智能”野心,它更像是一门关于如何在噪声世界中做稳定近似的学问。
但所有后续的革命,都严格建立在这一步之上。
二、模型复杂度的觉醒:为什么是多层神经网络?
很快,一个核心问题浮出水面:这个函数F,到底应该长什么样?
参数太少,模型表达能力不足;
参数太多,又会过拟合、失去泛化能力。
在漫长的探索中,人们逐渐意识到:
真实世界的 X→Y 映射,本身就是高度非线性的、多尺度嵌套的。
线性模型无法描述世界,不是算法不够聪明,而是假设错了。
多层神经网络(Deep Neural Networks)的真正价值在于它的结构弹性:
- 理论上,可以逼近任意复杂函数
- 实践中,可以通过层级结构逐步逼近真实世界
在学术视角下,每一层神经网络都在做两件事:
- 抽取更高层的语义特征
- 压缩与去冗余
于是,一个非常重要的概念逐渐浮现——并不是原始的 X 才是真实的 X。直接用原始输入,并没有真正的理解,就没法稳定拟合得到所需要的Y,因此需要计算得到一个更加精准的X,Compressed(X)
三、压缩即理解:为什么要得到Compressed(X)
原始输入往往充满冗余信息:
- 图像中的背景噪声
- 语言中的语法填充
- 传感器中的随机扰动
深度网络通过逐层变换,最终得到一个高度凝练的向量表示:
Compressed(X)
这个向量并不“像”原始数据,但它更接近事物的本质。
在这个意义上,我们甚至可以说:
Compressed(X) 才是真正被模型“理解”的 X。
在压缩空间中进行预测,比直接在原始空间中拟合,要稳定得多,也鲁棒得多。
同样的思想,也可以作用在输出端:
Y 也可以被压缩、建模、再重构。
四、从压缩到重构:Transformer的思想源头
以机器翻译为例:
- 输入语言 X
- 输出语言 Y
传统做法是直接从 X 映射到 Y,但效果始终受限。
Encoder–Decoder 架构引入了一条更“人类化”的路径:
- 将 X 压缩为抽象语义表示
Compressed(X)
- 在语义空间中进行变换,得到
F(Compressed(X)) = Compressed(Y)
- 再将其解压为目标语言
Y=Decompress(Compressed(Y))
Transformer 并不是凭空发明的奇迹,它是 “压缩—重构”这一思想的工程极致化实现。
五、静态语义的失败:Word2Vec的天花板
在 Transformer 之前,Word2Vec 曾经是一次重要突破。
它首次让词语拥有了“向量语义”,
从某种意义上看,也是一种 Compressed(X)。
但它很快暴露出致命缺陷:
语义是静态的。
“苹果”这个词:
- 在科技语境中是公司
- 在日常语境中是水果
但在 Word2Vec 中,它只有一个向量。
这不是工程实现的问题,而是范式的限制。
六、注意力机制:语义的“现场计算”
注意力机制真正改变的,是 “语义何时被决定”。
它不再提前固化语义,而是在模型读取句子的过程中,根据上下文关系实时计算每个 token 的含义。
也就是说:
语义不是存储出来的,而是被计算出来的。
这种“现场计算”极其昂贵:
- 每个 token 都要与上下文中其他 token 发生关系
- 需要大量 KV Cache
- 序列越长,计算和显存消耗越大
但代价换来了前所未有的回报——
生成结果的准确性、稳定性与连贯性发生了质变。
这一步,直接把 AI 推进了“可用”阶段。
七、从提示词工程到思维链:让模型替人思考
当模型能力增强后,一个新问题出现了:
普通用户并不会“和模型说话”。
早期,我们依赖提示词工程(Prompt Engineering),
本质上是由人类替模型规划思考路径。
这显然不可持续。
思维链(Chain of Thought)的提出,是一次极其关键的转折:
让模型自己把问题拆开,把隐含步骤显性化。
用户不再需要写“完美提示词”,
模型开始学会从一个简单问题中,自动展开推理空间。
八、慢思考:用时间换智能上限
在此基础上,慢思考(Deep Thinking / Reasoning)进一步突破了上限。
模型在输出答案之前:
- 自我验证
- 自我反驳
- 自我修正
甚至“自己和自己辩论”。
这一步标志着 AI 从“概率生成器”,
向近似理性推理系统演进。
同时,它也第一次清晰地把:
- 推理质量
- 推理时间
- 推理成本
绑定在了一起,直接塑造了后续的商业模式。
九、走向物理世界:大模型不再满足于文本
当推理能力成熟后,大模型开始突破“输入—输出”的抽象边界。
它渴望:
- 更多传感器
- 更多接口
- 更多执行能力
Physical AI 与具身智能,正是这种趋势的自然延伸。
在工厂、码头、仓储、能源系统中,
我们正在看到 AI 从“建议者”,变成“执行者”。
结语:理解前世,才能理解投资
大模型的表面,是模型、参数与 API;
它的背后,是算法范式、硬件体系、数据结构与能源约束。
理解了它的前世,我们才能在后续章节中,看清它的今生与未来。而这,正是我希望提供的——一种更接近底层真实的认知框架。