无数解的迷雾:AI训练为何像一场随机冒险?
当我们敲下“现在”两个字,期待模型吐出流畅的中文时,却偶尔冒出个“我’ll”这样中英混杂的怪胎,这让人忍不住想问:语言模型到底在想什么?表面上看,中文“我”和英文“I”都指向同一个“我”,可它们的嵌入向量却相距甚远,余弦相似度低到只有0.2053,仿佛两个陌生的路人。然而,模型却能在生成时将它们拼接成“我’ll”,这不免让人惊讶。
原来,这不是语料的错——训练数据里几乎不会有“我’ll”这样的奇葩组合,而是模型在多语言切换中留下的“记忆残影”。预训练时,中英文共享的嵌入空间里,某些不自然的模式悄悄扎根,哪怕后续用纯粹的中文微调,也难以完全抹去。这种现象就像是模型的“潜意识”,提醒我们:它的行为远比输入输出复杂,背后是训练数据和生成机制的微妙交织。
如果放大镜头,事情变得更有趣。模型为何会有这样的潜意识?答案藏在它的过参数化特性里。现代大模型动辄数十亿参数,远超拟合数据所需的最小量。这种冗余让模型轻松“插值”训练数据——完美记住每个样本,误差趋近于零。可这真是一件好事吗?
以医学诊断为例,插值能记住所有病例,但面对新患者却可能束手无策,因为它缺乏泛化能力。参数量并非越多越强,尤其在数据无限的理想世界里,能力会在某个阈值饱和,再多的参数只是徒增冗余。这就像一个书架,书再多也填不满智慧的空白,关键在于书的质量而非数量。过参数化揭示了一个悖论:模型的强大既是优势,也是潜在的陷阱。
再往深处挖,这种悖论的根源指向训练的本质——非凸优化。神经网络的损失函数不是简单的一条直线,而是一个高维空间里的崎岖山脉,局部最优解遍布其中。这些解不是孤立的点,而是连续的“流形”,仿佛一条条蜿蜒的河流,沿着参数空间延伸。想象一下,数十亿维的参数世界里,每调整一个权重,模型可能滑向另一个山谷,却依然保持相似的性能。这种无数解的存在,让我们明白:即使初始值不同,用相同数据训练出的模型也可能风格迥异,因为它们各自找到了自己的“舒适区”。这不仅解释了“我”和“I”的差异,也揭示了训练的随机性与必然性交织的奇妙图景。
如果说局部最优解是山谷,那模型的能力来源又是什么?彩票假说给出了一个引人深思的答案。它提出,随机初始化的网络中藏着一个“中奖彩票”——一个子网络,只要微调它,就能媲美全网络的性能。更妙的是,这种能力的高低分工清晰可见:低层捕获词法、句法等具体特征,高层则提炼出语义这样的抽象表示。为什么会这样?因为 Transformer 的层层递进就像一场接力赛,低层传递基础信息,高层整合成整体意义。这不仅在语言模型中成立,视觉模型里也是如此——从边缘到形状,再到物体,抽象一步步浮现。彩票假说让我们怀疑:或许我们训练的不是整个庞然大物,而只是唤醒了它体内的小巧灵魂。
从理论回到实践,这种灵魂如何适应新任务?假设我们要打造一个眼科模型,新增“视网膜”“白内障”等词汇,微调成了关键。有人建议冻结已有嵌入层,只解冻新词,但结果往往是 LOSS 值纹丝不动。为什么?因为新词不是孤岛,它需要与“炎症”“诊断”这些旧词互动,更需要 Transformer 层理解它们在眼科语境中的新关系。冻结旧词就像锁住了模型的记忆,新词只能在边缘徘徊,无法融入整体。解冻嵌入层,甚至部分 Transformer 层,让新旧词汇与模型核心协同进化,才能真正赋予它专业能力。这不仅是一个技术选择,更是对模型动态性的深刻洞察:它不是静态的机器,而是不断生长、适应的生命。