三棒
预训练/后训练/后推理是接力赛,不是替代关系 —— 预训练读遍图书馆形成通用能力,后训练手把手改作业教它听话干活,后推理(测试时scaling/long thinking)不改参数、只是让它在回答那一刻多想一会儿。三条曲线先后冒出来,本质是收益递减逼出来的:预训练边际收益放缓,行业就把重心挪到后训练;后训练也快摸到天花板,又挪到后推理。
K12-KGraph 确实证明了结构化知识能显著提升后训练效率 —— 用人教版教材建的知识图谱,只靠2,267条合成数据就在GaokaoBench上超过了OpenHermes、WizardLM等八个主流指令数据集,而且这套数据完全没碰过的语文、历史科目也跟着涨分,说明模型学到的是可迁移的结构化推理习惯。但这只验证了SFT阶段,样本量也卡在小规模,机制上还是从结果反推的合理假设,不宜直接拔高成放之四海皆准的规律。
最近半年,如果你混在 AI 技术圈子里,会发现一个趋势:
一边是"预训练要见顶了"的声音越来越多 —— GPT-3到GPT-4,参数从1746亿冲到1.8万亿,算力需求涨了68倍,可再往上堆参数,效果曲线已经没那么陡了;
另一边却是"后训练""后推理"这些词突然被反复提起,好像行业一夜之间找到了新大陆。
恰好这个时候,北京大学团队的一篇论文 —— K12-KGraph —— 在技术圈里被翻来覆去地讨论,说的是"给K-12教材建一张知识图谱,用极少的数据就能把大模型的教学能力训练得比市面主流数据集都好"。这两件事凑在一起,很容易让人怀疑:知识怎么组织,是不是才是决定后训练、后推理效果的那个隐藏变量?
论文详见 《AI论文解读 | 北京大学 K12-KGraph 论文解读 : 知识组织决定了 AI 后学习/推理性能?》
我们先把"后训练""后学习""后推理"这几个词捋清楚 —— 它们经常被混着用,可实际上指的是三件完全不同的事。
预训练、后训练、后推理,其实是接力赛的三棒
先说结论:这不是三个互相取代的技术,而是一场接力赛,每一棒解决的问题都不一样。
预训练是第一棒,干的事情最朴素 —— 让模型读遍能读到的所有文本,从中形成语言直觉和世界知识。这条曲线到今天依然管用:模型越大、数据越多、算力越足,效果越可预测地变好。但问题也在这儿:当参数规模冲到千亿、万亿级别,继续往上堆的边际收益已经肉眼可见地放缓了,而成本却是超线性增长的,这也是为什么"从头训一个大模型"逐渐变成极少数巨头才玩得起的游戏。
后训练是第二棒。模型读完书之后,还不会"听话" —— 你问它"法国首都是哪",它未必会规规矩矩回答"巴黎",可能接着往下瞎编一段无关的话。后训练要做的,就是用精心整理的指令数据、对话数据,加上监督微调(SFT)、以及DPO、GRPO这类强化学习算法,把模型从"什么都读过的书呆子"调教成"听得懂指令、干得了具体活"的助手。这一步计算量比预训练小得多,但技术含量正在快速上升 —— 因为数据质量、算法设计的好坏,直接决定了同样的计算投入能换回多少能力提升。
后推理,行业里更常见的说法是"测试时scaling"(test-time scaling),也叫"long thinking"。这是最新冒出来的第三棒,2024年之后随着一批"推理模型"的出现被明确提了出来。它不碰模型参数一根手指头,而是在你提问的那一刻,让模型多花点算力"想一想" —— 生成更长的思维链、多条路径分别算一遍再投票、或者做树搜索验证。用人话说,预训练是"读遍图书馆",后训练是"请个好老师手把手改作业",后推理则是"考试的时候多打会儿草稿" —— 草稿本身不会让你多学到什么新知识,但能让你更谨慎地把已经会的东西调用出来,少犯低级错误。
至于"后学习"这个说法,坦白讲,我在国际学术语境里没找到一个和"后训练""测试时scaling"并列的独立技术名词对应它。它更像是中文圈子里对"后训练里的学习过程"或者"模型上线之后持续吸收新数据、持续调整"这件事的一种笼统叫法,如果要找一个最接近的技术概念,大概是"持续学习/在线学习"(continual/online learning) —— 这和"上线前一次性完成的后训练"不完全是一回事,只是实践中两者的边界确实越来越模糊,很多产品化的强化学习本身就是边上线边迭代的循环。
三条曲线为什么会先后冒出来?说白了是收益递减逼出来的。预训练这条路走到今天,头部模型继续砸钱堆参数已经不划算了,那就把注意力挪到后训练 —— 不用重新烧一次数百万卡时,靠更聪明的数据配方和算法就能拿到肉眼可见的提升;等后训练这条路也开始摸到天花板,行业又把目光投向了后推理 —— 不改模型,光是让它在回答时多想一会儿,照样能明显提分。这也是为什么这一年多,大家讨论的重心从"卷参数规模"明显转向了"卷后训练数据质量"和"卷推理时的思考策略"。
顺带说一句,这套三段式框架不是哪家公司自说自话 —— 英伟达的官方博客、多家科技媒体都独立采用了同一套划分,说明这确实是当下行业相对公认的公共语言,而不是某个营销话术。不过这套框架成立的前提,是讨论对象仍然是以Transformer自回归语言模型为核心、追求通用对话和推理能力的这条技术路线;换成别的模型架构,或者还处在预训练数据本身就不够充分的小模型阶段,"后训练更划算"这个判断就不一定适用了 —— 对这些模型来说,先把预训练的底子打扎实,可能仍然是性价比最高的一步。
K12-KGraph 做了什么, 凭什么掀桌子
弄清楚了后训练/后推理是什么,再来看K12-KGraph为什么会被反复讨论,就顺理成章了。
这篇论文的出发点其实挺朴素:现在市面上评测教育大模型的基准 —— C-Eval、CMMLU、GaokaoBench —— 考的都是"模型能不能答对题",也就是事实回忆能力。可一个真正合格的老师脑子里装的东西,远不止"知道答案"。她还知道"学一元二次方程之前得先会解一元一次方程",知道"线性方程"是"代数式"这个大类下面的一个分支,知道某个实验对应哪个理论概念,知道每个知识点第一次出现在教材哪一章。这种结构性的理解 —— 论文管它叫"课程认知" —— 现有的训练数据和评测体系压根没覆盖到。
北大团队的解法很直接:直接从人教版官方教材里,用OCR加大模型抽取的方式,拉出一张覆盖数学、物理、化学、生物、小学到高中全学段的知识图谱,图里有概念、技能、实验、习题这些节点,节点之间用"分类""先修""关联""验证"这些关系连起来。这张图本身经过12位学科背景的标注员人工校验,一致性系数达到0.84,质量不算低。从这一张图出发,他们同时产出了一个专门考"课程认知"的评测集(2万3千多道题),和一套只有2,267条、完全由图谱结构合成出来的训练数据。
数字出来之后,确实容易让人瞪大眼睛。第一组数字说明现有大模型压根不懂课程结构:即便是当时最强的模型之一,在这套"课程认知"评测上精确匹配率也只有57%左右;一个较强的开源模型只有46%;某个8B的开源模型的表现,甚至跟纯随机瞎蒙没什么两样。第二组数字更抓眼球:这套只有2,267条、完全从图谱结构合成出来的训练数据,在严格控制数据量相同的前提下,SFT之后的效果超过了OpenHermes、UltraChat、WizardLM等八个主流通用指令数据集,差距有的还挺大。更有意思的是,这套数据完全没覆盖语文、历史、地理这些学科,可训练之后模型在这些科目上的表现依然是同批实验里最好的一档 —— 这说明模型学到的不是某一科的知识点,而是一种能迁移的、结构化的推理和答题习惯。
不过话说回来,凡事要辩证地看:这组漂亮数字目前只验证了监督微调(SFT)这一个阶段,图谱化数据用到强化学习阶段是不是同样有效,论文并没有回答;样本量卡在2,300条这个相对小的规模,优势才这么明显,数据量继续往上翻十倍百倍,这个优势会不会被摊薄,也还是未知数。"结构决定效率"背后的机制,论文更多是从实验结果反推出的合理假设,而不是从模型内部机制层面做了严格的可解释性验证。所以我的判断是:这个结果确实证明了"知识组织形式会显著影响后训练效率",但要把它拔高成一条放之四海皆准的普适规律,条件还不够 —— 它至少需要知识领域本身存在真实的、可显式建模的结构(K-12数理化生天然适合,很多现实任务未必如此),需要图谱抽取质量足够高(12人人工校验的成本可不低),也需要下游任务恰好考的是结构性推理而不是纯粹的死记硬背。
反复讨论不是巧合
我觉得这不是巧合,而是两条线索精准地撞到了一起。行业正处在"预训练红利见顶、后训练成了兵家必争之地"的焦虑期,任何一篇能回答"后训练阶段,用什么样的数据/结构能榨出更多效果"的论文,天然自带话题性。而K12-KGraph恰好讲了一个特别适合传播的故事 —— "只用2,300条数据,干翻八个主流数据集",这种"小数据打败大数据"的反差感,比"我们又堆了个更大的数据集"天然更有传播力。再加上"最强模型的先修关系推理还不如及格线"这个反差,两头一叠加,一两句话就能截图转发,正好踩中了技术圈爱看的那种叙事结构。
不过这里我得诚实地说一句:这是一篇2026年5月才挂出的很新的论文,我能查到的公开传播证据,主要是它被论文评述聚合站点收录翻译,属于"在AI/教育AI技术社区内引起较高关注度"的量级,还谈不上是破圈到大众媒体的那种"火"。如果你说的"火"是指技术圈子里的热议,上面这套分析站得住;但如果是指大众层面或者资本市场层面的广泛关注,目前能查到的证据还撑不起这么强的判断,这一点我觉得有必要提醒你别急着当成板上钉钉的事实。
总结
那么,"知识的组织形式是不是直接决定了后训练、后学习、后推理的效果"?我的答案是:在"后训练"这一棒上,K12-KGraph给出了相当扎实的证据 —— 至少在结构清晰的K-12数理化生这类领域,把知识显式组织成图之后再合成训练数据,比自然采集的通用语料效率高得多。但"后推理"这一棒,这篇论文其实完全没有验证过,能不能把同样的逻辑套过去,目前更多是合理的猜想而不是已经被证明的事实。真要证伪这套猜想也不难:换一个结构性没那么强的领域,比如开放域闲聊或者创意写作,用同样的方法建"图谱化数据"却拿不到类似的效率提升,那就说明这条规律是领域特定的,而不是普适真理。反过来,如果未来有人在法律、医学这类同样有清晰层级结构的领域复现出类似的效果 —— 用远小于主流语料的数据量,拿到超越通用数据集的表现 —— 那"结构决定效率"这条假说,就会拿到更有力的跨领域支持。
说到底,大模型这一路走来,从"读得越多越强"到"教得越巧越强",再到"想得越久越准",每一步都是在同一个问题上换了个角度回答:知识到底该怎么长在模型脑子里。K12-KGraph没有回答全部问题,但它确实提醒了我们一件很朴素的事 —— 有时候不是知识不够多,而是知识之间的关系,一直没被好好整理过。