PostgreSQL码农集散地

北大这篇 K12-KGraph 打了所有大模型的脸

这两天刷到一篇北大投给 NeurIPS 2026 的论文,K12-KGraph,越看越兴奋——不是因为它又刷了某个 SOTA,而是因为它在一个被所有人都忽视的盲区上,捅出了一条全新的赛道。

今天这篇文章,我想用最直白的方式,把它的核心价值拆给你看。如果你正在做教育 AI、智能辅导、自适应学习,或者只是关心「下一代 AI 教育评测往哪儿走」,这篇值得你花 8 分钟读完。


这篇论文干了什么

团队从人教版小学到高中的数学、物理、化学、生物教材里,系统性地抠出了一张「课程知识图谱」(K12-KGraph)。然后用这张图,同时造了两样东西:

  • K12-Bench:一套 23,640 道多选题的评测基准,专门考「课程结构理解力」——也就是模型是否真懂「先学什么再学什么」「这个概念属于哪个大类」「这个实验验证的是哪个原理」。
  • K12-Train:大约 2,300 条监督微调样本,专门教模型这种「课程结构理解力」。

然后,论文宣布了两个让所有 AI 从业者都得正视的结果。

两个让人坐不住的结果

① 顶尖大模型在这类题上集体折戟

最强的闭源模型 Gemini-3-Flash,在这个 K12-Bench 上的总体精确匹配率,只有 57.1% 。

最强的开源模型 Gemma-4-31B-IT 是 46.4% 。

最弱的 LLaMA-3-8B-Instruct 只有 7.2% ,基本等同随机猜。

而且,这五个任务族里有两类(Prereq 前置推理、Neighbor 邻居推荐)——也就是最需要真正理解「有向结构关系」的任务——最强模型 EM 也低于 35% 。

这意味着一件让整个教育 AI 行业脸红的事:

我们花了几十亿美金训练出来的所谓「最强大模型」,连「学一元二次方程之前得先学因式分解」这种最基础的结构性知识,都没真正搞明白。

它能做高考压轴题,但它「不懂这门课」。

② 2,300 条样本就能反向碾压十几万条通用指令数据

更让人震惊的是第二个结果。用 K12-Train 这套只有 2,300 条的结构化样本微调:

  • Qwen3-4B-Base 在 GaokaoBench 上,比最强基线高出 24.1 分;
  • Llama3.1-8B-Base 比最强基线高出 32.4 分;
  • EduEval 上,这套 2,300 条样本反超了 OpenHermes、WizardLM、UltraChat 等所有主流指令数据集。

最让我拍桌子的,是跨学科迁移:K12-Train 只用数理化生四科合成数据,但微调完的模型在语文、文科数学这种完全没有直接监督的科目上,也拿到了最高分。

这说明模型学到的不是「具体学科内容」,而是一种结构化理解与作答方式。


这件事为什么重要?

学术界目前做教育 AI 评测,几乎所有的基准(C-Eval、CMMLU、GaokaoBench、EduEval)都只是从题库里抽几道题,考的是「这道题答案是什么」——本质是事实回忆。

但一个真正合格的老师,光会做题就够了吗?

她还得知道:

  • 学一元一次方程之前得先学算术运算;
  • 它和「不等式」同属于「代数式」这个大类;
  • 它第一次出现在教材第几章第几节;
  • 这个实验能验证它背后的哪个原理。

这些「隐性的课程结构知识」,现有评测体系完全没测,现有训练数据完全没教。

K12-KGraph 这篇论文的核心价值,就是给这个被忽视了几年的盲区,补上了一个全新的评测维度——团队管它叫 Curriculum Cognition(课程认知) 。

它还提供了一条工业级低成本路径——

不需要堆几十万条通用对话数据,用几千条知识图谱指导合成的结构化数据,就能在教育下游任务上拿到显著提升。这对算力与数据预算有限的智能辅导团队,尤其友好。

三条必须正视的适用边界

泼盆凉水,有几个适用边界:

  • 图谱构建高度依赖 GPT-5.2 自动抽取 + 12 名学科专家人工核验(Fleiss' κ = 0.84,「高一致」不等于「完全正确」),系统性偏差会在下游悄悄积累;
  • 目前只覆盖数 / 理 / 化 / 生四科,语文、历史、英语等文科没纳入图谱,跨学科迁移大概率是「结构化推理风格」的迁移,而不是文科知识本身得到了支持;
  • 基于中文人教版教材,英文或其他语言版本的 K-12 场景,方法论可复用但需要重建整套图谱和数据。

这篇论文对未来意味着什么?

学术上:它打开了一个新方向——评测和训练「教育 AI」不应止步于「能否答题」,还要看「是否理解课程结构」。

更深远的是「一图两吃」的范式价值:同一张知识图谱,既当评测基准的原材料,又当训练数据的原材料——这天然保证了「考核什么,模型就专门练什么」,从根上杜绝「考核与培训脱节」。

这个范式不止教育能用。法律、医疗、金融……任何有「知识结构脉络」的垂直领域,理论上都能复用这套「知识图谱 → 评测 + 训练数据」的流水线。

工业上:对做智能辅导、自适应学习、教育大模型的团队,这是一条算力友好、数据友好的路径——几千条高质量的结构化样本,远胜于几十万条泛泛而谈的对话数据。

最后

我看完这篇论文有一个很深的感受:

我们一直在比谁的模型更大、谁的 benchmark 分数更高,但真正决定 AI 能不能「像老师」的核心,从来不是参数规模——而是模型脑子里的那张「这门课该怎么教的隐形地图」,到底画得有多细。

K12-KGraph 给我最大的启发是:结构化、垂直化、可解释的训练数据,可能才是下一轮教育 AI 的胜负手。

那些还在堆数据、堆算力的团队,可能需要停下来想一想了。


📌 论文地址:arXiv:2605.09635

📌 项目主页:haolpku.github.io/K12-KGraph-page

📌 数据集:huggingface.co/datasets/lhpku20010120/K12-KGraph

👇 评论区聊聊:你觉得 AI 教育产品里,「课程结构理解力」是会被补上的短板,还是只是论文里的 trick?