今天看到「机器之心」用几家主流大模型做的高考数学卷挑战评测,结果挺出人意料:Gemini 2.5 Pro 第一,豆包用的是具备多模态能力的视觉版,和 DeepSeek R1 并列第二。说是第二,其实和第一也不过一分之差而已。说起来,大模型在数学方面的能力,一直被质疑,过去也时不时的看到有用户抱怨大模型做不对简单的数学题。毕竟,大模型到目前为止更为擅长的是处理文本信息,非要逼着去做数学题的话,倒也是一个强需求。去年就有人用高考数学题做过评测,不过那次大模型的总体表现可以说是惨不忍睹,甚至没有一家能够及格。现在这才只经过一年的时间,得分就都已经表现相当惊人,各家模型都已经达到了优秀高考生的水准,或许明年就有大模型能拿到满分。在做数学题这事儿上,大模型是肯定也可取代我了。你说我该高兴还是——大模型写代码比我好很正常,毕竟我不写嘛,现在数学这能力我眼看着也追不上了。
其实这种趋势早就有预兆。数学家陶哲轩就认为:现在 AI 像家庭教师一样,能将每一步的证明向你阐明,并立即回答背后的原理,所以「做得对」已经不能作为学生做作业的目标。我们要教下一代孩子的是,如何验证 AI 生成的结果正确性,以及如何获得 AI 以外的意见。如果换一个角度看,AI 在解题训练和知识应用层面,已然是一位近乎完美的「超级刷题高手」,这倒是刚好适合我们应试教育的模式。
真是令人感慨,在做数学题这事儿上,大模型是肯定也可取代我了。不只是可以取代我,几乎所有觉得自己还有两把刷子的家长们,可能以后也不如大模型好用了。换句话说,让孩子早早学会用大模型辅助学习,不失为明智之选。就像围棋选手跟 AI 下练习棋,功力肯定长进,完全可以视为一种新式科学训练。未来尖子生的数学训练,恐怕也会少不了与大模型「过招」这一环节。只看一家评测,似乎总有点不放心,会不会有误差?再说,总分也没相差太多,难以充分表现能力差异,又去找了两份评测对比一下,从结果上看,Gemini 和豆包倒是始终在第一梯队里。字节「大力出奇迹」这一看家本领,用在大模型这件事上看来也会有奇效,不可低估这家公司的实力。至于我们这些普通人和家长——或许真要转变心态,与其死守「我来辅导」「家教来辅导」的思路,不如思考如何合理借力这些工具,帮孩子在新时代的学习路径上跑得更快、更远。
说不定,未来某一天,我们看到的不只是大模型刷分,更是它和顶尖数学家共同攻克未解难题。
不知道现在有没有大模型厂商去找韦神谈谈合作,这个点子免费。