很不错,我喜欢!Kimi,又悄悄咪咪的进化了!
你好呀,我是歪歪。
周末的时候 Max 同学给我出了一道事业单位考试的笔试题:
137/213 和 139/218 比谁大?
我一看,好家伙,这小学生都会啊,于是我掏出了手机,打开了计算器,正准备“除一下”。
她说不能用计算器。
那就:笔来,我手算。
然后她说,在争分夺秒的考场上,你如果想着用笔去算这个题的时候,不管做得对不对,你都已经“错了”,这题可以直接“秒杀”的。
我一听:呦呵,有点意思,展开讲讲。
然后她给我举了个很贴切的例子:假设你玩王者荣耀,现在 213 局,赢了 137 局。今天又开了 5 局,但是只赢了 2 局。
那你的胜率是变高了,还是变低了?
这个肯定是可以心算一把的,胜率肯定是变低了嘛。
所以,137/213 是大于 139/218 的。
这就是“胜率法”。
以此延伸,如果让我以后辅导孩子学习,这种属于“小学生”阶段的题目,哪怕再多学点,到初中的数学,我应该还能拿捏住,到了高中,可能就开始有点费劲了,咋办?
Max 同学随口就说:就算是高中数学我肯定也是没有问题的。再说了,现在 AI 这么厉害,到时候肯定也轮不到我们。
聊到这里的时候,我刚好想起前两天刷到一个信息,说 Kimi 发布了一个关于数学模型的啥产品。
当时关注到这个信息,完全是因为“数学模型”这个关键字。现在的各种大模型,对于文本类的处理已经可以说是炉火纯青了,但是在数学领域频频翻车。
因为目前大多数的大模型在最开始设计的时候就算用来理解和生成自然语言,而不是处理复杂、精确的数学运算。
自然语言具有模糊性和多义性,而数学语言则追求精确和唯一性。所以,数学模型,相比于文本类大模型来说,实现起来的复杂度是更高。
所以我打开 Kimi 准备问 Kimi 到底是个啥产品,我来试一试,结果你猜怎么着?
一进首页就看到它给自己打广告呢:
点进去一看让它自己介绍了一下:
这不就巧了吗?
刚想着“高中数学,有点费劲”,就遇到这个高考数学都能搞定的产品,这不就是我要找的东西嘛。
我找到了 2024 年新课标全国 I 卷数学真题试卷,这是它的第一道选择题:
当我以 LaTeX 格式把这个题目喂给 Kimi 的数字版的时候,这是它给我的回答:
正确答案就是 A,Kimi 不仅给出了答案,还给出了解题的过程,让我们知道这个答案是怎么来的。
在数学考试上,大家都是过来人,知道有个叫做“步骤分”的东西。这个思考的过程,其实就对应着步骤分。
而在大模型领域,这个思考的过程有个专业的术语叫做“CoT(Chain of Thought)”,是一种提升大型语言模型(LLM)在复杂推理任务上性能的技术。
它通过要求模型在输出最终答案之前,显式输出中间逐步的推理步骤,从而增强模型的算数、常识和推理能力。
核心点在于构建一条逻辑清晰的思维链,这条链由一系列相关的推理步骤组成,每个步骤都基于前一步的结果进行推导。
从输出结果来看,Kimi 应该是完成了 CoT 技术和数学模型的结合,这波结合应该是属于走在了大部分模型的前面。
其实也可以扩展一下,“CoT+其他”,比如 Kimi 的搜索板块。
一般来说,用户在使用 Kimi 进行提问的时候,有时候是不清晰的,但是有了 CoT 加持后,Kimi 就会开始对问题进行“思考”,就能对用户的模糊意图进行推理,在搜索过程中调用多种工具,以及对搜索的信息源做甄别。
也是一个非常值得期待的功能。
说回到数学版,也许你看前面的这个数学题,没什么感觉,毕竟第一题大家都叫做送分题。
但是,你用普通版给你做个演示:
这个对比就很明显了,在普通版里,首先给出的答案就是不对的。
然后进一步去找不正确的原因,发现它会认为 2<1.710。
这个错误其实已经不新鲜了,几个月前“9.11 和 9.9 比,谁更大”这个问题,就已经秒杀过一种大模型了。
现在,数字版,就能非常清晰、正确的处理这一类数学问题。
专业的事情,就交给专业的大模型去做。
至少,我以后遇到数学相关问题的时候,我肯定不会直接去问文本类大模型了,而是问“数字版”,免得被忽悠了还不知道为啥。
此外,我在了解相关信息的时候,看到了官方的这个描述:
我在使用的过程中也遇到了类似的情况,觉得还有点意思。
就是它会在思考的过程中突然发现:“额,好像不对啊?怎么回事,我再看看。”
也就是说,即使思路可能有点问题,但也是它思考的过程,它都会体现出来。
就像官方描述的一样:Kimi 数字版的解题思考过程,常常会让数学高手也受到启发。
在玩数学版的时候,歪师傅想起了一个名人名言:
万事万物,皆是数学。--- 沃兹基*硕德
既然都离不开数学,那数学会去怎么描述“跑步”这个事情呢?
于是我咨询了一下关于这方面的问题:
明年 2 月 23 日,有一个半马的比赛,如果我想要在 90 分钟内完赛,它站在数学的角度,告诉我,以我现在的水平,每个月需要提升 4.67 秒/公里,才能达到目的。
然后它论证了一下每个月把配速提升 4.67s 的合理性,并给我了一个训练计划建议,并且提出了“过度训练和伤病”的潜在问题,同时还提到了一个非常合理的训练原则:10% 规则。
说真的,它的训练计划啥的都非常的笼统,但是它刨去了一切的客观因素,站在数学角度给出了一个可量化到每个月的精准时间:4.67 秒/公里。
这是我之前没有想到的,这也体现了数学语言的精确性。
提到数学问题,我也问了一个简单问题,可以看到它有一个过度分析的过程,但是这个过度分析的过程,也很有意思,体现出了数学的严谨:
它用了几百字,通过九大步骤,最终得出了 1+1 等于 2 这样的结论。
这其中,让我觉得有点震惊的是,它考虑的非常的周全,考虑到了不同进制之间的处理:
在二进制中,1+1=10,这在十进制中表示为 2
相当于对于我的提问进行了猜测:提问的这个人只给了“计算1+1”,万一它说的是二进制呢?
同时,它的回答一定程度上也反哺了提问者:哦,原来换到“二进制”的视角,还有另外一个回答呢。
另外,Kimi 的数学版也让歪师傅联想到了一个人:美剧《生活大爆炸》中的谢尔顿·库珀。
这个哥们就是一个典型的理工男,具有非常牛逼的“数学脑子”。
我记得有一集,谢尔顿决定使用他的“逻辑和数学”方法来寻找理想的伴侣,他创建了一个复杂的“交友算法”:
我试着让 Kimi 数字版描述了一下他的这个公式:
这个算法包括了一系列的参数和标准,比如智力水平、兴趣爱好、对科学的热爱等,并且给每个标准分配了权重。
然后他制作了一个电子表格,列出了所有可能的候选人,并根据他的算法给每个人打分。
然而,当他按照算法找到他认为的“完美朋友”时,他发现这个人并不是他真正想要的人。
算法是他自己定制的,人也是基于算法找出来的。但是为啥算法筛选出来的人却不是最合适的呢?
因为他忽略了人际关系中的情感和化学反应这些无法量化的因素。
但是,如果谢尔顿拥有大模型,利用大模型的数学能力,对自己的算法进行不断的迭代,最后形成一个非常牛逼的筛选算法。
那他能找到一个“最好的朋友”吗?
肯定还是不能的,数学是绝对理性的,生活是充满感性的。
但是,利用大模型不断迭代的过程,一定是有趣的。