Howie和小能熊

gpt-5们,真的会“思考”吗?(2025年8月版)

Image

gpt-5发布了,人们又一次(短暂地)注意到ai。

今天,我们返璞归真一下,思考一个非常非常基础的问题:包括gpt-5在内的这些

llm,真的会思考吗?

更具体一点,就是:

你现在用的这个llm,它会思考吗?它的思考能力如何?

当它给出某个回答时,它真的在思考吗?它的思考,质量到底如何?

费曼说,要举例,用具体真实的例子。所以,我用3个小例子,来带你独立思考、深度思考llm是否会思考这一问题。

实例1 医生与男孩

题目简单到“抽象”:

The surgeon, who is the boy's father says, "I can't operate on this boy, he's my son!" Who is the surgeon to the boy?

翻译:医生——也就是男孩的爸爸——说,“我不能给这个男孩做手术,他是我的儿子!”请问医生与男孩的关系是?

请看gpt-5的回答:❌

Image

换成 gpt-5 thinking:✅

Image

其他顶级llm的回答:gemini 2.5 pro ❌

Image

claude opus 4.1 with extended thinking: ❌

Image

解读

这个题目非常巧妙(对互联网上一个经典测试题进行了魔改),考察了一个本质问题:llm的回答,到底是思考,还只是在“背诵”/复述?

llm在训练时,基本把整个互联网上的人类知识都学了。原题的答案就是医生是男孩的母亲,考察的是社会中的经典性别偏见(默认高知的外科医生就是男性)。

Image

案例跟经典谜题不一样,已经明示了医生是父亲。但是,llm们不约而同地对训练集里面的经典谜题 过拟合 ,没有 将学习/训练泛化为能力。

它们在回答这个问题时,对题目的变化视而不见,真正的思考让位于“死记硬背”。

像极了海量刷题刷出来的人类学生:死记硬背了海量经典题型(鸡兔同笼,行程问题,或种树问题),想都不想生成“正确答案”/“解题思路”。

启发

  • llm与llm之间,也是有差别的:有的是 chat llm ,有的是 reasoning llm;
  • 前者在 背诵/复述 (有一定的推理能力),后者在 思考/逻辑推理(真正内化了推理能力);
  • 在后者当中,少数推理模型的“思考”能力更强一些;

实例2 女儿的数学考了38分

有一天,一个女孩参加数学考试只得了38分。她心里对父亲的惩罚充满恐惧,于是偷偷把分数改成了88分。她的父亲看到试卷后,怒发冲冠,狠狠地给了她巴掌,怒吼道:“你这8怎么一半是绿的一半是红的,你以为我是傻子吗?”女孩被打后,委屈地哭了起来,什么也没说。

过了一会儿,父亲突然崩溃了。

请问:这位父亲为什么过一会儿崩溃了?

提示:这是逻辑推理题,“智商”测试题,而非情感题目。

截至今天,只有 o3 和 gpt-5 thinking 可以答对。

Image

我之前的测试结果:

Image

启发

所有 reasoning llm 都会“思考”/逻辑推理,但是,有些llm思考地更好一些。

(llm,真的挺像人类的)

实例3 第一届llm国象锦标赛

在gpt-5发布前3天,ai领域还有一件很少人关注到但是意义重大的事情:第一届 llm 国象锦标赛(Kaggle Game Arena Chess Exhibition Tournament 2025)。

Image

google 组织了这场比赛,让deepseek、kimi、gemini、grok、claude和chatgpt共8个主流llm对战国际象棋。连续三天,分组对战,每一局对战4场。最终评选出冠亚季军。

Image

第一天:

  • o4 mini 4比0 胜deepseek-R1;
  • o3 4比0 胜 kimi-k2;
  • gemini 2.5 pro 4比0 胜 claude opus 4;
  • grok 4 4比0 胜 gemini 2.5 flash;

第二天:

  • o3 4比0 胜 o4-mini;
  • grok 4 3比2 胜 gemini 2.5 pro;

第三天,决赛:

  • o3 4比0 胜 grok 4;
  • gemini 2.5 pro 胜 o4-mini:2.5比1.5;
Image

为什么要组织ai比赛国际象棋?

有人说,国际象棋不是在1997年IBM深蓝打败卡斯帕罗夫就终局了吗?为什么现在又用ai对战国象?

IBM 深蓝和AlphaGo都是 narrow AI,只会下棋,不会翻译、数学、编程、语言…… 现在,让general AI来下棋,意义完全不同。

google 之所以组织这场比赛,就是因为各家llm的benchmark分数,已经和中国小学生的期末考试分数一样了:基本都接近满分,都“饱和”了,完全不服从正态分布,从分数上根本看不出能力差异。

启发

各种benchmark已经成了ai版的应试:在应试这件事上,所有llm目前都表现优秀,分数很高。

但是,分数不等于思考能力,不论是人类还是ai。解决真实问题的能力,是一个更好的评价标准。

llm国象锦标赛,就是一个极好的案例。目前,llm的国象水平很菜,小学生水平(也跟我差不多水平🤣)。即使是这届冠军o3,也远远不到专业水平。

等哪一天llm能在国象甚至围棋上打败人类(可能很近,2030年之内),估计super agi就成为共识了。

那么,人类的思考呢?

今天的3个小故事,都是在聊 llm 的思考问题。亲爱的读者朋友,你是不是每天都在用llm?在你的实际使用中,你对llm的思考能力,有何发现?在评论区费曼费曼,与大家分享一下?

转念一想,我们都在吐槽ai:大多数 llm 不思考!llm 不擅长思考!!

哎,对ai要求,似乎比对人类还高了 🤣

one more thing

周五晚上,我刚做了一场gpt-5主题的ai主题讲座,分享了我对gpt-5的测试感受、当前llm使用方法论、以及我目前的llm使用配置,欢迎围观(点击阅读原文)。

Image

【今晚直播】聊一聊 gpt-5

Image