收获不止数据库

大白话秒懂五论文—AI大模型思维链的进化揭秘

摘要

为什么AI会算错简单数学题?秘密就藏在"思维链"里!本文用轻松对话形式解读五篇论文,让你秒懂让AI变身"超级大脑"的黑科技:

1️⃣ 手把手教:让AI 在答题前先看范例,正确率即可从18% 飙至57%!

2️⃣ 咒语觉醒:仅凭一句 Let's think step by step ,AI立刻聪明3倍!

3️⃣ 双剑合璧:两招一起用,AI性能暴涨,复杂测试反超人类平均水平!

4️⃣群体智慧:让AI生成多个思维链,用多数投票机制,性能再提18%!

5️⃣ 自我进化:生成“题-思维链-答案”合成数据,自我训练,永无上限!

DeepSeek-R1的核心思想源于这些论文的贡献。更为难得的是,这五篇论文皆符合三个特性:1. 较为浅显;2.极为重要;3.易于落地。这实属罕见,不容错过!

Image

1

手把手教(Few-shot-CoT) 

彬老师
Image
今天我们来探讨大模型的思维链。说到思维链则不得不提起Jason Wei的《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,该论文奠定了“思维链”技术的基础Image。
Image
哪吒2.jpg
小渣
Jason Wei?是不是先在Google,后去OpenAI的那位天才?Image
彬老师
Image
对,他在OpenAI负责O1和深度研究工作。实际上,OpenAI的O1、O3推理模型以及DeepSeek-R1的核心思想,都可以追溯到他的这些早期贡献Image。
弘棋.jpg
弘老师

Jason Wei 的方法简单有效。就是在问模型问题的同时,附上示范问题、示范答案及示范答案的思考过程。这样模型有样学样,就能回答的更好了。这里需要注意的是,仅给示范问题的答案而不给思考过程,效果会很差。

比如论文中给模型一个问题"罗杰有5个网球,他又买了2罐,每罐有3个网球,他现在有多少个网球?",如果只告诉它答案是11,而未解释原因,模型是无法做到举一反三的。

Image
弘棋.jpg
弘老师
我们让模型回答新问题"食堂有23个苹果,用了20个做午饭,又买了6个,现在还有多少个苹果?"时,模型给出答案为27。
Image
小渣

23-20+6=9,模型居然做错了如此简单的数学Image。

彬老师
Image

如果之前的示范并非单纯告诉它答案是11,而是这样教它:“罗杰一开始就有5个球,而罗杰又买了2罐,每罐3个网球,这里就有6个网球,所以答案是5+6=11。”  它就明白了,回答新题就不会犯这种低级错误了。

弘棋.jpg
弘老师
是的,有了这种思维过程的示范,模型在回答新问题时,也会自然而然地展现出类似的思考路径——自助餐厅有23个苹果,用20个苹果做了午餐,剩23-20=3个苹果,又买了6个苹果,所以现在有3+6=9个苹果。
Image
大饼
哇!就好像我们小时候学数学,老师不仅告诉我们答案,更重要的是教我们解题思路!
彬老师
Image

是的,Jason Wei把这种方法称为Few-shot Chain-of-Thought,简称Few-shot-CoT。论文中该方法将模型性能从18%提升到57%,效果惊人。

Image
Image
小渣
也就是说,模型其实已经"学会"了思考,只是需要我们给它一个示范,告诉它"该怎么思考"?
彬老师
Image

正是如此。这个发现彻底改变了我们对大模型能力的认识。不过,这种方法也有局限性,人工设计示例对每个问题都写思考引导,有些麻烦。

弘棋.jpg
弘老师
是的,这就引出了我们今天要探讨下一个关键内容,一起来看看第二篇论文。

2

咒语觉醒(Zero-shot-CoT)

彬老师
Image
弘老师说的第二篇论文,是指来自Google的《Large Language Models are Zero-Shot Reasoners》,该论文提出了更简洁的方法。
弘棋.jpg
弘老师
他们发现,只要在问题后面加一句简单的"咒语" 即可。
Image
Image
大饼

什么咒语?

弘棋.jpg
弘老师

Let's think step by step。

Image
大饼

这么一句话,就能让模型变厉害了?

彬老师
Image
是的。因为它不需要任何示例,却能激发模型产生完整的思维链,因此这种方法被称为Zero-shot-CoT。
弘棋.jpg
弘老师

看看论文中的例子:一个杂耍演员可以同时抛接16个球。一半的球是高尔夫球,一半的高尔夫球是蓝色的,有多少个蓝色的高尔夫球? 

Image
小渣

一半是高尔夫球,意味着有8个高尔夫球,再一半是蓝色的,所以是4个蓝色高尔夫球。

彬老师
Image
没错,请看论文的下图试验。
Image
彬老师
Image
直接问模型这个问题,它给出错误答案8。但如果在问题后面加上"Let's think step by step"这句话,模型就会给出一系列推理步骤:1. 杂耍演员有16个球;2. 一半是高尔夫球,所以有16/2=8个高尔夫球;3. 一半的高尔夫球是蓝色的;3.所以有8/2=4个蓝色高尔夫球。最终答案是4个。
Image
大饼

就像开启了某种隐藏模式一样!

弘棋.jpg
弘老师

实验数据更加惊人。在GSM8K数据集上,仅仅添加这个简单提示,模型性能从10.4%直接飙升至40.7%,提升近四倍!如下图所示。

Image
Image
小渣

这太神奇了!为什么简单的一句提示词能产生这么大的影响?

彬老师
Image
大模型在预训练过程中已经"学习"了思考的能力,但需要特定的触发条件来激活这种能力。"Let's think step by step"就像一把钥匙,打开了模型内部的推理机制。不过,从数据看,Zero-shot-CoT(40.7%)的表现还是不如Few-shot-CoT(57%),是不是觉得有些遗憾?
Image
弘棋.jpg
弘老师
哈,彬老师卖了个关子,他马上要提到第三篇论文了。

3

双剑合璧(Few-shot-CoT × Zero-shot-CoT)
彬老师
Image
还是Jason Wei他们,在《Large Challenging BIG-Bench tasks and whether chain-of-thought can solve them》论文中,尝试了一个看似简单却极为有效的组合,即同时使用Few-shot-CoT和Zero-shot-CoT。
Image
弘棋.jpg
弘老师
简单来说,就是既提供详细的思考示例,又在最后加上 Let's think step by step 的提示。
Image
小渣

两种方法优势叠加,效果会更好吧?

弘棋.jpg
弘老师
确实如此。论文中测试了一个时间推理问题:"今天,蒂芙尼去海滩了。他们可能在什么时间去的?" 如下图所示。
Image
弘棋.jpg
弘老师
首先,提供一个详细的示例,展示如何分析一个人的一天行程,从早上5点起床到最终得出"下午3点到4点去合适,答案为D"的完整推理。然后,在新问题后加上"Let's think step by step"。
彬老师
Image
这种双重加持下,模型对新问题"今天,汉娜去了足球场。他们可能在什么时间去的?"的回答变得异常清晰:详细分析汉娜一天的时间安排,最终准确推断出"汉娜唯一可以去足球场的时间是下午5点到6点,所以答案是(C)"。
Image
大饼
这些方法在简单问题上效果好,那对于复杂任务呢?
弘棋.jpg
弘老师
研究者们在Big-Bench Hard数据集上进行了测试,这是从Big-Bench中精选的23个极具挑战性的任务。结果令人震惊,传统方法在大多数任务上表现不如人类平均水平,但使用CoT后,模型在大部分任务上不仅大幅提升,超越了人类平均表现!
Image
Image
小渣

看似简单的调整,效果居然这么好?

彬老师
Image
更有趣的是,研究发现CoT能力与模型规模密切相关——随着模型参数增加,使用CoT的性能提升幅度远大于不使用CoT的情况,呈现出典型的能力"涌现"特征。
Image
Image
大饼
听起来,有些不可思议!Image
弘棋.jpg
弘老师
是的,这一系列研究确实改变了我们对模型能力的理解。不过,这些方法本质上都属于提示工程,不改变模型本身。接下来我们要把研究目标转向改变模型本身的领域了,一起看看第四篇论文。

4

群体智慧(Self Consistency)

彬老师
Image
Google的《SELF-CONSISTENCY IMPROVES CHAIN OF THOUGHT REASONING IN LANGUAGE MODELS》论文,就提出利用大模型的多样性生成能力,来提高推理准确性的巧妙思路。
Image
Image
大饼
多样性生成能力?Image
弘棋.jpg
弘老师
我们知道,大语言模型是生成式模型,对同一个问题可以产生多种不同的回答。研究者想到,何不让模型生成多个思维链,然后从中选出最佳答案?
Image
小渣

有点像投票系统?

弘棋.jpg
弘老师
正是如此!对同一个问题,使用CoT方法让模型生成多条不同的推理路径,每条路径都会得出一个答案。然后采用"多数投票"机制——如果多个答案中有两个是18,一个是16,那么最终选择的答案就是18,如下图所示。
Image
Image
大饼
这有点像集体决策了,利用"群体智慧"来提高准确率。
弘棋.jpg
弘老师
是的,实验结果也证明了这一点:在GSM8K数据集上,这种方法将模型性能从56.5%提升到74.4%,提高了近20个百分点。
Image
Image
小渣

生成的答案越多,投票基础就越大,准确率就会更高?

彬老师
Image
确实如此。研究发现,随着备选答案数量从1个增加到40个,模型性能持续提升。这与社会科学中的"集体智慧"理论非常吻合:样本越多,通过投票机制筛选出的结果越可能接近真相。
Image
Image
大饼
这太有意思了!不过,所有这些方法似乎都是在使用模型时的技巧,那能不能让模型自己学会产生更好的思维链呢?
弘棋.jpg
弘老师
哈哈,好问题,接下来第五篇论文会让你豁然开朗的。

5

自我进化(Self Improvement)

彬老师
Image
是的,论文《LARGE LANGUAGE MODELS CAN SELF-IMPROVE》可以回答大饼的疑问,该论文探索了如何让模型在训练过程中自己产生并优化思维链能力。
Image
弘棋.jpg
弘老师
这项研究的核心思想是"自举"(bootstrapping)——让模型从自己生成的高质量思维链中学习。
Image
小渣

这听起来有点像"自学成才"?

弘棋.jpg
弘老师

是的,具体过程是这样的:

1. 给模型提供一些人工设计的CoT示例;

2. 利用Self-Consistency方法让模型针对新问题生成多种思维链和答案;

3. 通过多数投票选出最可能正确的答案和对应的思维链;

4. 将这些高质量的"问题-思维链-答案"组合成新训练数据;

5. 用这些数据进一步训练(fine-tuning)模型。

如下图所示。

Image
Image
小渣

这意味着我们不需要大量人工标注的思维链数据,模型可以自己产生这些训练数据?

彬老师
Image
正是如此,这大大降低了对人工标注的依赖,为模型自主学习复杂推理能力开辟了新途径。

Image
大饼
如果不断重复这个过程,模型的推理能力是不是可以无限提升?
弘棋.jpg
弘老师

只是如此简单重复,还是有上限的。不过,提升大模型推理能力的手段还有许许多多,远不止今天探讨的这几篇思维链相关的论文,推理能力的爆发才刚刚开始。未来,像Jason Wei这样的做出杰出贡献的人工智能科学家会越来越多,未来可期!

jason wei.jpg
Jason Wei

各位兄弟抬举我Jason Wei了,亿点点心意,聊表谢意Image。

所有看到 《CoT五论文解读—AI大模型思维链的进化揭秘与实践》的人,你们一定发大财!Image

Image
 你领取了Jason Wei 的
红包 
彬老师
Image
谢谢Jason Wei!咱们做个小小的总结吧,如下图所示。此外本次探讨的很多内容是非常实用落地的,希望读者能好好的去学习体会。今天就交流到这里,咱们下次再聊。
Image
{本期互动} 个人能力及提示词技巧,决定了大模型输出质量的高低,请分享你的使用心得。
在评论区留下你的宝贵观点,截至3月18日(含),留言且留言处点赞数前三,IF CLUB社区赠精美水杯。
Image
更多精彩原创内容见公众号
    点关注   Image  不迷路
往期回顾,欢迎留言与转发