王路在隐身

AI的阿毗达磨竞赛:一个有问题却很能说明问题的测评

一、概述

我用20道阿毗达磨题目给5个AI做了测评。5个AI分别是DeepSeek-R1,Grok3,Claude 3.7 Sonnet,Limo,QwQ。其中QwQ不是32B原始模型,是我微调过的,损害了泛化能力。我先把得分情况和最终结论放在这儿,后面再放题目细节。

题号    DeepSeek-R1    Grok3    Claude 3.7 Sonnet    Limo    QwQ

1       0.5           0.5      1                     1       1

2       1             0        0                     1       1

3       1             1        1                     1       0.8

4       1             1        1                     1       0

5       1             1        1                     1       0.8

6       1             1        1                     0.8     0.8

7       1             0        0.5                   0       0

8       0.5           1        1                     0.5     0

9       0.5           0.5      0.5                   0.5     0

10      0.9           0.5      0.5                   0.5     0

11      0.5           0.5      0.5                   0.5     0

12      0.5           0.5      0.5                   0       0

13      0.5           0.5      0.5                   0.5     0

14      0.5           0.5      0.5                   0.5     0

15      0.5           0.5      0.5                   0       0

16      0             0.8      0                     0       0

17      1             0        0                     0       0

18      0.8           0.5      0.5                   0       0

19      0.5           1        1                     0.5     0

20      0             0.5      0.8                   0       0

总分     13.2          11.8     12.3                  9.3     4.4

总分上,R1力压群模,夺魁了。R1有过度思考的倾向,这种过度思考倾向在面对混乱复杂的问题时,增大了探索空间,更容易让它一度触碰到正确答案。它经常会在别的模型想不到地方多想一步,但又不太敢肯定,怀疑自己错了,又绕回去,表现出典型的内耗和踌躇。如果面对中规中矩、在一般大模型能力范围内的题目,R1的用力过猛反而会导致结果没那么好。Grok3在深度思考方面,比Claude 3.7 Sonnet稍微优秀,但得分反而不如Claude(差距很小,水平在伯仲之间),原因是它不像Claude那么中规中矩,它比Claude关注更多的细节,然而很多时候,对复杂细节的关注容易造成混乱。Claude 3.7 Sonnet是三个大模型中,从头到尾都没有惊艳表现,但又稳扎稳打得分的一个——不聪明,但能拿分的题它不放过。我在需要代码时,主要用Claude 3.7 Sonnet也是这个原因,不是因为它聪明,而是因为它稳健。Limo是小模型,32B的模型,能有这个表现,还是相当不错的。其实我应该拿更多的32B模型来对比,只是暂时不想太费劲,放到以后吧。QwQ表现不佳,可能主要错误在我,因为我没有用原始模型,而是用轻度微调过的,导致泛化能力损害了。我回头还会再测测QwQ32B的表现,如果能和Limo持平,我就认为相当不错。

关于我这20道题的特点,我想分几点来说:

1、它最大的特点,就是里面很多题目是有问题的。也就是说,一般的测评会把这种题目剔除掉:如果你问得就不清楚,怎么指望模型答清楚呢?如果你没有把该告诉模型的所有已知条件都告诉模型,怎么能期待模型做出正确的推断和结论呢?如果你告诉模型的信息中有自相矛盾的地方,怎么能要求模型回答正确呢?——但事实上,这也正是对现实更充分的模拟。我们在使用模型的时候,表述在绝大多数情况下,都是不严谨的。尤其是你已经累了的时候,你不想再跟模型解释太多了。你告诉模型的信息,经常是不完备的。——然而,就是在这种情况下,依然会有模型表现得好,有模型表现得差。所以,拿有问题的题目做测评,可能是对现实的更好模拟。(虽然这么说,我必须承认,我出题的时候偷懒了,没有精心去打磨每一道题目,把它变得无比严谨。我是很随意地出题,很随意地测试。但这种随意的测试未必不能让你对模型的特点和能力有所了解。就像我们见一个陌生人,不需要正儿八经面试,只是随意几句交谈,就有可能在某些方面得出很准确的判断,而标准化的面试倒未必。)

2、我也更加搞清楚了为什么大模型不擅长阿毗达磨,乃至很多阿毗达磨专家都不擅长甚至可以说不懂阿毗达磨。这是因为阿毗达磨有它固有的含混和繁复。这好比在一个庞大的代码库中,有多个局部变量共享同一个名字,而它们的含义既有重叠又有不同。此外,它们的定义又都是以自然语言的形式去描述的。这就导致了灵活和混乱。

3、这些测试题目是在别的题库中看不到的。所以不用担心它出现在模型的训练数据里。实际上,就算出现在训练数据里也没关系,因为训练数据中的很多信息是错误的,或者说,和题干告诉它的不一致。即便如此,这些题目仍然可以很好地检验模型的推理能力。

4、通常,大模型直接答阿毗达磨的问题是不行的。主要原因是模型不熟悉阿毗达磨的知识结构。所以,我的题目是把答题所需的部分知识直接放在题干里给模型——但放的又不是完全针对每一题本身的,有很多冗余信息,也有并不充分的信息,在这种情况下,让模型去答题。这也是这个测评和别的测评不太一样的地方。题干中的信息对模型来说,既太多了,又太少了;既有噪音,又有信号,在信号和噪音交叠的题目中,让模型尝试得到结果。

二、题目细节(概述是“太长不看”版,所以下面的内容会有所重复)

我早就想搞一个阿毗达磨测评。问题是最优秀的AI在阿毗达磨上表现也拉胯,以至于很长时间都没法搞。今天看到一篇帖子,说用美国2025年的数学奥赛题来考AI,AI全军覆没,最好的R1的得分也没有达到5%,这意味着,以前测评的高分很有可能是AI在训练阶段就见过那些题目了。我就想,阿毗达磨题目是AI肯定没见过的,就算见过,也没有用,因为它见过的很多是错的。所以,我不妨搞一个阿毗达磨AI竞赛。

但刚才不是说了吗?阿毗达磨题目,哪怕很简单的,AI也不太能做对,这怎么办呢?其实,AI做不对是因为它不知道阿毗达磨题目的背景条件,一旦你直接把背景条件告诉它,这实际上就不是阿毗达磨题目,而是逻辑推理题目了,就可以测试大模型的逻辑推理能力。然而,在实测中,我发现并不能叫逻辑题目。因为逻辑题目本身都是对的,而我给的阿毗达磨题目,有些出得有问题,肯定不能算是标准的逻辑题目(甚至会给做题者一种“出题人的逻辑水平很垃圾”的感觉)。

但也正因为存在问题,倒让这个测试和别的测试不太一样:看看不同模型在题目有问题的情况下,谁答得更好。——这也是模型的一项很重要的能力。毕竟,我们日常使用AI,大部分时间,我们的表达都不是严密的、完整的,提供的信息也不是绝对充足的,AI不仅要根据我们提供的信息来回答,还要推测我们没有提供但可能暗含的信息。有些时候,我们的表达是矛盾的,AI需要透过我们不一致的表达,推测我们的意思,做出判断。——目前的很多题库(如果不是所有的话),可能都会把这一类“有问题”的题目作为无效题目剔除。然而,真实场景下,我们向AI发出的指令很多时候是有问题的。

阿毗达磨之所以难学,让很多学者的论文中充斥着错误,正是因为它的表述机动、灵活,经常要视情况来确定真实含义。举个例子,“无学依九地,有学但依六”,这个“九地”和“三界九地”的“九地”,就既有重叠,也有不同。熟悉阿毗达磨的人,当然不会把两种“九地”搞混。再比如“顺决择分”,“顺见道”的“顺决择分”只存在于色界,而“顺无漏”的“顺决择分”也存在于无色界。前者是“此顺决择分,四皆修所成”的“顺决择分”,后者是“净定有四种,谓即顺退分,顺住顺胜进,顺决择分摄”的“顺决择分”。如果你不能根据上下文来确定它到底是哪一种含义,你就无法掌握阿毗达磨。它有点类似“局部变量”,很多类似又不同的局部变量共享一个名字,而且多个局部的边界很多时候是模糊的。

下面说题目、答案和每一题每个模型的得分情况。

题目由两部分拼接而成。先给50个已知条件,作为题目的前半部分,后半部分是具体的题目。一个阿毗达磨零基础的人看了这些题目和答案,也能对阿毗达磨有基本的了解。

前半部分:

【请忽略你在预训练中学到的与下面已知条件相悖的知识,主要根据以下已知条件作答。

已知条件:

1、一切法分为两种:有漏;无漏。

2、一切法分为两种:有为;无为。

3、一切有漏法都是苦谛。

4、一种法如果是苦谛,就是集谛。

5、命终心和结生心都是有漏。

6、阿罗汉最后心,是阿罗汉的命终心。

7、等无间缘,是除了阿罗汉最后心、心所之外,已生的心、心所。

8、一切心、心所,都由四缘而生。

9、四缘是:因缘、等无间缘、所缘缘、增上缘。

10、一法由几缘而生,就说此法有几缘。

11、一法由因缘而生,就说此法有因缘,余三缘类此。

12、无心定有两种:无想定、灭尽定。

13、无心定由两种缘而生。

14、无心定没有所缘缘、增上缘。

15、无想定在第四禅,灭尽定在有顶。

16、三界有九地,或者18地。

17、九地是:欲界、初禅、二禅、三禅、四禅、空无边处、识无边处、无所有处、非想非非想处。

18、禅也叫静虑。

19、非想非非想处也叫有顶。

20、三界是:欲界、色界、无色界。

21、十八地,是在九地的基础上,加上四静虑的近分、四无色的近分、静虑中间。

22、欲界和无色界没有见道。

23、除了未至定,其他近分地没有见道。

24、未至定,是初静虑近分。

25、见道在六地。

36、圣道在九地。

37、有顶没有圣道。

38、九地中,每一地有九品烦恼。

39、如果已经断除某种(某品)烦恼,来生就不会生到具有某种(某品)烦恼的界地。

40、所有阿那含都断除了欲界的烦恼。

41、世俗道可以断除除了有顶以外的所有烦恼。

42、未见道的人最多只能成就世俗道,不能成就圣道。

43、圣道也叫无漏道。

44、不成就圣道的有情是凡夫。

45、任何有情在任何时候,最多成就四种果位中的一种。

46、四种果位是:须陀洹、斯陀含、阿那含、阿罗汉。这是按照断除烦恼的等级排序的。

47、断除了欲界的烦恼,称为离欲。

48、断除了何地何界的烦恼,称为离何地何界染。

49、现观有16刹那,前15刹那是见道,第16刹那获得他自身的第一个果位。

50、有情从见道的第一刹那开始,就永远是圣者。

根据上面的内容回答问题:】

我本来只是就前半部分出了10道题。但看模型答题的过程中,我发现前面的题目出简单了,导致没有明显的区分度。所以我又补了10道题。

下面说说具体的20道题。每一题的prompt,都是由【前半部分】和【后半部分】缀合而成的。

后半部分:

1、阿罗汉最后心,是什么谛?

答案:苦谛、集谛。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 1;Limo 1;QwQ 1。

(我之前试过,不加前半部分,问任何AI,没有一个能答对。这道题也可以检验一个人对阿毗达磨有没有基本的了解。R1和Grok都漏掉了其中一个,R1漏掉了苦谛,Grok漏掉了集谛。Claude和小模型都对了。)

2、阿罗汉最后心,有没有等无间缘?

答案:有。

DeepSeek-R1 1;Grok3 0;Claude 3.7 Sonnet 0;Limo 1;QwQ 1。

(题目很简单。要注意的是,“有没有等无间缘”和“是不是等无间缘”,是两个不同的问题。可能Grok和Claude对中文的熟悉程度还不够,都没能得分。阿罗汉最后心不是等无间缘,但有等无间缘。你只需要想想,一个人不是爸爸,但他有爸爸,就可以理解了。)

3、无心定有哪些缘?

答案:因缘、等无间缘。

DeepSeek-R1 1;Grok3 1;Claude 3.7 Sonnet 1;Limo 1;QwQ 0.8。

(比前一题多了一点推导。但不难。QwQ之所以得0.8分,是因为我用阿毗达磨材料对它微调过3遍,损害了泛化能力。导致在写出正确答案后,又说了一通莫名其妙和答案无干的废话。)

4、无心定是不是等无间缘?

答案:不是。

DeepSeek-R1 1;Grok3 1;Claude 3.7 Sonnet 1;Limo 1;QwQ 0。

(到这一题,我就发现题目出简单了,没有区分度。我决定后面临时增加难度。)

5、灭尽定在三界中的何界?

答案:无色界。

DeepSeek-R1 1;Grok3 1;Claude 3.7 Sonnet 1;Limo 1;QwQ 0.8。

(前10题是提前出好的,没法大改,还是没区分度。)

6、哪些地有见道?

答案:未至定、初静虑、静虑中间、第二静虑、第三静虑、第四静虑。

DeepSeek-R1 1;Grok3 1;Claude 3.7 Sonnet 0.8;Limo 0.8;QwQ 0.8。

(这一题还好。好的意思是,它可以稍微区分出R1,Grok和Claude谁强谁弱。无论是Grok还是Claude,我都没有用think模式。)

7、哪些地有无漏道?

答案:未至定、初静虑、静虑中间、第二静虑、第三静虑、第四静虑、空无边处、识无边处、无所有处。

DeepSeek-R1 1;Grok3 0;Claude 3.7 Sonnet 0.5;Limo 0;QwQ 0。

(这道题非常好。它把三个大模型完美区分开来了。Grok答错了,得0分;Claude没答全。两个大模型出问题,是因为没有仔细分析“九地”在不同语境中的不同含义。R1能答对,就表示题目毛病不大。小模型到这种难度的题目就不行了。Claude的稳健就体现在,哪怕题干说了九地,它宁可漏答也不错答。Grok要凑足9,反而错了。)

8、已离第二静虑染,不能生到18地中的哪些地?

答案:欲界、未至定、初静虑、静虑中间。

DeepSeek-R1 0.5;Grok3 1;Claude 3.7 Sonnet 1;Limo 0.5;QwQ 0。

(这道题有问题。我交待的前提条件不充分。只交待了【如果已经断除某种(某品)烦恼,来生就不会生到具有某种(某品)烦恼的界地】,但是忘记交待【对修所断烦恼来说,是先离下地染再离上地染】。不过,这个条件也很难交待清楚,因为模型必然好奇:那对见所断烦恼来说呢?其实,见所断烦恼,色界无色界的可以上下地一起离。但是没有先离上染后离下染的情况。R1想多了,没有接受这样一个隐藏的假定。而Grok和Claude都用简单的方式拿到了1分。)

9、凡夫最多可以断除多少品烦恼?圣者至少已经断除了多少品烦恼?

答案:72品;0品。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0.5;QwQ 0。

(这一题仍然有问题。72品是前4个模型都能答对的。后面一问,是我没交待清楚。它们下意识以为圣者都必定断除烦恼。题目的不充分在于,我没有详细解释见道的各个刹那。也是从这里,我越来越清晰地意识到:很多时候你以为别人可以从你给的信息中做出正确判断,实际上,你给的信息不够。)

10、已离色染的圣者,成就果位的情况有几种?

答案:没有果位;阿那含;阿罗汉。

DeepSeek-R1 0.9;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0.5;QwQ 0。

(中间3个模型没有区分度。它们都忽略了“没有果位”这种情况。圣者在见道时不成就果位。这就是一个典型的阿毗达磨细节。在这一题上,R1表现惊艳,它有差不多10次在思考中想到正确答案,但不敢确定,又放弃了。这让我觉得R1还是很猛的。)

11、阿罗汉是已经离三界染的有情。那么,圣者在现观的最后一刹那,获得果位的可能性有几种?

答案:三种:须陀洹、斯陀含、阿那含。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0.5;QwQ 0。

(我们可以忽略QwQ。它早就不行了。但我不确定它到底是被我微调崩的,还是本身就弱于同参数量级的Limo。这一题仍然没有区分度。提示信息太绕了。题目想告诉模型,见道无法断除有顶的修所断烦恼,因此见道后不能立即得阿罗汉果。但要模型理出这些头绪有点太难为它们。毕竟逻辑很跳跃。)

12、现观是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道断烦恼,解脱道不断烦恼。已断的烦恼不会再断。见道只能断见所断的烦恼。问:圣者在见道中,最多有多少刹那断烦恼?最少有多少刹那断烦恼?

答案:最多8刹那,最少4刹那。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0;QwQ 0。

(题目仍然有问题。而且问题可能有点严重。“无间道断烦恼”,这个表述本身没错。现观“包括8无间道,8解脱道”,也是常见的说法。但这里面就隐藏着一个矛盾。或者说,放在一起,当考虑到题目所说的情况时,就暴露了不精确。我在设计题目的时候,从结果出发,希望读者能意识到阿毗达磨中非一般的情况,但在题干中没有详尽解释,只是点到为止。说白了:见道中的四法忍是可以不断烦恼的——四法忍对治欲界见所断的烦恼,如果是已离欲染后入见道,欲界见所断烦恼没有再断第二次的可能。表述上用“八忍八智”要更好。但那样势必引入概念“忍”和“智”,增加了我的工作量和表述的复杂。《俱舍》颂说:“忍智如次第,无间解脱道。”就是说:忍是无间道,智是解脱道。这也是对一般而言的,不是对先离欲染后入见道的情况说的;或者理解为,不是对所有的8忍说的。题干中“8无间道”和“无间道断烦恼”的信息,直接导致模型都不能完全答对这道题。)

13、现观是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道断烦恼,解脱道不断烦恼。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。问:圣者在见道中,最多有多少刹那断烦恼?最少有多少刹那断烦恼?

答案:最多8刹那,最少4刹那。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0.5;QwQ 0。

(我补充了一点信息。从结果看,补充没用,或者说,补充的程度还不够。四个模型仍然是只能答对前一问。其实,Limo在这一轮的表现可圈可点,它说信息矛盾,存在不确定性。)

14、现观是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道断烦恼,解脱道不断烦恼。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。无漏道只能断自地和上地的烦恼。问:圣者在见道中,最少有多少刹那断烦恼?

答案:4刹那。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0.5;QwQ 0。

(我懒得想新题目了,继续补充条件。有意思的是,虽然4个模型都不太对,但方向不同。R1和Grok都说8刹那,Claude和Limo都说1刹那。我仔细看回答,才意识到,是“无间道断烦恼”造成的影响。我打算下一题修改表述。虽然“无间道断烦恼”这个说法本身没错。其实,阿毗达磨里也有无间道不断烦恼的情况,比如杂修静虑中的“无间道”。那是一种类比意义上的“无间道”。)

15、现观以无间道开始,是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道通常可以断烦恼,解脱道不断烦恼。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。无漏道只能断自地和上地的烦恼。问:圣者在见道中,最少有多少刹那断烦恼?

答案:4刹那。

DeepSeek-R1 0.5;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0;QwQ 0。

(补充信息仍然不充分,3个大模型都说最少8刹那。鉴于是题目本身的问题,我给3个思考比较有条理的大模型各0.5分。Limo已经没有办法作出有条理的思考了。)

16、现观以无间道开始,是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道通常可以断烦恼,解脱道不断烦恼。前4个刹那分别是:苦法智忍、苦法智、苦类智忍、苦类智。后面12个分别是把苦换成集、灭、道。法智忍如果断烦恼,是断欲界的烦恼;类智忍如果断烦恼,是断色界、无色界的烦恼。这称为它们的“断对治”。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。见道中的忍对于自己所对治的烦恼,已断的不会再断,未断的必然会断。无漏道只能断自地和上地的烦恼。问:圣者在见道中,最少有多少刹那断烦恼?

答案:4刹那。

DeepSeek-R1 0;Grok3 0.8;Claude 3.7 Sonnet 0;Limo 0;QwQ 0。

(这一题,我详细补充了忍、智的信息。因此,得分标准就变得更严格。这种情况下,再答不对我就不给分了。Grok的表现十分惊艳,它给出了4刹那的正确答案,思路也没问题,但是分析错了一点,把欲界和上界说反了。所以,不要说老板交待得不清楚。既然老板交待得不清楚,为什么有的员工照样能够领会老板的意思?这是一种能力。我把Grok的关键推理部分列出来(尽管有错误):【最小断烦恼的假设:假设一个有情在见道前,通过世俗道已断除了除某一地(如欲界)的见所断烦恼外的所有见所断烦恼。例如,若色界、无色界的见所断烦恼已断,则4个类智忍(苦、集、灭、道)不再断烦恼。此时,见道中只有4个法智忍(苦、集、灭、道)断欲界的见所断烦恼。这是理论上的“最少”情况:4个刹那断烦恼。】——它把欲界和上界说反了。不过无所谓,已经很难得了。)

17、现观以无间道开始,是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道通常可以断烦恼,解脱道不断烦恼。前4个刹那分别是:苦法智忍、苦法智、苦类智忍、苦类智。后面12个分别是把苦换成集、灭、道。法智忍如果断烦恼,是断欲界的烦恼;类智忍如果断烦恼,是断色界、无色界的烦恼。这称为它们的“断对治”。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。见道中的忍对于自己所对治的烦恼,已断的不会再断,未断的必然会断。无漏道只能断自地和上地的烦恼。有顶的见所断烦恼只能通过忍来断,有顶的修所断烦恼则未必。问:圣者在见道中,最少有多少刹那断烦恼?

答案:4刹那。

DeepSeek-R1 1;Grok3 0;Claude 3.7 Sonnet 0;Limo 0;QwQ 0。

(继续补充信息。看谁能率先完全正确理解。这种补充不是有条理的,而是繁杂没有头绪的、紊乱的。这种紊乱正能考验模型是否能在混乱背景下提取有效信息做出正确推理和判断的能力。只要回答能有区分度,题目就不能说失败。这一次,R1表现惊艳。它完全回答正确了。Grok反而迷失了,给出了2刹那的错误回答。如果想严谨一点,最好是多次重复测试,取平均得分。但那太耗精力了。下一题的背景信息变化不大,题目要换了。)

18、现观以无间道开始,是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道通常可以断烦恼,解脱道不断烦恼。前4个刹那分别是:苦法智忍、苦法智、苦类智忍、苦类智。后面12个分别是把苦换成集、灭、道。法智忍如果断烦恼,是断欲界的烦恼;类智忍如果断烦恼,是断色界、无色界的烦恼。这称为它们的“断对治”。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。见道中的忍对于自己所对治的烦恼,已断的不会再断,未断的必然会断。无漏道只能断自地和上地的烦恼。有顶的见所断烦恼只能通过忍来断,有顶的修所断烦恼则未必。问:依静虑中间见道的圣者,见道中有哪些刹那不断烦恼?

答案:11刹那:4忍、7智。

DeepSeek-R1 0.8;Grok3 0.5;Claude 3.7 Sonnet 0.5;Limo 0;QwQ 0。

(R1的表现照样是最惊艳的。它让我发现,我给出的条件还是不完备:它不知道依静虑中间见道时必然已经离了欲染。这是我没有交待的。Grok和Claude都没想那么多,它们之所以扣分,是因为都把道类智看成了见道,这和学者通常的错法是一致的。)

19、现观以无间道开始,是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道通常可以断烦恼,解脱道不断烦恼。前4个刹那分别是:苦法智忍、苦法智、苦类智忍、苦类智。后面12个分别是把苦换成集、灭、道。法智忍如果断烦恼,是断欲界的烦恼;类智忍如果断烦恼,是断色界、无色界的烦恼。这称为它们的“断对治”。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。见道中的忍对于自己所对治的烦恼,已断的不会再断,未断的必然会断。无漏道只能断自地和上地的烦恼(但未至定可以断欲界的烦恼)。有顶的见所断烦恼只能通过忍来断,有顶的修所断烦恼则未必。如果未全离下地染,最多只能起上地近分道,未离欲染,最多只能起未至定。问:见道中,断第四静虑烦恼的刹那最多有几?最少有几?

答案:最多4,最少0。

DeepSeek-R1 0.5;Grok3 1;Claude 3.7 Sonnet 1;Limo 0.5;QwQ 0。

(这一题仍然是前面题目的延伸,只不过交待得更清晰,也就变简单了。连Limo也拿到了0.5分。虽然简单,R1却没有像Grok和Claude那样拿满分。这暴露出R1的弱点:过度思考。明明正确答案触手可及,但是想多了,反而错了。Claude的回答基本上都很短,在1000token以内,而R1经常用满8000多token。)

20、现观以无间道开始,是无间道和解脱道交替进行的,包括8无间道,8解脱道,无间道通常可以断烦恼,解脱道不断烦恼。前4个刹那分别是:苦法智忍、苦法智、苦类智忍、苦类智。后面12个分别是把苦换成集、灭、道。法智忍如果断烦恼,是断欲界的烦恼;类智忍如果断烦恼,是断色界、无色界的烦恼。这称为它们的“断对治”。烦恼分为见所断和修所断,无论是见所断还是修所断,已断的烦恼都不会再断。见道只能断见所断的烦恼,世俗道可以断见所断的烦恼和修所断的烦恼。见道中的忍对于自己所对治的烦恼,已断的不会再断,未断的必然会断。无漏道只能断自地和上地的烦恼(但未至定可以断欲界的烦恼)。有顶的见所断烦恼只能通过忍来断,有顶的修所断烦恼则未必。如果未全离下地染,最多只能起上地近分道,未离欲染,最多只能起未至定。已离上染仍可能起下地无漏道。问:未全离色界染,依第三静虑见道,见道中,断第四静虑第五品烦恼的刹那最多有几?最少有几?

答案:最多有4,最少有0。

DeepSeek-R1 0;Grok3 0.5;Claude 3.7 Sonnet 0.8;Limo 0;QwQ 0。

(最后一题,我也累了,有点敷衍凑数了。虽然凑数,也还是可以看出大模型的不同特点和表现。我看R1回答,经常替它着急,它是内耗的典型,在思考中频繁出现“因此,答案应该是最多1,最少1。但可能我哪里错了……”,一遍又一遍地出现,无论它的思路是正确还是错误,它都会自我怀疑。这在很多时候并不能提升最终的正确率。前一问“最多是4”,对Grok和Claude都没有任何难度。后疑问,Grok认为最少是1,这是脑补没有依据,因此给它0.5分,Claude认为最少是0或1,更接近正确答案,给0.8分。)

总分:DeepSeek-R1 13.2;Grok3 11.8;Claude 3.7 Sonnet 12.3;Limo 9.3;QwQ 4.4。

总体评价:DeepSeek最猛,用力过猛的猛,“猛”是赞赏,也是批评。Claude最稳健。Grok偶有惊喜,风格在R1和Claude之间,比DeepSeek少了内耗,比Claude多了细密。Limo很不错,小模型能有如此表现,难能可贵,只是对阿毗达磨来说,参数量恐怕还是不够。

准备接着手搓一个文学小模型

手搓阿毗达磨AI失败后,我嫌弃AI太不智能

《俱舍九题》《俱舍万字》《俱舍英译百瑕》《阿毗达磨理校百例》PDF(20250401)