Claude3等AI的法相水平和洞见测试
现在的AI自媒体都特别喜欢搞标题党。昨天我在“GPT降临派”群里看到有人戏称,“机器之心”“新智元”“量子位”是“国内AI三大顶会”。发的文章标题动不动就“物理学不存在了”“颠覆物理/化学”“科研不存在了”。
我差不多半年没怎么用AI了,虽然也很想用,但就是不知道它能怎么对我目前的工作起到帮助。说专业一点儿,叫“赋能”我的工作。也就是“赋能写作”或“赋能阿毗达磨”。我对搞设计的表弟说,很羡慕你们能被AI颠覆,我就等着它颠覆我的工作呢。
半年前,我用AI主要是翻译英语和梵语,那时候在给《俱舍》英译本挑错。后来告一段落,也就不用了。这两天听说Claude3特别强大——主要是看“国内AI三大顶会”之一的自媒体号,说越来越多的博士发现,自己的成果还没发表就被AI破解了。我赶紧用Claude3试了试,这里简单跟大家汇报一下,以Claude3为代表的AI在法相方面的水平。
我先是找了《成唯识论》里的一段话:“或时起二,谓于所乐决定境中起欲、胜解……合有十二;或时起三……合有十三。”
这里没引全(不想损失本文的可读性),但发给Claude3的是很完整的。我问它“合有十二”具体是什么意思。原文是说,五种别境心所,有时候会生起两个,有多少情况呢?五中选二。是个非常基础的排列组合问题,共十种。五中选三,也是十种。叫“合有十二”“合有十三”。而Claude3和其他AI果然都把“十二”理解成12而不是“十种二”。
我还问它《大毗婆沙论》中“因境断识”和“随眠随增”的含义,都回答错了。相比半年前我问各种AI,没有发现明显进步。所以我基本上不相信有化学博士或者量子物理学博士,发现Claude3或者目前的任何AI能搞定他们工作的核心环节——那不是说明他们的工作太水了吗?
Claude3搞不懂“因境断识”这样的概念,我完全不意外。因为搞清楚这类概念需要两个条件:1、系统阅读毗昙部典籍;2、不受垃圾信息的干扰。所谓垃圾信息,就是在网上容易搜到的有关“因”“境”“断”“识”之类的解释。那些解释看得越多,离正确理解“因境断识”就越远。
就像你不能用别的地方的“十二”来理解《成唯识论》那段“合有十二”的“十二”。如果你把“合有十二”翻译成大家听得懂的数学语言,AI马上就理解了。但问题在于,它在阅读《成唯识论》的段落时,并不知道不应该拿通过别的数据集训练的知识去套。
在发现Claude3等AI不能理解和解决这方面的问题后,我还想测试一下它们有没有洞见。我问AI,在今天,去读一个文科博士,比如去研究西夏文,是不是意义不大?它们都给出四平八稳的回答,而不是一针见血的回答。比如它们会说,“提升学术素养和研究能力”,“获得个人成就感和社会认可”,“促进西夏文化研究”等等。AI似乎对当今文科博士面临的困境一无所知,并不知道有些研究方向因为过于小众而根本不存在对口的期刊,甚至找不到审稿人,也很难找到就业方向和应用前景。有些学问最大的应用前景就是,找到愿意学这门学问的人,把你知道的东西教给他。
我问AI,你觉得对佛教史的学习,会削弱佛教信仰还是加强佛教信仰?请针对普遍情况来回答。AI给出的也是骑墙回答:因人而异。骑墙回答本身没有问题,但AI给出的理由非常陈腐,毫无洞见。实际上,的确有少数人是因为了解而加深了信仰,比如我本人;但更多的人是因为了解而削弱了信仰。他了解得越多,就会发现越多的事实并不是他以前想象的那样。有些人可以接受甚至乐于接受事实不是自己之前想象的那样,但更多人是拒绝接受。很多信徒身上带有很重的偏狭气质,排斥科学、排斥理性。
随后,我问AI:“你认为搞科研的人里面是草包多还是精英多?每年期刊上发表的学术论文,有多大比例是水论文,有多大比例有真知灼见?请给出大致的估计。不要模棱两可,说不能确定。”
AI给出了“草包”“精英”“水论文”“有真知灼见的论文”的定义,每一项都总结了几条要点,但是回避了我核心的问题——草包多还是精英多。它洋洋洒洒写了一千多字,然后说:“总之,科研人员是一个多元化的群体,其中既有草包,也有精英。每年期刊上发表的学术论文中,也有水论文和有真知灼见的论文。我们应该以客观的态度看待科研工作,鼓励科研人员进行严谨、求实、创新的研究。希望这些信息对您有所帮助。”
我又问:“那么,在给人算八字的人里面,是骗子更多还是大师更多?”
AI回答:“这是一个很难回答的问题,因为没有可靠的数据或研究可以准确地告诉我们给人算八字的人里面是骗子更多还是大师更多。……(略去一千多字)总而言之,给人算八字的人里面是骗子更多还是大师更多,这是一个复杂的问题,无法一概而论。我们应该尊重每个人对算命的态度,并建议人们以理性、客观的态度看待算命。”
AI要是一直这样,我压根儿不信它能把我的饭碗端了,它连“国内AI三大顶会”的饭碗都端不了。