大问题Dialectic

大问题:因果关系的本质是什么?

休谟:主观心理联想

如果在座各位了解一点西方哲学的话,会知道18世纪的苏格兰哲学家大卫·休谟解构了因果关系的客观性和必然性。休谟认为,因果关系并不是客观存在的。休谟对因果关系的解构可谓是振聋发聩,直到今天的哲学家和科学家,都不得不面对休谟对因果关系的挑战。

那休谟是怎么解构因果关系的?首先,休谟把人类所有的知识分成了两类,休谟的这个关于知识的分类被称作是「休谟之叉」,休谟认为,人类的知识分为两种,第一种是关于观念之间关系的知识,第二种是关于事实的知识。

人类理性研究的两种对象(休谟之叉)

1

关于观念之间关系的推理

Relations of Ideas

2

关于事实的知识

Matters of Fact

那第一种关于观念之间的关系,其实也就是数学和逻辑学方面的知识,这种数理逻辑的知识不牵涉任何经验事实,纯粹就是在概念之间进行逻辑推理,比如2+3=5,或者如果a>b,且b>c,那么a就必然>c。这种数理逻辑的知识是普遍必然的,丁是丁卯是卯,没有一点含糊的,研究这种知识,你甚至都不需要出门,躲在自家的小黑屋里面,通过逻辑推理就能推理出整个数学大厦,因为它们的否定会导致自身逻辑矛盾,这就是说,我们无需进行经验观察,只需分析概念本身就能研究这种知识。无论你身处何地,无论你来自北京还是上海,无论你出自哪个国家,2+3也=5,就算外星人来了,他也得跟咱考一样的数学卷子!

第二种知识就是科学知识了,包括自然科学和社会科学,这就是关于事实的知识。科学知识和数理逻辑的知识的重大差别,就是研究科学知识是要观察经验事实的。科学家得做实验,你不能躲在小黑屋里面只靠推理就能发科学论文了。而这种关于事实的科学知识是什么,其实也就是关于事物之间因果关系的知识。休谟说,这第二种关于事实的知识,也就是因果关系,并不是普遍必然的。

为什么这么说?举例而言,你观察到,太阳出来了,然后石头热了,于是你认为,是太阳的照射,造成了石头发热了,太阳照射是原因,石头发热是结果。你就得出了一条物理学的规律:「太阳会把石头晒热」。当然,你要做颗粒度更细的说法的话,那就是「太阳所发射出来的热能,加速了构成石头的分子的运动。」

但是,休谟就要问了:太阳出来,石头热了,这两个事实之间,有什么必然联系吗?当你说「因为太阳出来,所以石头热了」,这个因和果之间,有任何逻辑必然性吗?并没有,因为它的否定并不会导致逻辑矛盾。比如,我们完全可以设想,太阳出来了,然后石头就变冷了,完全有可能,逻辑上并没有任何矛盾。

那既然因果之间没有必然联系,那原因和结果之间的联系是怎么形成的?休谟说,所谓的因果之间的联系,只是建立在对经验事实的归纳的基础上,而产生的心理上的习惯性联想。

什么是对经验事实的归纳(Induction)?就是我们每次都观察到太阳出来了,然后发现石头跟着就热了,已经观察到一万次了每次都是这样,并且我们每次都掏出我们的小本本给记上了,这个小本本就代表着我们形成了一种习惯,然后当第一万零一次我们看到太阳出来的时候,这时候我们就复习我们的小本本,我们的心理上就产生了一个联想,联想到这一次这个石头大概率也会变热。也就是说,当我们观察到N次A事件发生都会伴随着B事件发生,当N这个数字大到一定程度以后,我们在心理上就相信,当第N+1次A事件发生了,B事件也发生的概率也就越大。但是,话说回来,概率再大,也只是概率而已,这只是我们不停地拿小本本记录以后形成的归纳,归纳是不具必然性的,因为完全有可能第N+2次A事件发生了,B事件并没有发生,完全有可能下一次太阳出来了,石头就变冷了。

你别以为「太阳出来石头变冷」这事儿匪夷所思,一个现实发生过的经典的例子就是,以前欧洲人还没发现澳大利亚的时候,看到的天鹅都是白色的,他们看到一百只、一万只、一百万只天鹅都是白色的,无一例外,于是欧洲的科学家就在他们的小本本上记下的科学规律是:「天鹅都是白色的」,认为这是科学规律。但是,一旦欧洲人去到澳大利亚以后,发现居然有黑天鹅,他们整个三观都炸裂了!

我们再举一个大家都听说过的例子,那就是英国哲学家罗素提出的「火鸡理论」,也就是被刘慈欣写进《三体》的「农场主假说」,就说,一个农场里有一群火鸡,农场主每天上午11点来给它们喂食。火鸡中的一名科学家观察这个现象,一直观察了近一年都没有出现例外,于是它宣称发现了自己宇宙中的伟大定律,那就是「每天上午11点,就有食物降临」。它在感恩节早晨向大家宣布了这个定律,但是,感恩节这天上午11点并没有食物降临,而是农场主进来把火鸡们都捉去杀了。

这意思就是说,我们基于经验的归纳而得出的关于事实之间的因果关系,并不是普遍必然的,我们永远无法避免下一个黑天鹅会出现。休谟认为,并不是有什么普遍必然的客观规律规定了太阳出来石头必须发热,而只是基于我们的心理习惯。我们习惯这样了,我们习惯看到太阳出来了,然后心理联想到石头会发热,就好像我们习惯看到一只杯子从桌子上掉落,然后心理联想到它会摔碎一样。我们从来没有直接经验到「因果关系本身」,我们只是看到了事件B总是在事件A之后出现,于是习惯性地以为A「导致」了B。这也就是说,事物与事物之间无所谓有什么客观的因果关系,因果关系是主观建构的。

休谟就这样解构了因果关系的客观性和必然性,这算是哲学史上一次颠覆性的看法,休谟的这套分析对于人们的因果观的冲击可以说是毁灭性的。当时牛顿力学横扫欧洲,大家觉得只要找对了亚里士多德的「动力因」那种东西,人类就找到了这个世界的客观规律,那么人类就是预测这个世界的一切变化。但休谟说:你找到的所谓事物的原因,只不过是对经验的归纳所形成的一种人类主观的心理联想,并非是世界自身的客观规律。

休谟这一观点造成后果是,人们对所谓科学真理的客观性、必然性的信任开始崩塌。我们花大力气搞实验、积累数据,就是想找出「可重复、可预测」的因果关系。可休谟提醒我们,你做的只是发现统计模式,而不是掌握了某种客观的必然规律。这就是为什么后来人们在说「只看相关,不问因果」时,总要提到休谟:你看到某两个变量总是同时发生,并不意味着其中一个是另一个的原因。确实,后世有很多科学家就受到了休谟的影响,干脆就认为,科学研究无需关注因果关系,而只需要关注相关关系就够了。

统计学家卡尔·皮尔逊就认为,科学研究并不是寻找「原因」的,而是描述现象间的统计相关关系,意思就是说,你作为一个科学家,你只要拿着你的小本本,如实地记录下来,先发生了什么,后发生了什么。先是太阳出来了,然后石头发热了,你如实记录下来就好了,而至于两者之间有没有因果关系,这个问题不重要。你只需要关注事物与事物之间的相关系数就好了。相关系数这一概念就是皮尔逊提出来的。

现在的大数据分析走的也是这么一条路子,「只看相关,不问因果」,我们之前开题的时候提到过这个经典案例,就是统计研究发现,在超市买尿布的顾客更容易买啤酒,这两者之间有高度相关性,但其中有什么因果关系吗?不知道,是因为年轻的爸爸们总被派去买尿布?还是因为喝啤酒的人大多是刚生孩子的父亲?不知道,也没必要知道,我们仅凭相关性,就可以指导超市老板的行动,那就是把货架上尿布和啤酒放在一起,这样销量就会提升,这就够了。

我们说回休谟,休谟解构了因果关系的客观性和必然性,认为因果观念只是人主观的习惯性联想。当然,休谟也并没有否认这种「因果观念」的实用性。就像刚刚我们说的,相关虽然不等于因果,但相关性足以指导我们的行动了。休谟也承认,要是我们每天都在怀疑「火会不会突然不烧人了」「酒喝下去会不会突然不醉人了」,那也根本没法生活了。虽然因果观念只是习惯性联想,但是人要正常生活下去,还是要遵从习惯的力量的,用休谟的原话说就是「习惯是人生的伟大指南」。休谟解构因果关系,并不是要否认人们的因果观念的实用性,但是,毕竟,作为哲学家,休谟有必要在理论上挑明:在逻辑和经验之间,有一个不可跨越的鸿沟。凡是建立在经验观察之上归纳出来的因果关系,都不是客观的和必然的。

这就是休谟的因果观,在当时牛顿力学横扫欧洲、科学突飞猛进的时代背景下,休谟却冷不丁地从哲学上破了一盆冷水,把亚里士多德留下的「因果是世界自带的秩序」这套信念浇得七零八落。休谟对因果关系的解构,不仅挑战了当时科学界的主流共识,也深深地冲击了同时代的另一位哲学家,那就是康德。康德比休谟小13岁,当他读到休谟的著作的时候,简直如五雷轰顶,三观崩塌,因果关系,不存在了?用康德的原话说就是,「休谟把我从独断论的迷梦中惊醒」。康德开始意识到,如果因果关系只是心理习惯,那么所有基于因果推理的科学知识,也就是所有的物理学规律,所有的自然法则,都将失去它的普遍必然性,这样的话,整个科学大厦就会失去哲学上的根基,沦为经验素材的堆砌,那这样的话,物理学真的就成集邮了!

在当时那个科学大发展的时代,科学知识的普遍必然性何以维系?这一问题就成了康德面对的最大的难题,也是休谟留给他最具挑战性的哲学遗产。由此,康德开启了自己的哲学之路,他要正面回应休谟提出的挑战,康德要在那个科学大发展的时代,从哲学上为科学知识的普遍必然性的奠基。接下来我们有请康德出场。

在进入康德这一part之前先插播一个环节啊,就是澄清一下咱们「大问题Dialectic」这个哲学小频道的定位——我做的这些节目,是娱乐节目,哪怕是所谓的智识娱乐节目,它也是娱乐节目,它是出于对一个大问题的争论,它有趣、好玩、有意思,才吸引大家伙儿来看的,而不是出于「我要学哲学」才来看咱们节目的。所以,咱们这个节目从来不教授哲学,我在节目里面讲到一些哲学知识,并不是为了讲哲学而讲哲学,而是为了作为本期大问题中某个哲学家用来争论的一个论据来用的。所以再说一遍,咱们是个娱乐节目,不是教学节目。

但是,不得不说呢,有很多朋友还是通过咱们大问题节目,对哲学感上了兴趣。很多朋友私信我说,看了咱们节目以后,转头就下单买了本诸如《西方哲学史》或者《西方哲学50讲》之类的书籍。可是,很多朋友的反馈,翻开这个哲学书,真是读得云里雾里,基本上买来的哲学书读不超过10页,就摆在书架上吃灰了。很多朋友反馈说:哲学书怎么这么晦涩难懂、不说人话啊,怎么跟夏先生在节目讲的感觉完全不一样呢?

自吹自擂一下啊,我在互联网上做哲学内容也差不多10年了,我的知识水平有多高不敢说,但是把哲学这个在很多人看来晦涩难懂、不说人话的学问,讲得让我们非专业的观众或读者能听明白,甚至觉得还蛮有意思的。这是我的一个小小的本领。所以,应很多观众朋友想学哲学但觉得自己读不懂这个需求呢,我出了一门课,我就不讲别的了,就讲我的老本行哲学。节目不专门教哲学,这个课就专门教哲学了。这门课叫做《看透世界:100个哲学大概念开悟人生!》其实就是我用100讲来讲明白、讲透西方哲学重要的100个哲学概念或命题。比如什么是「存在即合理」,什么是「柏拉图式的爱情」,什么是「现象学」,什么是「平庸之恶」,什么是「存在主义」,什么是「后现代主义」……这些哲学概念和命题估计你都听说过,但是你真的理解它们什么意思吗?我在这门课里面会把这100个重要的哲学概念或者命题讲明白。

这门课的底层其实是西方哲学史,但是,又不是按照编年史或者人头史那样枯燥地讲,而是把它模块化为100个重要的哲学梗来讲,这样方便大家比较轻松愉快地学习,学了能记住,能有收获感。而且,你以后在写作、交流、表达的时候能用上这些经典的哲学梗,这显得你很有文化。我在讲授这些哲学概念或命题的时候,肯定不是单纯地做词条解释,这ChatGPT就能做到,而是,这个哲学概念它的前因后果,它为了解决什么问题而被提出,以及它在后来被怎样的继承发展以及变异,包括它对我们今天的人的生活有什么启发……我尽量还是按照这样的脉络来讲的。总之就是让你觉得有意思,能学明白,并且印象深刻。

目前这个课程刚刚上线,赶紧趁这个时候买还能享受早鸟价减免100元,先到先得!而且你报名这门课,还有机会加入一个学习小组,我会在里面答疑,大家报名的人多的话,大家在学习小组里面一起讨论哲学也热闹点。你要是能从头到尾看完这100讲的哲学课,能让你看透世界,理解人性,开悟人生!

课程报名方式:

(保存↓下图,用淘宝APP扫码)

Image

行了,关于咱们这个哲学课就说到这了,康德要等不及了,待会看完这期节目别忘了报名咱们这个哲学课啊。好,下面有请德国哲学家康德出场!

康德:人的认知结构

我们即便是还没上过哲学课的朋友都知道,康德是近代以来影响力最大的哲学家之一,而这位大哲学家之所以发展出自己的哲学理论,就是被休谟刺激出来的。康德哲学的一大努力,就是要对休谟挑战因果关系做出回应。可以说,康德是否成功回应了休谟问题,决定了康德哲学是否立得住脚。

那康德是怎么回应休谟的挑战的?康德使用了「接化发」!就是先把休谟的看法接过来,以此化解掉休谟的挑战的攻击性,然后,再四两拨千斤,发出自己不同于休谟的看法。我们先说康德同意休谟的地方。

休谟认为,因果关系并不是客观存在的,因为我们在经验世界里面从未直接观察到过因果关系本身,我们观察到的是,事件B总是在事件A之后出现,于是,我们从主观上建构了A是B的原因。

康德说:没错,因果关系并不是客观存在的,因果关系确实是我们人类主观建构的,没问题!甚至,康德比休谟走得还更极端一些,不仅事物之间的因果关系是人类的主观建构,康德认为,我们关于事物的一切认识,都不是事物自带的,都是人类主观建构出来的。比如,当我们看到眼前有一个苹果,我能通过我的视觉感受到它是红色的,我能通过我的触觉感受到它丝滑的手感和它的重量,我能通过我的味觉感受到它酸酸甜甜的味道,等等。

问题在于,我们认识到的这个苹果的颜色、手感、重量、味道,是这个苹果本身自带的吗?这个苹果本身就是红色的吗?康德认为,并不是的,苹果的这些颜色、手感、味道这些属性,是我们人类主观建构出来的。因为我们人类有特有的感官和认知结构,苹果的这些颜色、手感、味道这些属性,都是透过了我们人类特有的感官和认知结构才被认识到的,这种对苹果的认识当然是人类的主观建构。

康德把这些透过我们人类特有的认知结构而得到的关于苹果的认识,这种主观建构,叫做现象,或者表象。但是,撇除这些主观建构出来的现象,你如果再问我,你一定要问我,苹果的客观的本质是什么?问如果脱离我们人类的感官和认知结构,这个苹果本身是什么?那这个问题就没法回答了。问苹果本身是什么,就像问一个盲人红色是怎样一种颜色一样,都是毫无意义的。

康德把这个事物本身叫做物自体,或者翻译叫做自在之物(Things-in-Itself),德语原文叫做Ding an sich。我们只能认识物自体刺激我们的感官和认知形式而被我们主观建构出来的现象,而关于这个物自体本身,我们无法对其做出任何描述,物自体无法认识,物自体不可知!

所以,在康德的这么一通操作之下,我们再说回休谟对因果关系的挑战。康德当然也认为,因果关系也是人类认知结构的一种主观建构,是现象世界里才有的,因果关系并不是物自体自带的。只有我们人类才能感知到事物之间有因果关系,如果换另外一种有完全不同的认知结构的物种,比如昆虫所感知的世界里,就是没有因果关系的。因果关系当然是人类主观建构出来的。

这就是康德同意休谟的地方,因果关系是人类的主观建构,甚至康德比休谟走得更极端,一切认识都是主观建构。但是,下面康德就要指出它不同意休谟的地方了。还记得,上一部分结尾的时候提到的康德哲学的一个重要任务吗?那就是为科学知识的普遍必然性奠基,休谟认为,科学知识是建立在因果推理上的,而因果推理只是主观建构,因而科学知识都不具有普遍必然性,但是,康德认为,即便建立在因果推理之上的科学知识是主观建构的,但它依然具有普遍必然性!

怎么一个东西既可以是主观建构的,又具有普遍必然性?好,我们一步一步来看,康德是怎么样把「主观性」和「普遍必然性」勾连在一起的。

你如果学过一点哲学课的话,会知道休谟是英国经验主义(Empiricism)阵营的哲学家。什么叫经验主义?简单说就是,我们的心灵从这个世界观察接收到什么样的经验事实,就是如实地接受的,不会给经验素材加戏。一个典型的学说,就是同属经验主义阵营的英国哲学家约翰·洛克提出的「白板说」(Blank Slate),就说我们的心灵就像一块干干净净的白板,上面没有任何标记,就像一面干净的镜子一样,我们对于世间万物的认识,就是经验素材的原始堆砌,外界有什么经验事实,我们就照单全收,一点也不加工。

所以,正是在经验主义主张的这个对经验素材照单全收、一点也不加工的意义上,休谟才提出灵魂反问:我们收集到的这些经验素材里面,哪儿有什么「因果关系」?我们观察到的仅仅是事件B总是在事件A之后出现,仅此而已。

但是,康德认为,人类的心灵并不是一块白板,而是自带自身的预加工程序的,就是我们在接受经验事实的时候,并不是照单全收,而是我们在接受经验素材的同时,已经在有加工地接受了。我们接收到的经验,都是已经被加工过的经验。就像我们在前面举的苹果的例子一样,我们认识不了苹果本身,我们只能透过苹果本身刺激我们的认知结构而产生的现象,而这么一个物自体「穿过」我们的认知结构的过程,也正是我们心灵的预加工程序在加工经验素材的过程。而这些预加工程序是什么?康德把它叫做认知形式(Form of Cognition)。康德在《纯粹理性批判》一书中,对我们的认知结构进行了详细的分析,他把人的认知结构分成了三层结构:感性、知性和理性。

康德划分的认知的三层结构

1

感性

Sensibility

2

知性

Understanding

3

理性

Reason

感性提供原始的材料,这些就类似于经验主义者说的我们照单全收的原始经验素材,是我们通过感官感受到的杂乱无章的经验素材,比如听到杯子落地的声音、看到水洒了一地。

知性就如同加工厂,负责把这些材料整合成可理解的现象,这里的加工程序,也就是认知形式,使用的就是所谓的「认知范畴」,而这其中就包括因果性的范畴。

理性则是在更高层次上把这些表象进一步串成原则和体系,比如我们对自然法则和道德法则的理解。

所以,因果关系就是在人的感性、知性、理性中的知性这个层面中的「因果性」这个认知范畴构建出来的,这个「因果性」范畴就是知性组织加工时间序列的一种方式。它让我们脑子里面有这么一根弦,就是一切事物都是有原因的,并且让我们能把时间上「后发生的事物」理解为「由前面的事物导致的」。如果没有因果性这样的认知形式,我们对这个世界就根本没法认识了,这个世界对我们就是一团乱麻,比如我们看到一个杯子掉地上,然后摔碎了,水撒了一地。我们说,因为杯子掉地上,所以它摔碎了。这并不是我们观察了一百个、一万个杯子掉地上摔碎以后才总结出来的事后联想。而是我们在观察杯子摔地上的那一瞬间就是通过因果范畴在观察它,如果没有因果性这个范畴,我们所有的感觉印象都只是一堆散乱的「杂多」,就是这个杯子怎么就掉地上了,然后怎么就碎了,水撒了一地,我们看不懂,我们感觉不到这其中的先后事件有什么关联,好像谁先谁后也无所谓,一团乱麻。用看视频来打比方的话,如果我们不是自带因果范畴看视频的话,我们就只能看到一帧一帧的彼此孤立的画面,而根本无法形成「一个杯子掉地上摔碎了」这样完整的视频。

所以,因果关系确实并不是客观存在于世界中的,而是我们认识世界必备的认知形式。康德把这些认识形式,也就是我们这里打比方说的预加工程序,称作是先验的(Transcendental),意思就是先于经验素材,并且使得我们对经验的认识得以可能的先决条件。打个比方,我们人类就是自带因果范畴这套滤镜看待世界的,这就像我们每个人从出生起,都被焊接上了一副眼镜,只要透过这个眼镜看世界,这个世间万物,就被赋予了因果关系。

所以我们并不是如亚里士多德说的那样,从这个外在世界里面发现了因果关系。我们也不是如休谟说的那样,在归纳了经验事实以后,事后习惯性联想出了个因果关系。我们是在认识世界的同时,就是拿着因果范畴这么一个预加工程序在认识世界的。因果关系不是来自经验,而是我们对经验的认识得以可能的先决条件。

现在,我们可以揭晓,为什么康德能一方面认为因果关系是主观建构的,另一方面也能认为这种主观建构的因果关系也是普遍必然的了。因为人的这一套认知形式,这一套预加工程序,这一副认识世界的滤镜,是全人类都一样的。全人类有一样的心灵结构,正所谓「人同此心,心同此理」。我们拿着同一套因果范畴这套滤镜认识世界,就相当于大家都是通过type-C接口来接受世界的信息的,由于接口的统一的,那人们接收到的因果关系的底层制式就是一样的。所以无论你身处何地,无论你来自北京还是上海,无论你出自哪个国家,人与人都是拿这同一套因果滤镜认识世界的。外星人来了,有没有同样一套因果滤镜不好说,但只要你是个人,你都摘不下这套因果滤镜。

所以在康德看来,基于因果推理的科学知识的普遍必然性,不是建立在它在物自体世界哪里有什么客观性,而是建立在「主体间性」之上的,也就是,人与人之间的先验认知形式是一样的。大家都是同一套加工程序,所以基于同一套加工程序而对世界产生的认识,在人与人之间就是能达成共识的,所以在这个意义上,康德也把这种「主体间性」称作一种「客观性」。

说完康德基于主体间性来为科学知识奠定普遍必然性,你可能会有疑惑,怎么主体与主体之间能达成共识,就说它具有普遍必然性?主体之间必然会达成共识吗?是的,在康德看来,这种所谓的共识是必然达成的,因为它是一种先天的共识。这就要说到康德的「『先天综合判断』(Synthetic A Priori Judgment)何以可能」这一学说了。

休谟把人类的知识分为两种,一种叫做关于观念之间关系的知识,也就是数理逻辑的知识,另一种是关于事实的知识,也就是建立在因果推理上的科学知识。休谟认为第一种知识才是普遍必然的,而第二种知识由于都是对经验事实的归纳,因而不是普遍必然的。

康德也大概套用了休谟这一套分类,然后试图用魔法打败魔法。康德也把所有知识分成两类,康德叫做两类判断,因为知识都是判断,一种叫做分析判断,另一种叫做综合判断。

两种判断(知识)

1

分析判断

Analytic Judgment

2

综合判断

Synthetic Judgment

第一种分析判断,就是谓词是包含在主词之中的,谓词是从主词哪里分析出来的,比如说同义反复,「所有的单身汉都是未婚男子」或者a=a这样的逻辑同一律,这样的分析判断是具有普遍必然性的,分析判断的普遍必然性取决于它的先天性(A Priori),先天的意思就是先于经验,不管经验世界天崩地裂、海枯石烂,不管你人在北京还是人在外星,a都=a。但是,这种分析判断没有为我们的知识增加新的内容,同义反复,算不上严格意义上的知识。

第二种综合判断,是指谓词并没有包含在主词之中。这就增加了新的内容了,所以这就是知识了。比如「太阳把石头晒热了」,「石头热了」这个事实我们是不能从「太阳」的定义中分析出来的,必须去观察事实经验才能得出这么一个判断,因而综合判断是后天的(A Posteriori),康德这里说的「后天」不是指明天的明天,「后天」的意思是指来自于经验,就是通过经验观察才能得到的。但是,也正是基于这一点,休谟认为,这种基于后天经验观察而得来的知识,不是普遍必然的,所以在这个意义上,休谟就解构掉了因果关系的普遍必然性了。

但是,康德这时候站出来说,休谟你说的这种知识,只是一种「后天的综合判断」,因果关系不是这种后天的综合判断。因果关系是一种「先天综合判断」(Synthetic A Priori Judgment)!

可是,你可能会觉得,「先天综合判断」里的这个「先天性」不是只有分析判断才能有吗?综合判断不都是后天的吗?怎么综合判断也能是「先天」的?一会儿后天,一会儿先天,到底是哪天?这个「先天综合判断」是何以可能的?

康德说,为什么综合判断可以是先天的?它的先天性(A Priori),取决于它的先验性(Transcendental)。这兜兜转转又说回去了,我们的认知形式就是先于经验,并且使得我们的经验认识得以可能的先决条件。先验的认知形式当然也是先天的,而先天性也就意味着一种普遍必然性,所以基于因果推理的科学知识,作为一种综合判断,也是一种先验的判断,因而也就是先天的判断,因而也具有的普遍必然性,论证完毕!

先天    ←    先验

       A Priori ← Transcendental

这里还是要解释一下——并不是所有综合判断都是先天的,比如「太阳把石头晒热了」就是一种后天综合判断(Synthetic A Posteriori Judgment),确实就像休谟说的那样,这确实不具备普遍必然性,因为它可错。而因果关系就不是这样的后天综合判断了,而是像「一切事物都有原因」这样的判断,这就是一种先天综合判断(Synthetic A Priori Judgment)。首先,它的谓词并不包含于主词之中。我们并不能从「事物」的定义里面分析出它必然有原因,所以它提供了新的内容,是一种综合判断;其次,它不依赖于经验,它是先验的,它不是我们观察大自然以后才得出的认识,而是自我们出生起我们脑中就自带的预加工程序,因而它是先天的。所以,太阳确实不一定就是石头变热的原因,但你不能说因果关系不存在。

康德这么一通操作,就为基于因果推理的科学知识奠定了普遍必然性的基础,从而回应了休谟对因果关系的挑战。你觉得康德对休谟的挑战的回应是成功的吗?康德完美解决了休谟提出的质疑了吗?

介绍完康德对休谟的回应,接下来即将出场的大卫·刘易斯在台下坐不住了。刘易斯不单单是哲学家,他也是逻辑学家。刘易斯就说,你们这帮纯哲学家真够无聊,争论个因果关系的本质是什么,争论了半天,说因果关系是人类认知形式中的先验范畴,说因果关系是一种先天综合判断。但是,我们知道这个对因果关系的定义有什么用?它能帮助我具体去认识世界、改造世界吗?你康德说要为科学知识奠基,可是你提出的这个因果观能有效指导科研工作吗?比如你导师问你这两个参数之间有没有因果关系,你回答说:这里面有一种先天综合判断!你看你导师不会不打死你?

我们研究因果关系,应当研究出关于因果关系的操作性定义,通过这个操作性定义,我们能具体衡量两个具体事物之间是有还是没有因果关系了。而这,就是接下来要出场的大卫·刘易斯要做的工作了。好,我们有请美国哲学家大卫·刘易斯出场!

刘易斯:反事实条件句

康德给因果关系下的定义,更多是一种本体论的定义,而刘易斯提出,要给因果关系下一个操作性的定义,就是说在什么情况下,我们可以说,两个事件之间有因果关系,在什么情况下可以说没有因果关系,换句话说,我们要知道的是「怎样才算是因果关系」,而不是「因果关系本身是什么」。这也就是说,刘易斯要给因果关系提供一个判断模型。

那我们怎么来判断因果关系?我们来举一个非常日常的例子。就是你今天上班迟到了,老板问你:「你为什么迟到?」你回答说:「因为路上堵车了。」老板质疑道:「难道路上堵车真的是你上班迟到的原因吗?」对呀,你怎么确定路上堵车和你上班迟到之间真的有因果关系?这时候刘易斯就会站出来替你翻译一下,你想表达路上堵车和你上班迟到之间有因果关系,其实你想表达的是,「如果路上没有堵车,我就不会迟到了。」

这就是刘易斯提出的验证是否存在因果关系的第一步,就是把有待验证的因果关系转换成一个逻辑上的反事实条件句。

什么叫做反事实条件句(Counterfactuals)?反事实条件句讲的就是,虽然现实中事情已经发生了,但我们可以设想一个「如果不是这样」的虚构场景,再看看这个场景下是否还是会发生那个结果。就是你如果想验证A是不是导致B发生的原因,你就去设想,如果没有A,那么B会不会发生?那如果没有A,就不会有B的话,那A就是B的原因!

反事实条件句

如果没有A,那么没有B。

If not A, then not B.

还是上班堵车的例子,你要验证路上堵车是不是导致上班迟到的原因,你就去设想另一个可能世界,在那里路况通畅,并没有堵车,那么你就能准时到公司,发现原来的结果并没有发生。所以,你就可以判断,路上堵车就是你今天上班迟到的原因。

我们刚刚提到了可能世界(Possible World)这个概念,说是设想另一个可能世界,如果没有A,会不会有B,这听起来挺科幻的,但是我们之前有一期讲《可能世界里的女友》那一期节目里面也提过可能世界理论,咱们讲因果关系这一期没必要这么科幻,其实我们可以把可能世界理解为一种可能性,就是今天上班路上可能堵车,可能不堵车,这意思也就是,在有一个可能世界里面上班路上堵车了,在另一个平行的可能世界里面,上班路上就没堵车。那要验证现实世界里面A和B有没有因果关系,就要诉诸于另一个可能世界,在这个可能世界里面,如果A没发生,B也没发生,那A和B在这个现实世界里就有因果关系。

注意,我们诉诸的这个可能世界,必须是一种与现实世界最邻近的可能世界(Closest Possible World),什么叫最邻近的可能世界?意思就是说,你设想的这个可能世界,它相比你所在的这个现实世界,它修改的设定比较少,别你为了验证今天上班迟到的原因,设想出这么一个可能世界——你这上班路上又是台风,又是地震的,绿巨人浩克还跑出来毁坏交通设施……那这干扰变量太多,就没法验证原因了。而最邻近的可能世界就是,它和现实世界里的其他设定都是一模一样的,仅仅是今天上班路上没堵车。简单说,就是你要控制变量。

那有了这样的通过诉诸最邻近可能世界的反事实条件句,我们在生活和科研活动中,就可以拿它来验证因果关系了。比如,一款新药对治疗疾病有没有因果关系,我们就可以设想两个邻近的可能世界,一个可能世界中的病人吃了这个药,而另一个可能世界的病人其他条件不变,只是没吃这个药,我们再来看两个可能世界中的病人的疾病会不会被治愈,这就是现在我们做医学实验常用的实验组和对照组。

现在我们知道了,通过诉诸最邻近的可能世界的反事实条件句就能验证两个事件之间是否具有因果关系,也就是如果没有A,也没有B,那么刘易斯就把A和B的这种关系叫做,反事实依赖关系(Counterfactual Dependence)。刘易斯认为,只要是具有反事实依赖关系的事件,就具有因果关系!因果关系的本质,就是反事实依赖!

那么现在问题来了,我们在生活中会发现,就是有些没有反事实依赖关系的两个事件,其实也是具有因果关系的。哲学界里面有一个经典的案例,叫做抢跑问题(Preemption),或者翻译叫做先发制人问题,就是说,有苏茜和鲍比两个熊孩子,他们用石头砸同一块窗户玻璃,苏茜先扔出了石头,石头击中了玻璃,玻璃碎了,鲍比也扔出了石头,只不过他手速比苏茜慢一点,他扔的石头飞到窗户那儿的时候,玻璃已经被苏茜扔的石头砸碎了。好,现在问题来了,请问,玻璃碎了这件事是否反事实依赖于苏茜扔石头?你会发现并不依赖,因为如果苏茜没扔石头,玻璃依然会碎掉,因为鲍比随后也会把玻璃砸碎。因此,苏茜扔石头和玻璃碎掉并没有反事实依赖关系。但是你就能说,苏茜扔石头就不是玻璃碎了的原因了吗?我们的显然不能认同这种结论。

其实,这是早期刘易斯的因果理论的一个bug,或者说理论不完备的地方。于是,刘易斯试图来填补这个不具备反事实依赖但依然具有因果关系的bug——他引入了因果链条(Causal Chain)的说法,就是两个没有直接反事实依赖关系的事件,我们还得考察他们有没有间接反事实依赖关系。这也就是说,我们要看这两个事件之间,有没有中间环节,使得这个链条上相邻的两个事件之间都具有反事实依赖关系。还是拿抢跑问题来说,事件A苏茜扔石头导致事件B玻璃碎了,这两个事件之间,可以插入一个中间环节C,也就是苏茜的石头飞向玻璃,从而形成了一个因果链条。

(A)苏茜扔石头→ (B)苏茜的石头飞向玻璃 → (C)玻璃碎了

现在我们看着这个因果链条,我们问:事件C苏茜的石头飞向玻璃,是否反事实依赖于事件A苏茜扔石头,答案是:是的,如果苏茜没扔石头,苏茜的石头就不会飞向玻璃了。我们再问,事件B玻璃碎了,是否反事实依赖于事件C苏茜的石头飞向玻璃?答案也是:是的,如果苏茜的石头没有飞向玻璃,玻璃就不会在那一刻以那种方式碎了。我们看,在这条因果链上,每一步都满足反事实依赖条件句,因此,即使最初我们发现事件B玻璃碎了并不直接反事实依赖事件A苏茜扔石头,但通过这条链条上相邻的节点之间都具有反事实依赖关系,我们仍然确定:苏茜扔石头确实是玻璃碎掉的原因。

这种虽然因果链的两头不具备直接的反事实依赖关系,但通过链条串联起来的间接反事实依赖关系的例子还有很多,而且中间环节可以不止一个,比如,某地夏季气温升高导致农作物产量下降,再导致主食价格上涨,再导致居民饮食结构改变,也就是少吃谷物了,再导致居民摄入碳水减少,血糖水平发生变化。虽然这个链条两头的事件,也就是气温升高,和血糖变化,没有反事实依赖关系,因为就算气温没升高,血糖也可能因为其他原因而发生变化。但是,如果这个链条上的每两个相邻的节点之间都有反事实依赖关系的话,那么我们还是可以说,气温升高就是导致血糖变化的原因。

气温升高 → 农作物减产 → 主食价格上涨 → 饮食结构变化 → 血糖变化

由此,刘易斯通过提出因果链条,就填补了用反事实条件句来定义因果关系的不完备之处,现在我们依然可以说因果关系的本质就是一种反事实依赖的关系,只不过,有的是两者之间的直接的反事实依赖关系,有的是通过因果链条串起来的间接反事实依赖关系。

因果关系=反事实依赖

1

直接的反事实依赖

If not A, then not B

2

间接的反事实依赖

A → C → D → B

大卫·刘易斯提出这一套用反事实条件句来解释因果关系,可以说是在学界石破天惊,因为他不再像以往的那些纯哲学家提出的一些概念上的关于因果关系的定义,但不具操作性,刘易斯说:如果没有A,那么没有B,因此A和B就具有因果关系,这就具有了操作性,我们就可以拿这个模型去验证现实世界里面的具体两件事之间有没有因果关系。

虽然大卫·刘易斯的这个因果理论是石破天惊的,但依然遭到了不少批评。也就是你刘易斯的因果理论主打个可操作性,那对这套理论的最多的批评依然体现在,这套理论,其实,也不是那么具备可操作性。

首先,你的这个反事实依赖是建立在一套可能世界理论之上的,就说要找到最邻近的可能世界,看看如果A不发生,B会不会发生,但是问题在于,到底什么是「最邻近的可能世界」?谁说了算?怎么比较两个可能世界的相似度?这个判断既没有客观标准,也没有实用的操作方法,只能靠主观臆测。比如你问「如果我没错过地铁,我还会迟到吗?」,刘易斯的意思是,想象一个最邻近的可能世界,在那个世界你没有错过地铁——然后观察你有没有迟到。但实际你会发现:你是因为出门晚才错过地铁的吗?还是因为地铁延误你才迟到的?是不是在那个世界你根本就不会出门?这就说不清楚了,哪个世界更邻近就高度依赖不同的人的直觉,说是可实操,但其实就是拍脑袋。

对刘易斯的因果理论缺乏实操性的另一个批评就是,你的这套反事实条件的理论,没法算概率——对刘易斯的理论来说,因果关系要么成立,要么不成立。但是,在现实生活中,我们都知道,因果关系不是这样非黑即白的,而是由一定的概率分布的,比如说,吸烟是否导致肺癌,按照刘易斯的反事实推理,我们就问:「如果这个人不吸烟,他一定不会得肺癌吗?」这就问不出啥,因为我们知道,有些人不吸烟也会得肺癌,而有些人由于基因或者体质的原因,就算吸烟也不大容易得肺癌,所以我们应当问的是:「吸烟是否显著提高了得肺癌的概率?」而这就需要算算术,就需要借助统计学的力量了。显然,刘易斯的因果理论并没有这一层面的考量,这也是即将出场的朱迪亚·珀尔对刘易斯的因果理论的批评,由于缺乏数学工具,刘易斯的因果理论依然不够实操化。而在概率和统计的意义上,进一步将因果判定模型实操化,这就是朱迪亚·珀尔的工作了。好,接下来有请以色列裔美国计算机科学家、哲学家朱迪亚·珀尔出场!

珀尔:机器可理解的代码

朱迪亚·珀尔也就是前两年市面上很畅销的那本书《The Book of Why》的作者,这本书2018年上市,第二年就被翻译成了中文,中文书名就叫做《为什么》。

朱迪亚·珀尔和上一part的大卫·刘易斯这两人都是哲学家,但是这两人也都不是纯哲学家,他们还有各自的主攻的其他领域。刘易斯同时也是个逻辑学家,所以他对因果关系的解释,就是从逻辑学层面给出的反事实条件句。珀尔同时是一个计算机科学家,他是2011年图灵奖的得主,所以作为计算机科学家的珀尔更加力求要把对因果关系的理论实操化,实操到什么程度呢?实操到能把它写成代码,能教会计算机理解因果关系!

上一部分结尾我们也提到了珀尔对刘易斯的因果理论的批评,但是不得不说,珀尔对刘易斯通过反事实条件句来判定因果关系,还是高度赞赏的,觉得这一洞见非常了不起。但问题就在于,用反事实条件句来判定因果,在道理上确实没错,但具体怎么操作,珀尔就不认同刘易斯了,刘易斯的方法是诉诸最邻近的可能世界看看If not A, then not B,这就比较拍脑袋了,在珀尔看来,你得用一套数学工具,用概率和统计的方法算出因果概率,这才是真正的客观的、可操作、可做实验的因果模型。

因此,珀尔自己提出了一个因果关系的定义,来替代简单粗暴的If not A, then not B的模型,来判定因果关系。珀尔给因果关系下的定义是长这个样的:

因果关系的定义

P(Y|do(X=x)) ≠ P(Y)

大家不要怕,虽然是数学公式,但我大概讲解一下,还是比较容易理解的。这个关于因果关系的定义,用人话说就是:如果你人为地对X做一个干预动作,导致Y的概率分布发生了改变,那么X就是Y的原因。这其中的关键词是「干预」,这个定义其实也就是珀尔的干预模型,我们把这个定义拆开成干预模型一个一个来讲就能理解了。

Image

我们先来看最左边的这个P(Y|X),这个我们上过中学的时候都学过,这就是条件概率,意思就是在X已经发生的条件下,Y发生的概率。其实表达的意思就是,X在多大概率上是Y的原因。举例子说,吸烟在多大概率上导致了肺癌,我们就可以写成P(肺癌|吸烟)。

比如说,你是一位科研人员,正在研究吸烟和肺癌的关系,你把人群分成了两组,吸烟的人和不吸烟的人,对应着中间这个公式,就是X=吸烟,意思就是,这是吸烟的这一组,以及X=不吸烟,意思就是,这是不吸烟这一组。这个大X=小x指事件大X的不同的状态,如果X是吸烟,那小x可以是指吸烟以及不吸烟,如果大X是太阳出来了,那小x可以是指出来了,以及没出来,以及出来一半,这取决于你的实验设置。

好,说回吸烟,你观察发现,吸烟者这一组患肺癌的概率是20%,不吸烟者这一组患肺癌的概率是10%,于是,你就得出结论说:吸烟会导致肺癌,吸烟就是肺癌的原因。能这样吗?答案是:并不能,这个结论并不可靠,为什么,因为你单纯通过观察就得出结论的话,没有排除混杂因子的干扰。

什么是混杂因子(Confounding Factor),这个混杂因子也就是一种干扰因素,比如我们看下面这幅示意图,我们看的到的是,X和Y之间好像有个因果关系,也就是X导致了Y,但其实,我们没看到的实际情况,是X和Y有一个共同的原因Z,这个Z一方面导致了X,另一方面导致了Y,这个Z就是混杂因子,Z混杂了X→Y的因果关系。拿吸烟和肺癌的例子来说,有可能并不是X吸烟导致了Y肺癌,而是有一个共同原因Z,比如说压力大,压力大的人一方面更容易吸烟,以及压力大的人另一方面更容易得肺癌。或者这个Z干脆就是一种特殊的基因,有这种基因的人一方面更容易抽烟,另一方面更容易得肺癌。这些都有可能。

Image
Image

所以说,珀尔的干预模型要做的一个重要工作就是,在考察因果关系的时候,一定要把这些个混杂因子给排除出去,。如果不排除混杂因子Z,就贸然说吸烟导致肺癌,这在做科研的时候就犯了混杂偏误(Confounding Bias)。这就是经典的相关≠因果的问题了。那怎么排除混杂因子——你得干预,你得do something,得有个do在其中,这就是右边的这个公式了。这才是珀尔干预模型的精髓,中间这个没有do的公式叫做观察,而右边这个有do的公式才叫干预。

那怎么干预?就是你得随机抽取人群,这里面有吸烟的,也有不吸烟的,你作为实验人员不是按照吸烟或不吸烟来划分人群了,而是你得主动地去干预,你得do something,也就是随机把人群分成两组,然后强行告诉第一组说,你们从今以后,必须给我吸烟,强制要求他们都吸烟,以及强行告诉第二组说,你们从今以后一根烟都不能抽,强制都不能抽烟。然后再对比,干预过的两组,他们分别得肺癌的概率分布有什么差别。你这样得出来的概率,才排除掉了混杂因子,才能干干净净地考察X与Y之间是否具有因果关系。

当然,强制让受试抽烟,这种实验肯定是没法做的,我这里就是为了让大家理解这个干预模型拿这个例子来说事儿。我们可以再举个例子。我们要考察名校学历对人40岁时候的收入的影响,现在都说要考上个985双一流大学,说是上不了名校的话,毕业以后薪资待遇就很低,真的是这样的吗?我们就来考察一下其中的因果关系。

Image

这时候你就不能停留在观察层面——把人群分成上过985双一流的人为一组,以及上的是什么民本双非的人为另一组,然后对比他们40岁时候的收入,这样你就没有排除掉混杂因子,因为可能你得出上名校的人收入更高的结论,是因为有这么一个混杂因子Z,比如说,家庭条件好,家庭条件的人更容易上名校,以及家庭条件好的人更容易找到收入高的工作。你得排除掉这些混杂因子,单纯看收入和名校学历之间的关系。所以,你得干预,你得do something,那就是随机抽取一帮高三毕业生,不管他们的智商、家庭条件以及长得是否好看,随机把他们分成两组,一组人为让他们上名校,另一组人为不让他们上名校,然后再看他们40岁时候的收入,是否有显著的差异。这样经过干预才能真正捋清名校和收入之间的因果关系。

总之,这个干预模型的核心精髓,就是你得主动地去干预,而不是被动地观察,被动观察只能得到相关关系,而只有主动干预,才能排除混杂因子,得出干净的因果关系。现在我们回过头来看珀尔对因果关系下的定义,就一目了然了,这个定义就是,如果你人为地对X做一个干预动作,导致了Y的概率分布发生了改变,那么X就是Y的原因。

因果关系的定义

P(Y|do(X=x)) ≠ P(Y)

当然,珀尔的这个定义或者干预模型,算出来的都是概率分布,这其中就牵涉到很多统计学的东西了,我们这里就不必细说了。总之,这个数学化的干预模型,它能算出具体的概率分布,这就比刘易斯简单的一句If not A, then not B,更具实操性,可以用来做实验了。

珀尔作为一名计算机科学家,他的一大努力就是教会机器理解因果关系,在珀尔的干预模型的基础之上,珀尔进一步把他的因果模型函数化、算法化,提出了结构方程模型(Structural Equation Model),用来明确表示一个变量是如何由其原因决定的。我们知道,著名的「贝叶斯网络」就是珀尔提出并引入人工智能领域的。在贝叶斯网络中,节点之间的箭头主要表示条件概率之间的依赖关系,而珀尔的结构方程模型进一步给这些箭头赋予了因果含义。其中,Xi就是系统中的一个变量;PAi是Xi的直接因变量,也就是所谓的「父变量」(parents);Ui代表背景噪音或其他无法观察的因素。

结构方程模型

Xi=fi(PAi,Ui)

这对于人工智能来说,这种因果模型尤其有用。因为主流的传统机器学习模型主要擅长发现相关性,但是,不能理解因果的机器,并不能真正理解这个世界是如何运作的。正是在这个意义上,虽然珀尔是主流传统机器学习人工智能的奠基人之一,珀尔现在也是主流的、基于大数据统计的人工智能的激烈批评者,他认为现在主流的人工智能只停留在我们之前说的观察的层级,只能理解相关性。而珀尔干的事情就是想让AI获得真正的智能,那就是能够理解因果关系的AI,而一种可以算法化的因果模型可以帮助AI理解干预与结果之间的联系,做出比如这样的推理「如果我做了X,会导致Y吗?」那这种能够理解因果关系的AI,对于机器做出规划、决策、诊断、自动驾驶等任务都非常关键。总之,珀尔真的是想教会机器理解因果关系啊!

说到这儿,大家可以回想回想康德的因果观,在康德那里,因果性是人的认知结构中的认知范畴,是人类心灵在认识世界的时候的一套认知加工的程序,而到了珀尔这里,珀尔则是想要把康德所说的这套人类独有的认知加工程序提取出来,把它形式化,算法化,把它写成代码,并教会机器,让机器也能像人一样能够理解因果。一个能够理解因果的机器,在珀尔看来,某种意义上也就具有的自由意志。什么是自由意志呢,人当然是具有自由意志的,在珀尔看来,人的自由意志的根源,恰恰就在人具备建立反事实推理的能力。也就是说,我们人无论实际上做了什么事情,但我们总可以设想:我本可以做出不同的选择,如果我不这么做,事情会变成怎样?这也就是刘易斯说的if not A then not B的反事实推理。在珀尔看来,人正是因为具有的这样反事实推理的能力,因而具备了自由意志,人总是可以设想另一种可能性的。而珀尔已经把刘易斯的反事实推理进一步形式化为干预模型和SEM结构方程模型,也就是说,自由意志也是可以形式化、算法化,也是可以写成代码教给机器的。一个拥有的自由意志的机器能够理解反事实问题,比如自动驾驶汽车做出一个向左转决策,它同时也可以评估「如果我右转了,是否更安全?」当机器学会思考「我本可以做出不同选择」,当机器也学会设想另一种可能性的时候,机器也就拥有了自由意志。

介绍完朱迪亚·珀尔的因果模型以及他的因果观,接下来,我们进入本期因果关系研讨会的会议总结。