因果森林:当机器学习遇上计量经济学
在很长一段时间里,统计学界和机器学习界像是两个老死不相往来的邻居。统计学家和计量经济学家坐在这一头,他们痴迷于因果推断,想要知道如果改变某项政策,经济指标会怎么变。他们极其看重模型的解释性和偏差的消除,哪怕为此牺牲模型的拟合能力。而计算机系的机器学习专家坐在那一头,他们痴迷于预测,想要通过海量特征去精准预测未来的结果。他们往往不在乎模型内部是不是黑箱,只要预测得准就行。
直到斯坦福大学的苏珊·阿西和诺贝尔奖得主吉多·因本斯等人的出现,这两个世界开始融合。这场被称为因果革命的浪潮,核心任务只有一个:将机器学习强大的非线性拟合能力,引入到严谨的计量经济学框架中,从而让我们不仅能预测未来,更能精准地干预未来。
为了真正读懂这场革命,我们需要先从最基础的工具,也就是树和森林讲起,再逐步深入到那四个里程碑式的节点。
一、基础概念:从树木到森林的隐喻
在深入算法之前,我们先来解决几个听起来很形象、但往往被误解的基础概念。
首先是树和叶子。在计算机科学中,决策树模型借鉴了自然界树木的结构,但做了一个有趣的倒置:它是一棵根在上、叶在下的树。数据的起点被称为根节点,代表了所有的样本。随着模型不断地问问题,比如年龄大于30岁吗,或者收入高于平均值吗,数据就会顺着树枝分叉流向不同的方向。
那么,什么叫叶子节点?它指的是树生长的终点,也就是那些不再分叉的末端节点。你可以把叶子节点想象成一个个最终的容器或桶。经过层层筛选,样本最终会掉进某一个特定的桶里。在传统的预测任务中,我们用这个桶里所有样本的平均值来代表预测结果。
但这并不完美,因为一棵树太容易受样本波动的影响了,也就是所谓的过拟合。为了解决这个问题,2001年 Leo Breiman 提出了随机森林。之所以叫森林,是因为它由成千上百棵树组成,独木不成林,通过让众多的树一起投票,错误的预测会相互抵消,结果就会变得非常稳定。而之所以叫随机,是因为为了保证每棵树都有独立的观点,算法强制引入了随机性:每棵树只能看到一部分样本,且在做决策时只能看到一部分特征。这种强制的多样性,成就了机器学习历史上最强大的算法之一。
后来,阿西等人将这种思想移植到了因果推断领域,便有了因果森林。它之所以改名,是因为目标变了:随机森林是为了预测结果数值,比如预测房价;而因果森林是为了预测因果效应,比如预测修路对房价具体提升了多少。
二、因果革命的四大里程碑节点
理解了基础工具,我们就可以看懂这场因果革命是如何一步步发生的。
节点一:因果树 (2016) 重塑分裂标准与诚实性原则
2016年,阿西和因本斯在 PNAS 上发表论文,指出了直接用传统的机器学习树去切分因果效应是错误的。
传统的树是为了预测结果设计的。比如,它会把病情严重程度作为分裂标准,因为这最能预测病人会不会死亡。但在因果推断中,我们关心的是治疗效应,即吃药和不吃药的差别。因此,因果树修改了树的生长规则:它不再追求让叶子节点里的结果最纯净(方差最小),而是追求让叶子节点之间的治疗效应差异最大。例如,它可能会发现基因型是比病情更好的分裂特征,因为它能把吃药有效的人和吃药无效的人区分开。
更重要的是,这篇论文提出了一个极具哲学意味的概念,叫诚实性原则。在传统机器学习中,我们习惯用同一份数据去训练模型和估计数值,这在因果推断中会导致严重的偏差,你会不自觉地挑选出那些偶然表现好的数据,从而高估药效。
所谓的诚实性原则,就是把训练集随机一分为二。第一半数据专门用来建立树的结构,决定在哪里分叉,这叫建树;第二半数据则专门扔进建好的树里,统计落入每个叶子节点的样本的治疗效应,作为最终估值,这叫估值。虽然这样做让样本量减半、方差变大了,但它彻底消除了自卖自夸的选择偏差,确保了结果的统计学严谨性。
节点二:双重机器学习 (DML, 2018) 驯服高维干扰
如果说因果树解决了异质性问题,那么 DML 解决的就是著名的混杂因素问题。当我们想研究某个核心变量,例如价格对销量的影响时,往往面临成百上千个干扰变量,如广告、季节、宏观经济等。
传统的线性回归处理不了这么多变量,而直接把所有变量扔进机器学习模型又会因为正则化导致对核心变量的估计产生偏差。
切尔诺祖科夫等人提出的 DML 复活了1988年罗宾逊的残差回归思想,并将其现代化。其核心逻辑分为三步:首先,用任意强大的机器学习模型(如神经网络)通过干扰变量来预测结果变量,算出预测不准的残差;其次,再用机器学习模型通过干扰变量来预测核心变量,算出核心变量中无法被干扰变量解释的残差;最后,只把这两个残差拿来进行回归分析。
这背后有一个高深的数学原理叫 Neyman 正交化。通俗地讲,这种方法把干扰项带来的噪音与我们需要研究的信号从数学上垂直隔离开来了。这意味着,哪怕我们在第一步和第二步中用机器学习去拟合干扰项时有一些误差,这些误差也不会传递到最后一步,从而保证了我们对因果效应的估计是无偏且稳健的。它让我们可以放心地使用黑箱模型去处理复杂的干扰,同时得到像线性回归一样清晰的因果结论。
节点三:因果森林 (2018/2019) 点亮置信区间
单棵的因果树虽然诚实,但它的预测往往是锯齿状的,不够平滑,且方差很大。于是,Wager 和阿西将其扩展成了森林。
这一节点最伟大的贡献并非仅仅是把树变成了森林,而是解决了机器学习在科学界应用的一个痛点:缺乏统计推断。以前的机器学习只能告诉你预测值是 0.5,但不能告诉你这个预测有多靠谱。
Wager 和阿西完成了高难度的数学证明。他们证明了,只要满足包括诚实性原则在内的一系列条件,因果森林产生的预测值,随着样本量的增加,在数学上是服从渐近正态分布的。
这意味着什么?这意味着我们终于可以给机器学习的预测结果画上置信区间了。我们可以自信地说:针对这类用户,打折促销带来的增量收益是 10 元,且我们有 95% 的把握这个数值在 8 元到 12 元之间。对于医疗审批或公共政策制定来说,这种包含不确定性量化的结论,远比一个单纯的预测点值要有价值得多。
节点四:广义随机森林 (GRF, 2019) 万法归一
到了2019年,阿西等人发现,因果森林其实只是一个更大框架的特例。他们提出了广义随机森林 GRF,试图一统江湖。
他们视角的转变非常精彩:他们认为,随机森林本质上不是一个预测器,而是一个加权器。森林的作用,就是根据数据的特征,计算出训练样本中哪些人和目标样本最相似。如果两棵树甚至一百棵树都把样本 A 和目标样本 B 分到了同一个叶子节点里,说明它们极其相似,那么样本 A 的权重就很大。
GRF 提出了一套通用框架:只要你的经济学问题能写成局部矩方程,无论是分位数回归、工具变量回归,还是因果推断,都可以用这一套逻辑来解。第一步,用森林算出每个样本的权重;第二步,利用这些权重解方程。这极大地扩展了机器学习在经济学中的应用边界,不再需要为每一个新问题重新发明一种森林算法。
三、总结:机器学习与统计学的完美分工
纵观这四个节点,我们可以清晰地看到机器学习与统计学是如何在这里结合的。它们就像是猎犬与法官的关系。
机器学习扮演的是猎犬的角色。它利用其强大的、灵活的、非线性的拟合能力,去处理那些高维的数据,去挖掘数据中复杂的异质性结构,去把干扰变量造成的噪音剔除干净。它负责干那些最脏、最累、最复杂的活。
而统计学扮演的是法官的角色。它制定了诚实性的规则,设计了正交化的策略,并提供了渐近正态性的理论保证。它负责确保猎犬找回来的东西是可信的,是可以经得起推敲的,并给出一个明确的误差范围。
这就是因果革命的精髓:用机器学习的蛮力,干统计学的精细活。这不仅让计量经济学变得更强大,也让机器学习真正具备了指导决策的智慧。