“智商是先天还是后天?”——这个问题错在哪里?
我们先把一个非常容易被绕进去的问题拆开来看:当我们说一个性状"可遗传",又说它"被环境塑造",这两句话同时为真到底意味着什么。日常直觉会把这两件事当成两份蛋糕——基因切走一块,环境切走一块,加起来是整个结果。这种直觉在数学上有个名字,叫可加分解,写出来就是 outcome ≈ a·G + b·E:基因贡献一份主效应,环境贡献一份主效应,两者各管各的,最后拼在一起。绝大多数人讨论"先天后天"用的都是这个图像,绝大多数科普写作也默认它,连不少研究者口头表述里都隐含它。
问题是,有一整类基因,它根本不在主效应那一栏里出现。它管的不是"在平均环境下你会有多高的产出",而是"当环境变动一格,你的产出会跟着变多少"。用数学语言说,它编码的是 ∂outcome/∂E,是结果对环境的偏导,是斜率本身。把这种基因的作用方式推到极端,模型不再是 a·G + b·E,而是 outcome ≈ G·E:基因和环境相乘。在这个相乘的世界里发生了一件非常违反直觉的事——固定 G 不动,outcome 仍然可以从最低值一路拉到最高值,只要 E 在变。也就是说,知道一个人的 G,你无法预测他的 outcome 落在哪里;G 唯一能预测的,是他的 outcome 对 E 有多敏感、对环境的回应有多陡峭。基因不再设定结果的水平,它设定的是结果对环境的汇率。
这个区别听起来抽象,但它直接决定了我们最常用的那个统计量——遗传度 h²——会怎样系统性地骗我们。遗传度的定义是"群体中结果方差里可以归因于遗传主效应的比例",注意"主效应"三个字,那是它的命门。它是一个线性方差分解的产物:把总方差拆成 G 的方差、E 的方差、剩下的残差,残差里习惯性地塞进所有交互项 G×E,因为可加模型本来就装不下交互。结果就是:一个百分之百由基因决定、但只通过 G×E 通道起作用的可塑性参数——它是百分之百可遗传的——在 h² 的账本上贡献的份额接近于零,而它放大出来的所有那些跨环境的方差,会被一笔一笔记到环境名下。遗传度只能看见主效应;可塑性住在交互项里;于是越纯粹的、越纯净的可遗传可塑性,反而在表观遗传度上越隐形。这不是悖论,不是测量误差,不是样本不够大可以修正的瑕疵,而是方差分解这个工具本身定义出来的盲区——它的语法里没有给"汇率"留位置。我们之前那个收口的说法——"你遗传到的是把 nurture 换算成 outcome 的汇率"——就是在描述这件事;汇率是一个 G×E 项,h² 在结构上看不见它。
要让这件事再具体一点,可以借用心理学里"兰花儿童与蒲公英儿童"那个比方,对应的术语叫差异易感性(differential susceptibility)。兰花型的人可塑性高:在滋养、稳定、刺激充足的环境里,他们会绽放得比一般人更鲜艳;在贫瘠、混乱、忽视的环境里,他们也比一般人凋谢得更厉害。蒲公英型的人可塑性低:好坏环境对他们的影响都不大,他们顽强、稳定、对环境钝感。现在做个思想实验:你设计一项研究,所有被试都来自相对相似、条件不算极端的中产环境——环境的方差很窄。在这样的样本里,兰花和蒲公英的最终结果差别并不大,因为环境本身没把他们的差异拉开。统计上你会得出"基因几乎不解释任何方差"的结论,遗传度几乎消失了。换一个研究,把环境跨度拉到很宽——从严重忽视到精心培养都纳入样本——同样这群人,兰花型的人在两端会出现夸张的分化,蒲公英型的人则稳稳地待在中间。这时候同一个基因的"遗传度"会突然爆出来,但它爆出来的形态是"环境敏感性"——基因在告诉你的不是你最终的位置,而是你被环境推动的幅度。同一个基因,在不同环境跨度的样本里测出完全不同的遗传度。这件事本身就是一个铁证:它住在交互项里,不住在主效应里。
讲清楚了这套机制,我们就可以处理那个最经典、最容易吵架、也最壮观的例子:智商。
智商的诡异在于它在两端同时极端。一方面,它的遗传度估计高得惊人——成人样本里常见的估计落在 0.5 到 0.8 之间,而且有一个反直觉的趋势:遗传度随年龄上升,童年比较低,到了成年期反而越来越高,这叫 Wilson 效应。另一方面,它对环境的敏感性也大得惊人——最有名的就是 Flynn 效应:整个二十世纪,全球各地的智商测验原始分数,平均每十年涨大约三分,几代人下来涨了整整一到两个标准差。这个涨幅是巨大的,大到如果你拿 1950 年的常模去测今天的人,今天的平均人会被划到当年的"高于平均"区间;反过来用今天的常模去测 1950 年的人,他们的平均分会落到偏低的位置。基因池在几十年里几乎没动,能解释这种漂移的只可能是环境——营养改善、教育普及、信息复杂度提高、抽象思维训练增多、围产期医疗进步,等等。
一个特质同时具备"高遗传度"和"被环境推得满地走",按照可加直觉这是一个矛盾,因为你既要说基因主宰、又要说环境主宰,听上去左右互搏。但放回到我们前面那个相乘模型里,这就不矛盾了,反而是签名特征——这正是"可遗传的可塑性"应该长成的样子,不是反例,是教科书例证。要把这件事说透,有三块拼图必须摆到位。
第一块,Wilson 效应背后藏着主动基因—环境相关(active rGE)。一般人听到"遗传度随年龄上升"会非常意外,因为直觉上你会觉得人活得越久、堆积的人生经验越多,环境的份额应该越来越大才对,怎么反而是基因越长越响?机制在于:到了一定年龄,一个人开始主动地选择、塑造、引出他周围的环境。一个天生认知倾向偏强的孩子,会比同龄人更喜欢读书、更被复杂的游戏吸引、更可能被老师注意到然后放进更难的班、更可能找到同样爱琢磨问题的朋友、长大后更可能进入需要持续学习的工作环境。每一步都不大,但每一步都让他的环境变得比同龄人更"高认知密度"。这是一个自我强化的级联:基因→选择→环境→反馈到能力→更强的选择倾向。从外面看,统计上你会发现"基因解释的方差越来越大",于是写在遗传度账上;但发生在底层的事情是,基因通过一连串环境的选择和塑造在间接作用。表面上记成遗传,骨子里是一个被基因驱动的环境级联。这跟依恋研究里那个 evocative rGE——孩子的气质引出大人的回应方式——是同一台机器,只是放在不同领域不同生命阶段上演。基因不仅在你体内表达,它还从你体内伸手出去,挑选和塑造它要面对的环境。
第二块拼图是 Scarr-Rowe 交互:智商的遗传度本身随社会经济地位变化。在贫困、资源匮乏的样本里,智商的遗传度低;在富裕、资源充足的样本里,智商的遗传度高。这正好是 G×E 的干净版本,几乎可以直接当作教科书插图。机制的方向是这样的:当环境严重匮乏——营养不足、慢性应激、教育资源差、稳定性低、刺激贫乏——这些环境因素本身就是主导变量,它们把所有人都压到了远低于其遗传潜能的位置,谁也表达不出来。环境像一个瓶颈,所有水都被卡在那里,看不出谁的管道更粗。当环境充足、不再是瓶颈,营养、教育、刺激这些基础供应都拉满之后,剩下的方差才轮到遗传倾向去解释——那时候不同的人在同样的丰沛环境里,分化出不同的发展轨迹,这种分化就是遗传度跳起来的地方。换一种说法:遗传潜能只有在环境允许的时候才表达,环境不允许的时候,再"好"的基因也只是潜在的可能性,不会变成可观测的结果。这句话逐字就是"可塑性基因把控制权交给环境"。所以那个常常被引用的"智商遗传度 0.7"并不是一个普适常数,而是一个在富裕样本里测出来的数,这个数字本身就是富裕环境的副产品;换一个贫困样本去测,你得到的是另一个数。这里有一个诚实的脚注必须加:Scarr-Rowe 在美国数据里是相对稳健的发现,但跨国复制的结果并不齐整,有的研究找到了,有的没找到,原因可能跟"贫困"在不同国家意味的具体短缺不一样有关。作为机制说明它依然很干净,作为普适经验规律就得保留余地。
第三块拼图是 Flynn 效应,它的功能是把前面两块的结论锁死。因为如果只有 Wilson 和 Scarr-Rowe,你还可以勉强用一些复杂的可加模型去拟合。但当你同时面对"高遗传度"和"几代人之间巨大的环境驱动涨幅"这两件事时,逻辑上唯一融贯的解释是:可遗传的不是水平,可遗传的是斜率,是对环境的敏感性。基因设定的是认知带宽对营养、对教育、对认知复杂度的响应曲线;二十世纪那一整套环境改善沿着这条响应曲线猛推,于是整代人的分数齐齐上扬。但是与此同时,个体之间的相对排序——同一代人之中谁更靠前、谁更靠后——基本保持不变,因为他们的响应斜率没变,环境是同方向地推着所有人。遗传度抓的恰恰就是这个排序的稳定性。水平由环境填进去,排序的敏感性由基因决定。这跟我们前面写的 outcome ≈ G·E 那个极端形式逐字对应:G 不预测 outcome 的水平,G 预测的是 outcome 对 E 的斜率。Flynn 效应不是来推翻智商遗传度的,它是来告诉你那个遗传度到底测的是什么——它测的是斜率分布的稳定性,不是水平分布的固定性。
把这三块拼图合在一起,智商就从"既遗传又环境的折中"——这种说法其实什么都没说清——变成了"可遗传的可塑性"的最完整范例。基因高度决定了你的认知有多吃环境,而把认知的实际水平交给营养、教育、认知刺激去填。这跟我们之前讲依恋时讲的那一套是同构的:你遗传的不是结果,你遗传的是把养育换算成结果的汇率。换一种养育,同一份基因会兑出完全不同的结果,但兑换的比率、兑换的敏感性、好环境放大多少、坏环境扣减多少,这些参数是从父母那里来的。
最后必须放一段必要的护栏,否则前面所有讨论都容易被错引到一个不属于它的层面上去。这一整套语言——h²、Flynn 效应、Scarr-Rowe 交互、差异易感性——全都是关于群体方差的语言,它们回答的问题是"在一群人里,结果的差异从哪里来"。它们不能用来回答"对某一个具体的人,他的某个结果有百分之多少来自基因、百分之多少来自环境"。这后一个问法在结构上就是病态的(ill-posed),因为在单个人身上,G 和 E 不是相加的两份贡献,而是相乘的一对参数:你不能问一块面积里宽和长各占百分之多少,你只能说宽和长一起决定面积。群体语言之所以能做加法,是因为在一群人之间你可以问"差异从哪里来",那是关于方差的统计问题;而在单一个体身上,没有"差异"可言,只有一个生成过程,那个生成过程本身就是相乘的、交互的、不可分解的。这一段护栏要时时记得,否则很容易把"高遗传度"误读成"这个人主要由基因决定",那是一个范畴错误,是把群体统计偷偷搬到了个体本体论上去,而这两层根本不在同一种语言里运作。
当一个基因管的是斜率而不是水平的时候,我们用来衡量"遗传的影响"的那把尺子会系统性地低估它;越纯粹的可塑性基因,越是被环境数据掩护起来,看起来反而像环境的功劳。智商之所以是这个机制最壮观的展示厅,是因为它把所有线索都摆出来了——高遗传度、年龄递增、随阶层变化的遗传度、跨代际的巨大环境涨幅——任意单独一条都可以被各种简化叙事吸收,但四条一起摆出来,可加直觉就破产了,只剩下相乘那条路。基因决定汇率,环境决定数额;最终的结果是这两者的乘积,而不是它们的和。