冲击多巴胺经典理论:神经科学如何重新认识这种“愉悦化学物质”|《自然》长文
本篇《自然》长文共6206字,干货满满,预计阅读时间19分钟,时间不够建议可以先“浮窗”或者收藏哦。
原文作者:David Adam
长期以来,多巴胺被视为大脑中奖赏机制的裁判;但新的发现可能颠覆这一关于多巴胺功能的经典理论。
动画来源:Fabio Buonocore
今年的5月,神经科学家在西班牙塞维利亚参加多巴胺学会(Dopamine Society)的年会,其中有一场讨论可能格外激烈。第31场会议将安排一场辩论,双方研究者在多巴胺在大脑中究竟扮演什么角色这一问题上存在根本分歧。
多巴胺是一种研究极为充分的神经递质(一类在细胞之间传递信号的化学物质)。在神经科学之外,多巴胺也广为人知,常被称为“愉悦化学物质”,被描绘成人们从娱乐性药物或浏览社交媒体中获得的奖赏快感。
研究者一致认为,这种说法大为简化了多巴胺的作用。但除此之外,分歧正在扩大。过去曾有一个简单模型解释多巴胺如何在大脑中发挥作用;如今,一些挑战者试图修正这一理论,甚至彻底推翻它。
这不仅关系到基础神经科学,也关系到临床医生如何解释并治疗注意缺陷多动障碍(ADHD)和成瘾等疾病。如果这个模型是错的,或者需要修正,那么人们关于这些障碍成因以及治疗方式的一些假设,也可能随之改变。
被称为奖赏预测误差(reward prediction error,RPE)假说的经典观点认为,大脑中的多巴胺爆发会把刺激与奖赏联系起来,帮助强化满足动物或人类需求的关联。几十年来,这一模型主导并引领着该领域的研究,为解释动物实验数据提供了一个数学框架,也能很好地解释行为。
对于难以用简单理论套用到大脑复杂性的研究者而言,这是一种难得的宝贵工具。英国诺丁汉大学的神经科学家Mark Humphries说:“多巴胺是神经科学中唯一一个我们拥有计算模型、能够解释信号是什么以及它在计算什么的领域。”业内人士知道,RPE模型中涉及的一些假设是简化了的。但作为对大脑某部分的有效理解,它曾被视为重大进展。
过去几年,这种主导地位开始动摇。大约十年前,一些实验技术出现,使研究人员更容易在动物实验中监测神经元释放多巴胺。这使整个领域迅速扩展,更多实验室能够收集并分析数据。许多研究数据表明,多巴胺在大脑中的功能远远不止奖赏,还可能参与注意、工作记忆,甚至社会行为等认知功能。另一些研究显示,多巴胺神经元会对新刺激、威胁和运动作出反应。Humphries说,原有模型已不足以解释这一切。
于是,该领域正面对一个问题,塞维利亚第31场会议的讨论亦会涉及:这是否就是神经科学中备受珍视的模型之终结?或者,这一理念以及临床医生用于理解ADHD、精神分裂症和成瘾的改编版本,如今已经牵连过广,大而不倒?阿拉巴马大学伯明翰分校的神经科学家Kauê Costa说:“我确实认为这个框架是不够充分的。但你知道,若要刺王杀驾,最好别拖泥带水。”
预测奖赏
奖赏预测的思想源自20世纪俄国心理学家伊凡·巴甫洛夫(Ivan Pavlov)的著名实验。他提出经典条件反射概念,证明狗会学会把环境线索与食物预期联系起来。这一原则启发了20世纪60年代试图发展机器学习理论的计算机科学家,并在20世纪90年代被用于设计神经网络。
培养皿中,多巴胺神经元(绿色)与其他成熟神经元(红色)共同生长。每个细胞核中的 DNA 显示为蓝色。来源:Jian Feng
1997年,神经科学家复用这一概念解释一项灵长类动物实验的数据[1]。Wolfram Schultz(现就职于英国剑桥大学)和同事展示了猴子学会期待奖赏时,脑深部多巴胺神经元活动如何发生转移。起初,当动物意外得到果汁时,这些神经元会被激活并释放多巴胺。随后,实验者在果汁到来前先亮灯,结果发现,此后触发多巴胺神经元的是灯光(奖赏的预示信号),而不是果汁。如果猴子预期会有果汁却没有得到,多巴胺神经元放电率会出现一次向下的波动。
RPE假说认为,多巴胺信号能让大脑随着时间推移,更好地估计奖赏——食物、伴侣、安全地点——可能来自哪里。
普林斯顿大学的神经科学家Nathaniel Daw称此为“计算神经科学的璀璨明星”。该理论把单个神经元活动的爆发与复杂行为联系起来。他说:“这套理论从尖峰放电和突触一路连到行为与成瘾,而且颇有说服力。”
该理论的支持者认为,从本质上说,多巴胺激增传递的是“价值”信号:它提供关于某个物体、行动或结果的主观价值、吸引力或用途的信息,并帮助动物决定优先事项。在经典例子中,孩子第一次听到冰淇淋车的铃声,随后得到冰淇淋,会感到惊喜。这个意外奖赏的价值会使释放多巴胺的神经元活动激增。反复经历之后,这种价值以及多巴胺激增完全转变为与铃声相关;奖赏变得符合预期,因此没有误差,也就没有信号。如果某一天孩子听到铃声却没有得到冰淇淋,就会产生负向RPE,即活动受到抑制,从而削弱这种关联(见“经典奖赏理论”)。随着时间推移,这种关联会加强某些神经元之间的连接,并重塑神经通路。
几十年来,研究者把RPE理论加以扩展,用它探索大脑如何学习并储存对奖赏以外许多事物的预测方式。这个更广泛概念被称为时间差异强化学习(temporal difference reinforcement learning,TDRL)。它利用预测价值与实际价值随时间产生的差异来更新预测、优化行动,以扩大未来收益。大量实验数据支持TDRL理论。但过去几年,也出现了一批高影响力论文,拓展了这一简单图景。
一些研究考察了多巴胺神经元的亚群,发现其中许多神经元除了传递奖赏信号,还会编码非奖赏变量。例如,有些神经元也会对动物在迷宫中的位置或速度作出反应[2]。还有一些似乎编码的是动物当前运动使其更接近还是远离目标,而不是目标本身的价值[3]。
另一些工作拓展了更多多巴胺功能。多巴胺信号可以同时编码多个潜在奖赏,并帮助动物在其中进行优先排序[4]。例如,当鸣禽口渴时,多巴胺反应可偏向水;但当附近出现潜在配偶时,它又会重新调整为优先歌唱——不过这些神经元如何改变其调谐方式仍不清楚。
多巴胺的经典理论认为,它传递奖赏预测误差,但新的发现正在挑战这一观点。2025年一项研究提出[5],多巴胺也参与预测行为,并由此促进重复行为。这意味着重复行为或成瘾习惯未必是RPE的结果。同样,研究也观察到多巴胺会传递关于威胁[6]、厌恶性刺激[7]和刺激新奇性的预测信号[8],而不只是奖赏。
这些发现提出的问题归根结底是:该领域是否应该停止不断修补和扩展现有模型来解释新的数据,而是转向“采用具有不同基本假设的别类模型”?约翰斯·霍普金斯大学医学院神经科学家Geoffrey Schoenbaum主持了塞维利亚的这场会议。他说:“在经历一段明显的主导期后,RPE假说正在显露老态。”
推翻国王
范德比尔特大学的药理学家Erin Calipari,是迫切想要削弱多巴胺与奖赏之间联系的神经科学家之一。她认为,多巴胺应被置于更广阔的视角下理解,它是大脑引导并促进信息处理和学习的一种方式。但她发现很难发表这一观点的论文。
2021年,Calipari刚成为独立的课题负责人,正在组建自己的实验室,并准备发表首批论文之一。该研究显示,小鼠在遭遇压力性刺激时,例如足部受到轻微电击,会释放多巴胺[7]。这个结果无法用奖赏解释,并遭到审稿人的强烈阻力,他们要求增加进一步实验,其中一些实验旨在生成与奖赏相关的数据。她说:“人们对此非常愤怒。简直是狂风暴雨。”
对RPE王冠的一个直接挑战来自加州大学旧金山分校神经科学家Vijay Mohan Namboodiri。他提出了一个替代模型,基本上与RPE相反。RPE认为,动物先看到线索,随后把它与奖赏联系起来;而Namboodiri认为,过程恰恰相反:动物经历奖赏后,会及时回溯,识别导致奖赏的线索。
他的团队用小鼠做了多项测试,试图区分这种回溯式学习与原始RPE理论[9]。例如,研究人员随机给未经训练的小鼠提供糖水奖赏。RPE理论预测,小鼠刚开始的多巴胺反应应当很高,随后会随着它们学会奖赏有时会出现而下降。但Namboodiri推断,如果动物是在回顾过去寻找线索,那么多巴胺应随着反复经历奖赏而增加,因为它发出的信号是这些事件具有意义,并启动记忆搜索以发现导致它们的原因。测试结果支持了他的理论。他将其称为因果关系的调整净偶然性模型(adjusted net contingency for causal relations,ANCCR)。
Namboodiri认为,这种回溯式学习更符合直觉。通常情况下,人们通过获得奖赏然后回头寻找原因来学习,而不是追踪环境中的每一个细节,并观察它们如何对应于后来才得到的奖赏。
人们对他的想法反响不一。Humphries说:“我还没遇到过真正理解这个模型的人。我们为此专门进行了一次期刊讨论。”
但Namboodiri表示,如果科学家把多巴胺在学习中的作用方向理解反了,那可能对治疗脑部疾病产生临床影响。例如,这可以解释成瘾为何如此难以治疗。
他指出,成瘾复发的一个主要原因,是人们接触到过去曾与药物配对的线索。“如果我已经戒烟了,那么每次我看到别人吸烟,那都会成为一个让我去吸烟的提示。”他说,TDRL模型无法解释这一点。该模型预测,每当一个已经戒烟的人看到别人吸烟而自己没有点烟时,负向预测误差都应削弱这种关联。
他说,根据ANCCR的看法,这种关联之所以保留,是因为如果有意义的事件是你吸烟,那么多巴胺释放会促使你的大脑向过去寻找解释性线索。“而你过去已经见过,每当你获得尼古丁时,你看到了别人吸烟,对吧?所以这种回溯的关联可以说是百分之百的。”如果这一点成立,它将支持许多戒烟者反复失败的经验:即使多次保持克制,也不足以抹去那段记忆。
挑战现状
Humphries说,批评RPE/TDRL模型的一个复杂之处在于,自该理论提出以来的30年里,它已沿着许多不同方向被修订,常常是为了回应具体批评。“我们所说的那个模型已经碎裂成许多模型。”他说。对Namboodiri这样的批评者而言,这使目标难以聚焦,也使TDRL理论难以证伪。
这个问题的一个例子是关于动物如何预期奖赏:大约十年前,实验显示,即便小鼠已经学会某个线索预示奖赏,多巴胺释放仍会随着它们接近奖赏而逐渐增加。然而经典TDRL模型预测,多巴胺爆发应完全转移到提示上;这种逐渐上升的信号与RPE并不一致。
随后涌现出一批论文,论证经典TDRL模型其实可以整合多巴胺递增现象,关键在于科学家需重新设想动物如何理解世界:如果动物在“提示”与“奖励”之间感受到的是一连串连续时刻,而不是一次巨大的状态改变,那么随着时间上越来越接近奖励,动物对其赋予更高价值,由此便产生了这种逐渐增强的信号。
哈佛大学神经科学家Samuel Gershman认为,这是合理的方法。他从机器学习中借用了RPE概念,并用它改造经典 TDRL模型,以容纳多巴胺递增现象[10]。他说:“我认为重要的是,这些修改并非纯粹是临时拼凑的,比如‘我要调整理论中的某个数字,好让它匹配数据’。”
霍华德·休斯医学研究所珍妮利亚研究园区(Howard Hughes Medical Institute’s Janelia Research Campus)的神经科学家Josh Dudman说,对经典模型的挑战日益增加。这是因为科学家如今能在更多情境下,更精确地测量多巴胺神经元的活动;这些神经元位于大脑深部,过去很难触及。他说,大约十年前,科学家开始能够把基因编码传感器植入多巴胺神经元,并用光纤测量其活动。“突然之间,你可以在各种情境中测量多巴胺了。”Dudman说,“于是我们开始看到一堆例外,以及模型不再那么好用的地方。”
在Calipari看来,追问多巴胺可能在大脑中执行哪些孤立功能,本身就是错误的问题。她认为,多巴胺的作用是让其他神经系统更高效地运转,帮助它们强化与任务相关的活动,并更快作出决策。“所以,我认为无论你研究什么,多巴胺都参与其中。”
她说,当一个简单数学模型应用于人脑时,其适用性会瓦解。“我并不认为是这些模型不好。”她说,“问题在于,人们会固守着原本只为解释某些细微数据而建立的模型,并用它来解释整个大脑。”
《自然》联系到的该领域每位研究者都同意,新数据正在对 TDRL构成日益严峻的挑战,但他们对这意味着什么看法不一。明尼苏达大学明尼阿波利斯分校的神经科学家David Redish说:“我们正在开始认识到多巴胺的复杂性。但我还不打算就此全盘否定。”
包括Dudman在内的另一些人则更乐于考虑替代方案。他说:“我非常愿意接受这样一种想法:也许我们应该尝试完全不同的东西。但我知道,许多在会议上和我争论的同事对此感到不安。”
参考文献:
Schultz, W., Dayan, P. & Montague, P. R. Science 275, 1593–1599 (1997).
Engelhard, B. et al. Nature 570, 509–513 (2019).
Brown, E. H. et al. Nature https://doi.org/10.1038/s41586-025-10083-1 (2026).
Roeser, A. et al. Nature 623, 375–380 (2023).
Greenstreet, F. et al. Nature 643, 1333–1342 (2025).
Menegas, W., Akiti, K., Amo, R., Uchida, N. & Watabe-Uchida, M. Nature Neurosci. 21, 1421–1430 (2018).
Kutlu, M. G. et al. Curr. Biol. 31, 4748–4761 (2021).
Kutlu, M. G. et al. Nature Neurosci. 25, 1071–1081 (2022).
Jeong, H. et al. Science 378, eabq6740 (2022).
Gershman, S. Neural Comput. 26, 467–471 (2014).
原文以Dopamine takes a hit: how neuroscience is rethinking the ‘feel-good’ chemical标题发表在2026年3月17日《自然》的新闻特写版块上
© nature
Doi:10.1038/d41586-026-00836-x
点击阅读原文查看英文原文
眼睛就看得懂的研究,就在视频号
往期精彩文章
版权声明:
本文由施普林格·自然上海办公室负责翻译。中文内容仅供参考,一切内容以英文原版为准。欢迎转发至朋友圈,如需转载,请邮件[email protected]。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。
© 2026 Springer Nature Limited. All Rights Reserved
星标我们🌟,喜欢就点亮小爱心哦!