研究不是天赋,是手艺
作者:Vivek Nair,Anthropic 研究员。原文 2025 年发在 X,520 万阅读。本文是对原文的解读与延伸,不替代原文。
你是什么时候发现自己"不会做研究"的?
我猜不是拿到学位的时候。是某个深夜,你盯着屏幕上的实验结果,突然意识到你根本不知道为什么做这个实验。选题是导师给的,方向是跟大实验室的,方法是从 arXiv 热门论文里抄的。每件事单独看都对,合在一起就是——你从来不知道自己为什么要做这个。
Vivek Nair 把这种状态命名为"absorbed problem"——吸收来的问题。你知道一个著名实验室在关注某个方向,但不知道为什么,不知道他们期望发现什么,更不知道什么情况他们会放弃。当他们转向时,你一年后才发现。
这篇文章最刺人的一句话:"大多数人学的不是做研究,而是看起来像个研究者。"
研究手艺七项核心原则
● ● ●
品味不是天赋,是肌肉
Vivek 把研究能力拆成了一组小的、可训练的技能。选题、阅读、写作、实验循环、失败分析——每一项都有具体的方法,每一项都能练。
其中最打动我的是对"品味"的拆解。
品味通常被讨论得像天赋——你有,或者你没有。Vivek 认为它更像肌肉。他的训练方法很简单:
- 01每次跑实验前先预测结果。 把预测写下来,跑完对照。
- 02遮住论文的结果部分,从方法推数字。 推完再看作者的真实结果。
- 03标记本月哪些成果两年后还会重要。 两年后检查命中率。
"一次预测加一次修正,重复几百次——好模型都是这么训出来的。你脑子里的那个也不例外。"
说白了:品味不是神秘的审美直觉,是大量反馈循环练出来的模式识别。 预测得越多、修正得越多,你脑子里那个"什么方向值得做"的分类器就越准。
● ● ●
输入决定输出
Vivek 对信息获取的观点可能是整篇文章里最反常识的:共享的阅读列表产生共享的想法。
如果你的信息食谱是 arXiv 热门榜加群聊筛选的残留,你会在同一时间得出和所有人一样的结论——这让那些结论价值约等于零。
他提出的替代方案出人意料:读旧材料。
- MoE(Mixture of Experts)追溯到 1991 年
- LSTM 追溯到 1997 年
- 反向传播 1986 年进入主流
Rich Sutton 2019 年用约一千字写了 The Bitter Lesson,预测领域走向比十倍的综述更准。Claude Shannon 1952 年的创造性思维讲座——"把问题缩小到近乎平凡,解决小版本,再逐步加回难度"——比大多数当代方法论建议更有用。
这不是叫你"多读经典"。它是一条具体的策略:当一个领域以惊人的速度重演自己的历史时,最便宜的竞争优势就是比同行早三十年知道答案。
● ● ●
写作是最便宜的思考校验
Paul Graham 有个著名观察:一个想法在落笔之前感觉是完全成型的。白纸会暴露大脑覆盖的漏洞——未测试的假设、不连贯的步骤、暗中矛盾的两个主张。
Feynman 说得更狠:"你最需要避免愚弄的人就是你自己——因为你是最容易的目标。写作是有史以来最便宜的防御。"
Vivek 提出了达尔文的"程序性诚实"——达尔文会立即写下任何不利于自己理论的事实,因为记忆优先删除不方便的证据。你的记忆对你的失败实验也会做同样的事。
他建议的研究日志格式值得直接抄:假设 → 设置 → 期望 → 结果 → 更新后的信念。 六个月后重读,它会让你比任何审稿人都更谦卑。
还有一个被忽略的价值:公开发表一部分。 Olah 和 Carter 在 Research Debt 里指出,清晰的解释本身就是真正的贡献。可解释性领域很多人是通过博客文章而非会议论文接触这个方向的。公开写作是一个无法伪造的思维样本——一种比简历更强的凭证。
● ● ●
研究速度 = 你发现自己错了的速度
关于 Alec Radford 的故事很少涉及单次天才闪念。通常关于数量——每天更多跑数,每周丢弃更多错误想法,现实模型比任何人都更新得快。
这句话值得反复读:研究的速度,主要取决于你发现自己的错误有多快。
这就是为什么 Vivek 把"工具化"定义为一级研究活动:
- 启动运行:一条命令
- 画图:再一条命令
- 每次实验从配置文件可复现
- 比较两次运行应该只要几秒,而不是一个下午的考古挖掘
Karpathy 有个经典配方:大规模训练前先在单个 batch 上过拟合——30 秒干掉一半 bug。策略就是把一切缩小到便宜的程度,搞对,再砸算力。
研究反馈循环
还有一个容易忽视的点:工程不是低人一等。 在前沿,能自己搭 harness、eval 系统和数据管线的研究者,就是那个假说能被实际测试的人。其他人都在排队等。
● ● ●
盯住输出,不是 loss 曲线
一条下降的 loss 曲线是安慰剂,不是分析。实验释放的信息远比我们消费的多——失败案例、尾部分布、日志——大多数死在日志里。
Vivek 引了两个经典方法:
- Karpathy 做预训练时的一个步骤: 花几小时手工检查原始数据。大多数 ML bug 是静默数据问题——你得到一个平庸的模型,和一个关于原因完全错误的理论。
- Andrew Ng 的经典技巧: 挑 100 个失败案例,分类,聚焦最大的一类。对模型和评估都有效。
"如果你从没读过 benchmark 测试的原始文本,你并不真正理解那个 benchmark。"
一个真正奇怪的行为记录,比多一位小数点的 accuracy 更有教育价值。
● ● ●
有目的地游荡,但不乱跑
你的第一个子领域很大程度上是时机问题——接受它。在大脑深度专精于某个方向之前,在可解释性、评估、RL、系统工程上都投入真正的精力。你的独特技能组合会在某处变成不平等的竞争优势。
Karpathy 区分了"内循环"和"外循环":
- 内循环:解决问题。跑实验、调参、改代码。
- 外循环:决定什么问题值得解决。选题、判断方向、识别信号。
大多数人只在内循环上用力。PhD 真正有价值的是花在外循环上的时间。
内循环与外循环
● ● ●
复利:每天微不足道的边际增益
文章收尾的这段话可能是整篇里最治愈的:
"知识和生产力像利息一样复利。每天的边际增益单独看微不足道——你读的、你记录的、你的循环速度、你和谁争论。给它们几年,它们会产生从外部看起来像运气的职业生涯。"
具体行动很简单:复现别人的工作并公开发表发现。开源自己的工具。用简单语言解释复杂概念。回报来自侧面——几个月后的合作、引用、或一个你本来无法申请的职位。
● ● ●
诊断书,不是方法论
它厉害不是因为说了什么新东西——你读到的每条原则可能都在别处见过:Hamming 的选题、Feynman 的写作、Shannon 的问题缩放、Sutton 的 Bitter Lesson。
它厉害是因为把这些分散的智慧精准拼成了一个可操作的框架。 开篇第一刀切在最痛的地方——"你学的是表演研究,不是做研究"——然后逐一拆解表演和真做之间的差距。每个差距对应一个可训练的技能。
文章的诚实度也罕见。"工具化是一级研究活动"正面冲突学术圈"写代码是脏活"的隐性文化。"旧材料被严重低估"在一个只刷 arXiv 新论文的行业里近乎反直觉,但 MoE/LSTM/backprop 三个例子摆在那里,你没法反驳——这个领域确实在循环重演自己的历史。
不用记哪条具体方法。记住那个底层信念就行:研究不是天选之子的游戏。是一组小技能,每条都能练。