哈佛教授培养“纯AI博士生”,两周干完一年工作
加星标,才能不错过每日推送!方法见文末插图
人工智能(AI)是否有能力研究理论物理?在本篇特邀文章中,物理学教授Matthew Schwartz 决定通过指导Claude(一个人工智能大语言模型)完成一项真正的科研计算(涵盖从起始到结束的全过程)以探究这个问题,在此期间他本人从未亲手编辑过任何文件。这项工作始于2025年12月最后两周,论文于今年1月上传至arXiv,随后引发了物理学界的广泛关注。以下是他对该探索过程的详细记录。
我指导 Claude Opus 4.5 完成了一项真正的理论物理计算工作,通过文本提示词(prompt),将复杂的代码编写与数值运算过程成功“封装”在底层。 最终产出了一篇技术严谨、具有影响力的理论高能物理论文;整个过程仅耗时两周,而通常情况下完成这样的工作要以年为单位。 在历经 110 个独立的草稿版本、消耗 3600 万 token(词元)以及超过 40 小时的本地 CPU 计算后,Claude 证明了它的高效性、不知疲倦且极度讨好的能力。 Claude 的能力令人印象深刻,但也存在不够严谨(sloppy)的问题,因此我认为研究领域的专业知识对于评估其结果准确性仍至关重要。 人工智能目前尚无法完成端到端(全流程贯通式)的科学研究。但该项目证明,我可以通过创建一组提示词(prompt),引导 Claude 开展前沿科学研究。这在三个月前是无法实现的。 这可能是我写过的最重要的论文——并非因为物理内容本身,而是因为其研究方法。已经没有回头路了。
仅允许向Claude Code提供文本提示词。禁止直接编辑文件。 禁止将我个人的推导计算复制粘贴到对话框中。 但允许输入来自 Gemini 或 GPT 的计算结果,前提是这些结果也是通过纯文本提示词生成的。
不知疲倦的迭代:110 个版本的论文,数以百计的调试绘图,毫无怨言。
基础微积分与代数:建立积分、变量替换、函数展开、核对系数。 代码生成:生成 Python 绘图、Fortran 接口、Mathematica 脚本——全部运行正常。不再有 Python 版本冲突、缺少库或语法错误等烦恼。 文献综述:能够连贯地整合多篇论文的研究结果,并全面检索文献。但务必让 Claude 逐一核对参考文献中的作者、标题和期刊信息。
保持一贯的约定:当研究涉及非标准的物理约定(conventions)时,即便你强迫它记录并遵守这些约定,它仍会不断退回到教科书的默认设定。 诚信核查:它会在未实际检查的情况下声称“已验证”。你必须当面拆穿,并严厉追问:“你真的诚实地核查了所有内容吗?”或要求其“逐行验证每一个步骤”。虽然使用 Skills 功能和CLAUDE.md配置文件能有所改善,但仍显不足。 知道何时停止:它发现一个错误后就认为任务已完成并停止检索更多错误。你需要不断重复“再次检查”,直到它无法发现新问题为止。 保持目标:它只能处理小的步骤,并且容易失去方向。 图表审美:坐标轴标签、图例、字体和颜色等细节都需要人工进行微调,才能达到人类可读的标准。 抗压:如果我强迫它深入思考某个问题,一段时间后,它会倾向于直接给出我想要的答案,即便该答案缺乏论据支撑。
交叉验证(Cross-verification):让 GPT 检查 Claude 的工作,反之亦然。利用它们相互捕捉错误。对于最难的积分,由 GPT 求解后交由 Claude 整合。 树状结构(Tree structure):Claude 维护的是任务总结的分层体系,而非单一的长文档。比起需要记忆的内容,它在处理可查阅的内容时表现更佳。 明确的诚实性要求:在md 配置中,我写道:“严禁使用‘由此变为’或‘为了保持一致性’等短语来跳过步骤。要么展示计算过程,要么承认‘不知道’。” 重复要求:鉴于 Claude 发现一个错误后可能就停止检索,必须反复询问,直到它找不出更多错误。
注:本文封面图片来自版权图库,转载使用可能引发版权纠纷。
相关阅读
近期推荐
特 别 提 示
1. 进入『返朴』微信公众号底部菜单“精品专栏“,可查阅不同主题系列科普文章。
2.『返朴』提供按月检索文章功能。关注公众号,回复四位数组成的年份+月份,如“1903”,可获取2019年3月的文章索引,以此类推。
3. 欢迎投稿!邮箱:[email protected] ,如有参考文献请附文末。稿件合适会尽快联系!
版权说明:欢迎个人转发,任何形式的媒体或机构未经授权,不得转载和摘编。转载授权请在「返朴」微信公众号内联系后台。
长按下方图片关注「返朴」,查看更多历史文章