Google推出科研AI ScientistTwo,科研全流程全自动化:读论文、找缺陷、提新想法、实验验证、怼审稿人、补实验……
大家好,这里是pythonic生物人。
今天聊一个Google Cloud AI Research 9月10日发在arXiv上的科研工具——ScientistTwo。
ScientistTwo做了什么:
现有AI做科研的套路,大多是针对一个benchmark优化一个指标。你给它一个数据集,它调调参、改改模型结构,把准确率刷上去就完事了。
但真正的科研是:你读了一堆论文,发现某个方法有个致命缺陷,然后你想出一个新思路去补这个坑,做实验验证,再做消融证明你的改进确实有用,最后写成论文被人挑刺,再补实验回应。
ScientistTwo就是照这个流程设计的。
ScientistTwo在LLM、机器人、神经科学、强化学习等十几个方向,自己写论文、自己写代码、自己怼自己,86/107个任务打赢人类SOTA,平均提了25.2%。
把它生成的论文让斯坦福的AI审稿人打分,比ICLR 2026和NeurIPS 2025真·接收论文的平均分还高。
找文章局限:读人类SOTA论文,找出它的弱点。有个Limitation Verifier会检查找得够不够全,不够就继续找。 提想法:针对这些局限生成新idea,Novelty Checker打分,按新颖性排序。 做实验:先在benchmark子集上快速验证,不行就扔,行就上全量。这个策略很务实,省算力。 想法进化:第一轮跑完,Idea Evolver分析成功和失败的实验记录,进化出更好的假设。同时保留一部分原始seed ideas继续探索,避免陷入局部最优。 消融分析:Ablation Planner自动设计消融实验,搞清楚性能提升到底来自哪个组件。如果发现某个组件没用甚至拖后腿,就砍掉重新优化。 写论文+模拟审稿:Initial Drafter生成论文初稿,然后Peer-Reviewer Agent按ICLR标准打分。分数不够?Rebuttal Agent分析审稿意见,设计补充实验,跑完结果更新到论文里。这个循环一直跑到分数达标。 Meta-review:最后再来一轮元审稿,判断论文够不够顶会标准。不够就回去改idea,重新走一遍流程。
他们在107个来自ICLR、ICML、NeurIPS的研究问题上测试。
ScientistTwo与各baseline在ScholarPeer和Stanford Agentic Reviewer上的评分对比(上图):
ScientistTwo的7.5和5.7明显高出一截。 生成的论文在ScholarPeer审稿系统里平均分7.5,接收率91.9%。作为对比,ScientistOne只有3.8分,接收率14.3%。 更关键的是,在Stanford Agentic Reviewer这个held-out评审系统上,所有baseline的接收率都是0,ScientistTwo是72.1%。
当然它也不是没有短板:
方法论的严谨性上,人类还是略胜一筹。而且它生成的论文还没到spotlight/oral那种范式级突破的水平。
成本昂贵,跑一个任务平均花3765美元,2-3天完成。比人类快很多,但对学术实验室来说还是贵。
写到最后:
这个工作的意义不在于“AI能写论文”——这事之前就有人做。它的意义在于:AI开始具备闭环的科研迭代能力,就是它能根据实验结果调整假设,能根据审稿意见设计补充实验,能用消融分析反推方法改进。这些是人类科研的核心动作,之前没有系统能完整做到。 当然,它现在的局限也很明显。方法论的深度还不够,更多是在现有框架内做增量改进,而不是提出全新的理论范式。论文里也承认了这一点。 另外,用AI审稿系统来评估AI生成的论文,这个设定本身有点循环论证的味道。虽然他们用了held-out的Stanford Agentic Reviewer,但AI审稿和人类审稿的偏好可能还是有差异。论文里也做了9个人类审稿人的评估,结论是整体打平,实验执行上AI还更受青睐,但方法论严谨性人类略优。 不管怎样,这个方向值得关注。当AI能自己做科研迭代的时候,人类研究者的角色可能会慢慢从“亲自做”变成“定方向+把关”。
论文链接:https://arxiv.org/html/2609.19644v1
往期精彩