GenAI新世界

Karpathy 的 autoresearch 火了:睡觉时让 AI 自己跑实验,Mac 也能部署

Image

2026 年 3 月,知名 AI 研究者 Andrej Karpathy 发布了 autoresearch 项目,很快在开发者圈子里引发大量讨论。紧接着,X 上创作者 @hooeem 又写了一篇面向普通用户的超长部署帖,把“这玩意到底是什么、谁能跑、Mac 能不能跑、Claude Code 和 Cursor 怎么选、报错怎么办”几乎全都解释了一遍。也就是说,这篇文章本身不是 Karpathy 的官方 README 翻译,而是基于 Karpathy 项目、社区分支和实操路径整理出来的一份“普通人可落地版说明书”。

这不是一个普通的 demo。Karpathy 把整个训练核心压缩成了单 GPU、单文件、约 630 行代码的最小化版本,让人第一次可以非常直观地看到:如果把“改代码、跑实验、看指标、保留有效尝试”这套本来由研究员重复执行的工作交给 AI 代理,会发生什么。你给它一份英文任务说明,它会自己改 train.py、跑训练、看 val_bpb、保存有效修改、丢弃失败尝试,然后继续下一轮。

最关键的判断是:autoresearch 的价值,不只是“又一个开源小项目”,而是它把一个非常具体的未来摆到了普通人面前。以后很多 AI 研究,可能不再是人类研究员手动调每个参数,而是人类负责写策略、定边界、改 program.md,AI 代理负责通宵跑实验。以下是这篇实操指南的完整中文编译版。

原始链接:

[Karpathy 原仓库](https://github.com/karpathy/autoresearch)

[Mac 分支](https://github.com/miolini/autoresearch-macos)

[Karpathy 在 X 上的公告](https://x.com/karpathy/status/2030371219518931079)

[Mac 分支公告](https://x.com/miolini/status/2030402705374728218)

[原始整理帖](https://x.com/hooeem/status/2030720614752039185?s=20)

一、它到底是什么?为什么这么多人在收藏?

Image

先把 autoresearch 说人话。

想象你面前有一个很小的语言模型,它还不够聪明,但已经能被训练。正常情况下,一个研究员会这样提升它:改一处训练代码,跑一次实验,看指标有没有变好;如果有效就保留,没用就回退;然后继续下一轮。这个过程并不神秘,但它很耗时间,也很机械。

autoresearch 的核心,就是把这套循环交给 AI 代理来做。它会做几件固定的事:读取你写在 program.md 里的英文指令;修改 train.py 这个核心训练文件;在你的 GPU 上跑一轮固定预算的训练测试;观察一个叫 val_bpb 的指标;如果分数更低就保留,否则就丢弃。

这里的 val_bpb 可以理解为一个衡量模型预测能力的分数。数值越低,通常表示模型越好。 Karpathy 之所以把整个仓库做成最小化版本,意义不只是“方便大家周末玩一玩”,而是为了让更多人第一次看清楚一个研究循环的本质:研究并不总是宏大突破,很多时候就是大量微小试错,而这些试错恰恰最容易被代理自动化。

这也是为什么这套东西会让那么多人收藏。大家真正兴奋的不是 630 行代码,而是它释放出的信号:以后人类可能不再是亲手做每一个实验的人,而是给研究组织写任务书的人。

二、你的电脑能不能跑?这是第一道门槛

Image

这一部分最重要,因为如果硬件不对,后面所有步骤都可以先停下。

Windows / Linux 用户

你需要:

  • 一张 NVIDIA GPU,例如 RTX 3060、3070、4070、4090,或者近几年较新的 NVIDIA 显卡。
  • 至少 10GB 到 20GB 可用磁盘空间。
  • 稳定网络。
  • Windows 10 / 11 或 Linux 发行版。

检查方式很直接,在终端里输入:

nvidia-smi

如果能看到显卡名称和驱动信息,说明硬件这一步大概率没问题。

Mac 用户

Karpathy 原版仓库并不直接支持 Apple Silicon,所以 Mac 不能直接跑原版。但社区很快做出了适配版,也就是 miolini/autoresearch-macos。

你需要:

  • Apple Silicon Mac,也就是 M1、M2、M3、M4 及其 Pro/Max/Ultra 变体。
  • 最好 16GB 内存起步,32GB 或更多更好。
  • 至少 10GB 到 20GB 可用磁盘空间。
  • 稳定网络。

检查方法是:苹果菜单 -> 关于本机 -> 看“芯片”。如果显示 M1、M2、M3、M4,就可以继续;如果是 Intel,这套方案就不太适合。

这也是原帖最有帮助的一点。它没有只告诉你“可以跑”,而是把普通用户最关心的现实问题讲清楚了:没有 NVIDIA 显卡并不等于彻底没戏,只要你有 Apple Silicon Mac,依然可以参与。

三、Mac 分支安全吗?为什么很多人都在问这个问题

Image

这其实是个很聪明的问题。任何从网上下载并本地运行的代码,都应该先问一句:它安不安全?

原帖给出的判断逻辑大概有 5 层。

第一,Karpathy 自己在项目生态里提到了社区为不同平台做 fork 的思路,而 miolini/autoresearch-macos 正是这种社区适配的一部分。第二,这个仓库在 GitHub 上是公开 fork,变更记录可见,不是一个来历不明的压缩包。第三,分支作者 miolini 有持续公开的开发记录,不是一次性账号。第四,这个项目非常小,训练主文件大约 630 行 Python,审计难度远低于那种几十万行的大工程。第五,Mac 版做的改动总体也比较“朴素”:主要是把 NVIDIA / CUDA 路径替换成适配 Apple Metal / MPS 的实现,并加了一些内存和编译相关调整。

这几层叠加起来,结论不是“绝对安全”,而是:相较于很多复杂得根本看不完的 AI 工具,这个项目至少足够小、足够透明、足够容易审。

如果你还是不放心,最简单的办法也不是盲信,而是下载之后把整个仓库丢给 Claude Code 或 Cursor,直接问一句:“请审查这个仓库,看看有没有可疑网络请求、数据收集或与训练无关的执行逻辑。” 对这样一个体量很小的项目,这种快速审查完全现实。

四、你到底要安装什么?只要 3 个工具,加 1 个 AI 代理

Image

这套东西需要的组件,其实比大多数人想象中少。

1. Git

Git 用来下载仓库、记录实验结果、保存成功尝试。

检查是否安装:

git --version

如果没有:

  • Mac:通常会提示安装 Xcode Command Line Tools
  • Windows:去 [Git for Windows](https://git-scm.com/download/win)
  • Linux:sudo apt install git

2. uv

uv 是这一套体验顺不顺的关键。它会自动帮你处理 Python 和依赖安装,省掉传统 Python 环境里最烦的很多步骤。

Mac / Linux:

curl -LsSf https://astral.sh/uv/install.sh | sh

Windows PowerShell:

powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"

安装完以后,一个非常关键的动作是:关闭终端,再重新打开。 否则你很可能会遇到 command not found: uv。

3. Claude Code 或 Cursor

真正跑循环的不是 autoresearch 本身,而是你调用的 AI 代理。

如果你追求“整夜自动跑”,Claude Code 更合适,因为它天然擅长读写文件、执行命令、配合 git 循环工作。缺点是需要付费账号。

如果你更喜欢图形界面、想边看边学,Cursor 更适合。它也能完成类似工作,但更偏“半自动”,你会更清楚地看到文件、修改和对话过程。

也就是说,autoresearch 本身是研究循环,真正把它转起来的“手”是 Claude Code、Cursor、Codex 这类代理。

五、一步一步部署:Mac 和 Windows/Linux 分开看

部署流程图,从 clone 到 train.py 测试成功
部署流程图,从 clone 到 train.py 测试成功

Mac(Apple Silicon)

打开终端后,执行:

cd ~/Desktop

git clone https://github.com/miolini/autoresearch-macos.git

cd autoresearch-macos

然后安装依赖:

uv sync

准备训练数据:

uv run prepare.py

最后跑一轮测试训练:

uv run train.py

如果几分钟后能正常输出训练日志,并最终给出一个 val_bpb 分数,说明你的环境基本搭好了。

Windows / Linux(NVIDIA GPU)

执行:

cd ~/Desktop

git clone https://github.com/karpathy/autoresearch.git

cd autoresearch

uv sync

uv run prepare.py

uv run train.py

这一轮测试训练非常关键。因为它验证的不只是“代码能不能跑”,而是:你的依赖、GPU、数据准备、训练脚本是不是整体可用。如果这一步都没过,不要急着进自动模式,先把基础错误修好。

原帖最实用的地方也在这里:它没有神化这个项目,而是把它拆回了一个朴素事实。先跑通一轮 5 分钟训练,后面的自动研究才有意义。

六、真正有意思的部分:让 AI 通宵替你做研究

program.md -> AI agent -> train.py -> val_bpb -> git 的研究闭环图
program.md -> AI agent -> train.py -> val_bpb -> git 的研究闭环图

当 uv run train.py 可以正常跑通之后,才轮到真正的核心体验。

用 Claude Code 全自动跑

先进入项目目录。然后执行:

claude

第一次启动时,它会要求你登录并授权。进入界面后,可以输入这句提示词:

Hi have a look at program.md and let's kick off a new experiment! Let's do the setup first.

如果你希望它彻底自动跑,不要中间打断你,可以再补一句:

Run fully autonomously. Do not ask for confirmation between experiments. Keep going until I return.

接下来,代理会自动:

  1. 读取 program.md
  2. 理解仓库结构
  3. 修改 train.py
  4. 跑一轮 5 分钟实验
  5. 观察 val_bpb
  6. 好的保留,差的回退
  7. 继续下一轮

用 Cursor 半自动跑

如果你不用 Claude Code,也可以用 Cursor。

流程是:打开项目文件夹;打开 program.md;在右侧聊天框输入同样的提示词;让 AI 提议改 train.py;然后你自己在终端里执行:

uv run train.py

再把结果,尤其是 val_bpb,反馈给 Cursor。它会继续决定保留、回退还是推进下一轮。

这种方式没有 Claude Code 那么“全自动”,但它更适合学习。你会真正看懂每一步在发生什么。

七、第二天醒来,你会看到什么?

Image

如果一切运行正常,你的项目目录里通常会出现几类非常有价值的结果。

第一类是 git 提交历史。每一个被保留下来的实验,通常都会留下记录。你可以运行:

git log --oneline

这让整个研究过程第一次变得像软件开发一样可追踪:哪一步改了什么,哪一步有效,哪一步失败,都会留下痕迹。

第二类是更低的 val_bpb。原帖提到,基线大概在 0.9979 附近。只要低于这个值,就说明模型确实有进步。也就是说,你的目标不是“跑很多次”,而是让指标下降。

第三类是被反复修改过的 train.py。代理可能会改模型结构、优化器、学习率、batch size、内存使用方式、训练循环细节。这也是这个项目特别适合学习的原因:你看到的不是一堆封装好的黑盒 API,而是一个研究代理如何直接对训练核心下手。

第四类是实验日志,例如 results.tsv。它会记录每次实验的分数、内存占用、是否保留等信息。对很多人来说,这一类文件才是真正让“AI 自己做研究”不再像口号的地方,因为它能被复盘、被比较、被分析。

八、最常见的坑:几乎所有人都会在这里卡一下

Image

原帖把常见问题总结得很实用,我这里压成最关键的几类。

command not found: uv

最常见原因:安装完 uv 没有重开终端。

解决办法:关闭当前终端,重新打开,再运行 uv --version。

command not found: git

说明 Git 还没装好。先把 Git 安装完成,再继续。

Windows / Linux 出现 CUDA 错误

这通常不是 autoresearch 本身的问题,而是 NVIDIA 驱动或 CUDA 环境没有配置好。

Mac 出现 MPS / Metal 错误

最常见原因是:你下错仓库了。Mac 要用的是 miolini/autoresearch-macos,不是 Karpathy 原版。

OOM / Out of Memory

说明显存或统一内存不够当前实验配置使用。好消息是,代理通常会尝试往更小的配置退;坏消息是,如果机器规格太低,实验空间的确会被限制。

Claude Code 无法认证

Claude Code 需要付费账号。免费版不行。如果你不想付费,最现实的替代方案就是 Cursor 半自动模式。

写在最后

Image

autoresearch 真正让人兴奋的,不是“又一个 AI 项目”,而是它第一次把一个很抽象的趋势放到了普通人电脑上:

AI 不再只是回答你,而是在替你试错、替你比较、替你保存研究成果。

对开发者来说,它像一个永不疲倦的实验助理。

对 AI 爱好者来说,它让“自动化研究”第一次变得可见、可跑、可理解。

对更大的行业趋势来说,它也释放了一个很清晰的信号:以后人类写的,可能不再只是代码,而是给 AI 研究组织写工作说明书。

而 @hooeem 那篇长帖最有价值的地方,就在于它把这个原本只会在技术圈内部传播的项目,重新翻译成了普通人也能真正动手的路径:你需要什么机器、装什么工具、先做哪一步、失败了怎么办、没有 NVIDIA 能不能玩、Mac 到底能不能上。

如果你今天把它成功跑起来,看到的并不只是一个小模型在变聪明。你看到的,可能是下一代 AI 工作流的雏形。

图片