一只阿木木

停止提示你的 AI,开始为它设计循环——Loop Engineering 诞生记

停止提示你的 AI——开始为它设计循环

副标题:Loop Engineering 诞生记:一条推文、650万次浏览,和一个改变了整个AI工程范式的6个字


我是【一只阿木木】——公开建造我的 AI 第二大脑。

在一个所有东西都在云端化、AI 化、平台锁定化的时代,我选择反方向——让文件持久,让应用可替换,让人保持思考。 这不是保守,而是一种深度的长期主义。

我的终极赌注是:当 AI Agent 变得越来越强大时,拥有一个由纯文本文件组成的、结构化的、本地存储的知识库,将成为每个人最有价值的数字资产。Obsidian 不需要"成为" AI——它只需要成为 AI 最好的"操作对象"。

我相信:在 AI 时代,每个普通人都该拥有一个自动生长的知识系统。

引子:一条推文,打碎了两年的认知惯性

2026年6月7日,凌晨,一个叫 Peter Steinberger 的工程师在 X 上发了12个字:

"You shouldn't be prompting coding agents anymore. You should be designing loops that prompt your agents."

没有图。没有代码链接。没有博客文章。

在此之前,大约有两年时间,从 AI 代理里获取价值的方式很简单:写一个好提示,分享足够的上下文,读取返回的内容,然后再输入下一条指令。你始终握着工具,一轮接一轮。

然后这12个字出现了。

2026年6月8日,Peter Steinberger——OpenClaw 的创建者,现任职于 OpenAI——发布了两句话,在 X 上获得了 650 万次浏览。就这两句话。没有图。没有仓库链接。整个 AI 编程圈子花了接下来一整周争论这六个词的含义。

但真正让这个概念引爆的,是另一个人也在几乎同一时间说了几乎一样的话。

2026年6月,Anthropic 的 Claude Code 创建者 Boris Cherny 在一个舞台上说:「我不再提示 Claude 了。我有循环在运行。是它们在提示 Claude,决定下一步做什么。」

两个在第一线的人,同时说了同一件事。

这不是巧合。这是信号。

一、这之前发生了什么:你以为自己在用 AI,其实你只是在聊天

让我先说一件事。

在2024年和2025年的大部分时间里,我以为自己在「用 AI 开发」。打开 Cursor,输入需求,等它生成代码,审查,再提示,再等待,循环往复。

效率确实提升了。但我没有意识到的是,我一直是那个驱动引擎的人。AI 是工具,我是操作者。每一步都需要我在场,每一次迭代都需要我开口。

这种模式有一个隐藏的上限:我的注意力带宽。

每天能开多少轮对话?能同时管理几个 AI 任务?能在多少个上下文窗口之间跳跃?

这个模型有天花板。对于任何需要多个步骤、真实世界反馈或迭代改进的任务,单次提示很快就会崩溃。

那么接下来发生了什么改变?

二、范式转移:从「操作工具」到「设计系统」

先给出最简单的定义。

Loop Engineering 是这样一种实践:设计、操作和改进反馈循环,让 AI 编码代理能够规划工作、修改代码、观察结果、修正方法,直到软件任务完成。它不把 AI 工具当成一次性代码生成器,而是把软件工作当成一个迭代系统:定义目标、检查代码库、做出修改、运行验证、读取结果、决定下一步。

听起来还是有点抽象?

用一个具体的对比。

旧范式(你在操作 AI):

text

你 → 提示 → AI 生成代码 → 你审查 → 你发现Bug → 你再提示 → AI 修复 → 你再审查...

整个过程里,你是系统的 CPU。AI 只是一个很快的键盘。

新范式(你在设计系统):

text

你 → 定义目标 + 验证条件 → 
  Loop {
    AI 读取项目状态 →
    AI 做出修改 →
    运行测试套件 →
    如果通过:结束
    如果失败:读取错误 → 继续下一轮
  }

你做了什么?你定义了目标和停止条件,然后离开了。

Loop Engineering 的名字抓住了真正的变化所在:你不再是提示 Agent 的那个人,而是设计提示 Agent 的系统的那个人。

三、真正理解它

理论讲完了。说一个我自己做过的真实例子。

场景:我需要对一个 RAG 系统的检索模块做大规模重构。涉及约800行代码,15个函数,3个不同的接口契约。

旧做法(我做过的):

打开 Claude,把代码贴进去,说「请重构这些函数,遵循以下接口...」。然后 Claude 生成了一坨代码,我花了两个小时审查、发现问题、再提示、再审查。第二天它「忘了」昨天做了什么修改。

每次新对话都要重新建立上下文。这叫 Session 失忆症——每次重置都在浪费你最宝贵的资源:时间和注意力。

新做法(Loop Engineering):

Bash

# 第一步:写清楚目标文件(不是提示词,是系统的输入规格)
# VISION.md:我在构建什么,为什么
# AGENTS.md:Agent 的工作边界和约定
# tests/test_retrieval.py:15个验证重构正确性的测试(先写测试!)

# 第二步:启动循环
MAX_ITER=20
iter=0
while [ $iter -lt $MAX_ITER ]; do
  claude -p "根据 VISION.md 和 AGENTS.md,
             重构 src/retrieval.py,
             确保所有 tests/test_retrieval.py 通过。
             当前迭代: $iter" \
    --allowed-tools "read_file,write_file,run_command"

  # 运行验证
  if python -m pytest tests/test_retrieval.py --tb=short; then
    echo "✅ 所有测试通过,Loop 结束"
    break
  fi

  iter=$((iter + 1))
done

我按下回车,去喝了一杯咖啡。

回来时:17次迭代,所有15个测试通过,代码已经重构完毕。

我在整个过程中做了什么?定义了目标,写了测试,设定了边界。 然后放手。

四、Loop 的解剖:它为什么能工作?

很多人看到上面的例子会想:这只是个 while 循环,没什么神奇的。

但关键不在循环本身。1循环不是魔法。魔法在循环里面的反馈机制。

一个有效的 Loop 有五个核心组件:

1. 目标(Goal):明确的终止条件。不是「写好代码」,是「所有测试通过」。模糊的目标会产生永远运行的循环。

2. 状态读取(State Check):在 Hermes Agent 上的一个决定性示例:触发器每15分钟运行一次 cron;状态检查读取生产健康检查和测试结果;决策:如果所有检查通过,记录日志并停止;如果有什么失败,打开修复循环。

3. 反馈信号(Feedback):反馈让循环值得信任——测试、类型检查、审查门控;一个没有任何推回机制的循环,只是 Agent 在自我认同。

4. 记忆持久化(Memory):在每次循环结束后写一个关于失败模式和修复方案的简短记录,让下次同样问题的处理更快。

5. 成本控制(Cost Guard):Uber 在 Claude Code 和 Cursor 上为每人每工具每月设定了1500美元的上限,原因是在4个月内烧光了年度 AI 预算。 没有成本上限的循环是财务炸弹。MAX_ITER=20 是你的第一道防线。

五、真实的坑:我掉进去过的三个

坑1:目标不可测量

最常见的失败模式:给 Agent 的目标是「优化这段代码」。

它会永远运行,因为「优化」没有终止条件。永远有更多优化可以做。

解法:所有目标必须是可验证的布尔值。pytest 通过 = True。API 响应时间 < 200ms = True。

坑2:没有写入边界

我给了 Agent 整个 Vault 的写入权限。它改了我不希望它碰的文件。

没有护栏,你会得到无限循环和远超预算的账单惊喜。 更糟糕的是,你会得到被悄悄覆盖的核心文件。

解法:在 AGENTS.md 里明确定义「禁止操作的文件/目录」,使用 --allowed-tools 限制写入范围,并用 Git 做版本控制备份。

坑3:上下文窗口焦虑

随着上下文窗口填满,模型会「恐慌」并急于完成,以避免空间耗尽;Agent 经常试图一次性解决整个问题,产生一团没有文档的修改。

解法:每次循环开一个干净的 worktree(git worktree add),强制 Agent 在有限范围内工作,而不是啃整个代码库。

六、2026年6月,工具已经准备好了

你可能会说:这听起来很复杂,自己搭一套这个系统要花多少时间?

让早期采用者感到惊讶的是,这不再是自己动手构建的工作。一年前,一个循环意味着一堆你永远要维护的 bash 脚本,只有你自己看得懂。到2026年中,这些部件已经内置在产品里了。

具体来说:

2026年6月,Claude Code 和 OpenAI Codex 都原生支持计划执行、worktrees、skills、MCP 连接器、子 Agent 和记忆。

  • Claude Code:claude -p 非交互模式,/goal 命令运行直到完成条件满足
  • OpenAI Codex:计划执行 + GitHub Actions 集成
  • Hermes Agent:内置 cron、多模型支持、持久化记忆、自主 skill 创建

基础设施已经到位。门槛不再是「能不能搭」,而是「会不会设计」。

七、2026,你的角色变了

Loop Engineering 最深刻的影响,不是效率提升,而是你和 AI 的关系重新定义了。

以前:你是司机,AI 是车。你每一步都要打方向盘。

现在:你是赛道设计师,AI 是赛车手。你定义规则、路径和终点,然后让赛车自己跑。

赛道设计师需要的技能,和司机完全不同:

  • 深入理解「什么是好的验证信号」(测试设计能力)
  • 知道「如何定义有边界的操作空间」(系统设计能力)
  • 能够「从失败模式中提取可复用的知识」(知识工程能力)

到2026年中,瓶颈已经从模型能力转移到编排设计。仍然一次一条地输入提示词的开发者,正在把90%的价值留在桌上。Prompt Engineering 没有死——它是入场券。Loop Engineering 是下一层。

你现在就可以做

不需要搭复杂的系统。今天就可以开始。

打开你手头的任何一个有测试覆盖的项目。

写一个10行的 shell 脚本:

  1. 调用 claude -p 执行一个具体的重构任务
  2. 运行 pytest
  3. 如果失败,循环继续,把错误信息喂回给下一次调用
  4. 设定最大迭代次数为10

按下回车。离开。

当你回来看到测试全绿时,你会明白为什么 Boris Cherny 说:

「我的工作,是写循环。」

我是【一只阿木木】——公开建造我的 AI 第二大脑。

一个程序员出身的知识工作者,公开记录自己如何用 AI 工具搭建个人知识系统、把读过的书和做过的项目变成可复用资产的全过程。

在一个所有东西都在云端化、AI 化、平台锁定化的时代,我选择反方向——让文件持久,让应用可替换,让人保持思考。 这不是保守,而是一种深度的长期主义。

我的终极赌注是:当 AI Agent 变得越来越强大时,拥有一个由纯文本文件组成的、结构化的、本地存储的知识库,将成为每个人最有价值的数字资产。Obsidian 不需要"成为" AI——它只需要成为 AI 最好的"操作对象"。

普通人如何用 AI 搭建自己的知识操作系统?

欢迎加入行动营👇获取更多Obsidian + AI数字大脑实践

Image

我相信:在 AI 时代,每个普通人都该拥有一个自动生长的知识系统

欢迎关注【一只阿木木】🌊