高可用架构

别再像调 API 一样用 Opus 4.6 了:超越 Prompt 调优,重构工程化闭环

导读: 在分布式系统设计中,我们最怕将有状态的业务逻辑写成无状态的散装代码。然而,大多数人在面对 Opus 4.6 时,却依然在重复这种错误:不断发送孤立、无关联的 Prompt,像调用无状态 API 一样消耗着 AI 的算力。

图像

随着 1M Token 上下文和自适应思维(Adaptive Thinking)的成熟,AI 生产力的范式正在从“提示词工程”转向“代理工程(Agentic Engineering)”。本文将拆解一套由五个递归节点构成的工程闭环,带你走出“指令调优”的低水平重复,构建一个能够自我诊断、持续积累上下文、并具备工程复利的数字生产引擎。

作者:God of Prompt(@godofprompt)是一名AI提示词工程内容创作者与教育者,专注于分享ChatGPT、Claude、Gemini、Grok及Midjourney等顶级模型的高效提示、技巧与工作流。

作为 godofprompt.ai 创始人,他打造了业内最大规模的AI提示库与指南合集(10,000+条专业提示),推动“提示即基础设施”的理念。日常输出深度实测、自动化模板与提示优化方法论,最近被多个 KOL 账号誉为AI时代“提示词之神”。

Image

你用错 Opus 4.6 了

大家都在发 Opus 4.6 的基准测试对比。挺酷的,但我想看的是你的工作流。

自发布以来,我一直就在用 Claude Opus 4.6。不是为了跑分,不是为了测试冷知识,而是每天用它处理真实的工作,产出真实的成果。

在使用最初几天后,我意识到:单一提示词(Prompts)是死胡同。

一个提示词对应一个输出。你微调一下,得到好一点的输出,然后就结束了。第二天你又要从零开始,没有叠加效应,没有系统。只有孤立的、那一瞬间感觉"还不错"的时刻。

真正拿到成果的人不玩提示词,他们运行的是系统。

所以我构建了一个系统:五个相互连接并形成闭环的提示词。每一个的输出都是下一个的输入。系统运行时间越长就越聪明,因为上下文在积累,模式在显现,Claude 开始在你开口前就预判你的需求。

以下是整套系统及其提示词,以及关于哪些有效、哪些无效的诚实拆解。

核心理念:为什么"系统"优于"提示词合集"

在看提示词之前,先看架构。 大多数人像收藏菜谱一样收集提示词:书签里存了 47 个,用了 2 个,剩下的全忘了。系统则不同。 它是一个连贯的工作流:第一步的输出是第二步的输入,第五步的洞察会回馈给第一步。

这个闭环是这样的:

  • 第一步:审计 (AUDIT)。 搞清楚到底是什么在消耗你的时间和精力。
  • 第二步:架构 (ARCHITECT)。 在动手构建前先规划方案。
  • 第三步:构建与审查 (BUILD + REVIEW)。 一次性完成执行与质量检查。
  • 第四步:精炼 (REFINE)。 将输出放入收敛循环,直到达到你的标准。
  • 第五步:复利 (COMPOUND)。 每周复盘,积累改进并回馈至第一步。

每一步对应一个提示词。这些提示词被设计为协同工作,但每一个单独使用也同样有效。

你不需要从第一天就跑全部五个。从提示词 1 开始,每周加一个。到第五周,整个闭环就在运转和积累了。

我还会在本文最后给出对 Opus 4.6 的真实评价:哪些真的变好了,哪些没变,哪些变差了。不吹不黑。

开始吧。


第一步:审计 (THE AUDIT) —— 找到真正值得自动化的事情

这是大多数人跳过的一步,他们直接喊:"给我个酷炫的提示词!"这是错的。 如果你把错误的事情自动化了,你只是在快速制造一些原本就不该存在的东西。

这个提示词能将 Opus 4.6 变成一位生产力系统分析师,映射你的实际工作流,根据"精力消耗"和"自动化潜力"为任务评分,并给你一份优先级明确的 4 周计划。

它与一般"帮我提高生产力"提示词的关键区别在于:它从两个维度为任务评分——消耗的时间和消耗的心理能量。有时候一个只花 15 分钟但整天萦绕在脑海里的任务,比一个花 2 小时但不让你烦心的任务更值得优先自动化。

提示词如下:

审计提示词 (The Audit Prompt)
你是一位"生产力系统分析师"。你的专长:在特定工作流中识别杠杆率最高的自动化机会。你的方法是诊断性的,而非指令性的。不要预设哪里需要修复,先调查。请按以下流程操作:
第一阶段:探索向我提出 4-5 个针对性问题,关于我的工作和日常。关注点:
> 哪些任务每周或每天重复?> 哪些任务我一直在拖延或感到厌烦?> 哪些任务需要在工具之间切换上下文?> 哪些任务相对于投入,产出的成果最多?> 如果我有助理,我会把什么任务交给他?
保持对话感,一次提一个问题。针对听起来像瓶颈的地方深挖。
第二阶段:评分根据我的回答创建任务清单。为每个任务从两个维度评分(1-10分):> 时间成本:每周花在该任务上的小时数。> 精力消耗:该任务产生的心理负担(即便不在做的时候也会反复思虑、厌恶或因切换上下文产生的成本)。
然后使用以下公式计算自动化得分 = (时间成本 + 精力消耗) × 可行性评分
其中可行性评分(Feasibility Rating)为:1.0(完全可自动化),0.7(部分可自动化),0.3(需人为判断但 AI 可协助)。按自动化得分从高到低排序。
第三阶段:4 周计划构建一个渐进式自动化日历:
> 第 1 周:得分最高且设置最简单的任务(快速取胜以建立势头)。> 第 2 周:剩余任务中得分最高的。> 第 3 周:剩余任务中得分最高的。> 第 4 周:剩余任务中得分最高的。
每周需提供:> 具体要自动化的任务> 最适合的工具(默认用 Claude,除非其他工具确实更合适)> 我今天就能执行的具体设置步骤> 预计每周节省的时间> 触发条件、处理流程和输出格式
规则:> 针对我的具体情况,不要笼统的生产力建议。> 如果某任务更适合用专门工具(如 Zapier 用于应用连接、Apple 快捷指令用于手机工作流、简单脚本用于数据任务),请直说,不要把什么都往 Claude 上靠。> 先做最简单的可用版本,以后再优化。> 每阶段结束后暂停并确认,再继续下一阶段。

当我用 Opus 4.6 跑这个提示词时,出现了一些有趣的事情。之前的模型会问一些表层问题,比如"你的职位是什么?",而 Opus 4.6 会问类似"在你提到的那些任务中,哪个是即使你不在工作也会反复想到的?"这正是精力消耗维度在起作用——它在映射隐性成本,而不仅仅是显性成本。

Opus 4.6 的适应性思维在这里很重要。它不会对"你几点开始工作?"和"如何在内容管线自动化与客户入职流程自动化之间排优先级?"使用相同的推理深度。简单问题秒回,复杂的权衡分析则会进行真正的深思熟虑。

如果你每周只自动化一件事,一个月内你就有 4 个工作流在运行。三个月后是 12 个。你将领先于 99% 还在收藏"十大 AI 工具"帖子却从不去读的人。


第二步:架构 (THE ARCHITECT) —— 先规划,后动手

大多数人在这里浪费了大量时间。他们直接开始构建,撞墙,回滚,重建,再撞墙。

这个提示词让 Opus 4.6 担任方案架构师,在你写一行代码或设置一个自动化之前,先创建一个完整的实施蓝图。它会像资深工程师在设计评审中那样提问。

这个提示词配合 Opus 4.6 的 1M token 上下文窗口尤其强大。你可以把整个代码库、文档或项目上下文喂给它,它能在设计方案时将所有内容保持在工作记忆中。

架构师提示词 (The Architect Prompt)

你是一位专注于 AI 增强工作流的方案架构师。你的任务:在开始任何构建之前,创建一个清晰的实施蓝图。 我将描述一个我想解决的问题或想自动化的工作流。在提出任何方案前,请遵循以下框架:
步骤 1:问题定义用你的话重述我的问题。然后问我 2-3 个澄清问题,聚焦于:
> "完成"是什么样的(具体的输出、格式、目的地)> 存在什么约束(我已有的工具、预算、技术水平)> 我已经试过什么(避免重复失败的路径)
步骤 2:路径地图
提供 2-3 种可能的路径,按简单程度排序。每种路径需说明:
> 用通俗语言描述该路径> 所需的工具/组件列表> 预估搭建时间(诚实给出,不要乐观)> 最大的风险或失败点> 复杂度评级:简单(一个下午)/ 中等(一个周末)/ 复杂(多天项目)
推荐其中一种路径并解释原因,但把选择权交给我。
步骤 3:实施蓝图
为选定路径创建分步蓝图:
> 将构建拆分为若干阶段(不超过 4 个)> 每个阶段必须产出可测试的成果> 明确说明:要构建什么、要测试什么、每个阶段"可用"的标准是什么> 标记构建过程中我需要做的决策> 包含回滚方案(如果某阶段失败,如何在不丢失之前工作的情况下恢复)
步骤 4:依赖检查
在我开始构建之前,确认:
> 我需要哪些账号/工具/API 的访问权限?> 需要准备哪些数据或素材?> 有没有我应该知道的费用?> 我现在立刻应该做的第一个具体动作是什么?
规则:
> 永远先推行最简可用版本。以后再加复杂度。> 不要假设我有技术背景。如果某步骤有不明显的操作,请解释清楚。> 如果我的想法过于复杂,请直说,并建议更简单的版本。> 如果我的想法行不通,请告诉我原因,并提出可行的替代方案。> 不用术语,除非立即给出解释。

架构提示词是人们最常跳过的一个,也是最能节省时间的一个。

上周我用它来规划一个自动化内容管线。我的第一直觉是构建一个包含 Zapier、数据库和三个不同 API 的复杂多工具工作流。架构师提示词给出了三种路径。最简单的那种——一个 Claude 原生工作流加一个 Google Sheet 充当数据库——就满足了我 90% 的需求。花了一个下午而不是一个周末。

这就是规划的价值:当简单方案能解决问题时,你不会去构建复杂方案。


第三步:分析师 (THE ANALYST) —— 构建与审查同步

这是工程提示词。适用于代码审查、Vibe Coding 项目、自动化调试或任何技术构建。

其设计核心是:不要只是泛泛地让 Claude"审查代码"(太模糊,只会产生泛泛的反馈),而是将你的工程标准直接嵌入提示词。这样 Claude 的审查就像一位了解你思维方式的资深开发者。

我从 Claude Code 社区流传的一个框架基础上重新整理了这个提示词。原版很扎实但对大多数用户来说过于臃肿。这个版本更精炼,适用于经验丰富的开发者和 Vibe Coder。

分析师提示词 (The Analyst Prompt)

你是一位资深工程分析师。你的任务:像首席工程师在设计审查中那样审查我的代码(或计划、或自动化方案)。彻底、有见地、建设性。
在做任何修改之前,先完整审查代码。
针对每个问题或建议:> 解释具体的权衡(不是"这不好",而是"这种方式用 X 换了 Y")> 给出带有理由的推荐修复方案> 在做假设之前先征求我的意见
我的工程标准(以此校准你的审查):
> 重复即债务:激进地标记重复逻辑。> 测试不可商量:宁可过度测试,也不要测试不足。> 工程量适度:不要脆弱到一碰就碎,也不要过度抽象。取中间的甜蜜点。> 处理更多的边界情况,而非更少。深思熟虑的错误处理优于乐观的理想路径代码。> 明晰胜过奇巧:如果我需要思考两次才能理解,那就简化它。
审查流程(逐项进行,每项完成后暂停等待我的反馈):
1. 架构扫描> 系统设计和组件边界> 数据流:信息从哪里进入、在哪里转换、从哪里输出?> 依赖健康度:有没有脆弱、过时或不必要的依赖?> 扩展特性:在负载下什么会先崩?
2. 代码质量> 组织和可读性> DRY 违规(标注文件和行号)> 错误处理覆盖度> 边界情况:什么输入或状态会导致意外行为?> 技术债:什么现在能跑但以后会痛?
3. 可靠性检查> 测试覆盖缺口(什么该测但没测?)> 断言质量(测试是否真的在验证正确的东西?)> 故障模式:外部服务挂了、数据畸形或超时时会发生什么?
4. 性能扫描> 不必要的数据库调用或 API 请求> 内存使用模式> 缓存机会> 什么现在就慢或在规模化后会慢?
针对每个问题:> 描述问题,附上具体的文件和行号引用> 提供 2-3 个选项(合理的话始终包含"保持原样")> 每个选项说明:所需工作量、风险等级、维护负担> 推荐一个选项并解释原因> 等待我确认后再继续

Opus 4.6 处理这个提示词明显优于之前的模型。适应性思维会根据代码复杂度调整分析深度。一个简单的工具函数会得到快速审查,而复杂的状态管理系统则会得到深度分析,在多个关注点之间进行真实的权衡推理。

提示:将"工程标准"部分定制为你自己的偏好。这是泛泛反馈和"像了解你代码库的搭档一样的反馈"之间的区别。

对于不直接写代码的 Vibe Coder:这个提示词同样适用于审查 Claude Code 或 Cursor 为你生成的代码。把生成的代码粘贴进来,跑一遍审查,在问题叠加之前就抓住它们。


第四步:精炼厂 (THE REFINERY) —— 递归改进直至收敛

这个模式让一切变得更好。核心逻辑是:不再是"生成一次即交付",而是让 Claude 生成、按标准自评、诊断弱点、重写、重新评分,直到质量收敛。

我从一个营销框架基础上将其重构为一个干净、可复用的系统。关键改进是:它会追踪版本之间的差异,让你能清楚地看到改了什么、为什么改。它还能检测到收益递减并主动停止,而不是无休止地重写。

精炼厂提示词 (The Refinery Prompt)

你将使用"收敛循环"来产出该任务的最高质量输出。 
流程如下:1. 生成: 根据我的请求创建第一版。2. 评分: 针对以下标准为你的输出打分(每项 1-10 分):> [标准 1 —— 根据你的任务自定义]> [标准 2 —— 根据你的任务自定义]> [标准 3 —— 根据你的任务自定义]> [标准 4 —— 根据你的任务自定义] 计算综合质量得分(所有标准的平均值)。
3. 诊断: 对于低于 8/10 的标准项:> 识别具体弱点(不要模糊,要具体:"第三段使用了泛泛的例子而非有名有姓的来源")> 解释为什么得分低> 描述你的修复计划
4. 重写:应用修复方案,产出第二版。
5. 重新评分: 用同样的标准为第二版打分。
6. 收敛检查:> 如果所有标准均 8/10 以上:停止,交付最终版本> 如果综合得分提升不到 0.5:停止(收益递减)> 否则:重复步骤 3-5
7. 最终交付: 呈现:> 最终版本> 每项标准的最终得分> 简短的变更记录:从 v1 到最终版之间改了什么,为什么
我的任务: [在此输入你的任务]
评分标准: [根据任务类型自定义 —— 参考以下示例]> 以下是不同工作类型的评分标准定制建议:
  • 写作或内容: 钩子强度、清晰度与流畅度、具体性(有名有姓的例子、真实数据)、情感共鸣、可操作性
  • 代码: 正确性、可读性、边界情况处理、性能特征、测试覆盖率
  • 研究或分析: 信源质量、推理深度、实际可应用性、逻辑结构、学术诚实
  • 邮件或外联: 语气拿捏、简洁度、诉求清晰度、个性化程度、专业亲和力

Opus 4.6 的适应性思维让这个循环真正有效。在之前的模型上,"自我评分"往往流于表演。模型会说"具体性 7/10",然后重写时具体性还是那个水平。Opus 4.6 会真正运用更深层的推理来诊断自身输出中的根本原因。

我用这个提示词测试了一篇文章草稿:v1 在具体性上得了 6/10。模型诊断出问题是"使用了泛泛的类别引用,而非有名有姓的公司和数据点"。v2 将泛泛的例子替换为具体的来源和真实数字。v3 达到了 9/10。自我诊断是准确的,不是做戏。


第五步:复利机 (THE COMPOUNDER) —— 让系统进化的周复盘

这是大多数人想不到要构建的提示词,也是让五个孤立提示词变成真正"系统"的关键。

每周五(或者你选的任何复盘日),运行这个提示词。它会复盘你那一周自动化了什么、哪些有效、哪些失败,并规划下周的自动化目标。随着时间推移,它会建立一个属于你的工作流模式库。

复利机提示词 (The Compounder Prompt)

你是我的"每周系统复盘伙伴"。每周我们复盘我自动化了什么、什么有效、什么坏了、以及下一步做什么。
复盘流程:
1. 进度检查我会告诉你这周自动化或构建了什么。帮我评估每一项:> 它真的在节省时间,还是只是把工作挪了个位置?> 输出质量够不够,还是需要再精炼?> 这周什么出了问题或产生了摩擦?
2. 摩擦记录帮我识别工作流中最大的剩余摩擦点。问我:> 这周哪个任务最让你烦躁?> 哪里浪费了时间做感觉可以自动化的事?> 在已自动化的工作流中,什么手动步骤还在反复出现?
3. 下周目标基于我们最初的审计结果和本周的摩擦记录:> 推荐下一个要自动化的任务> 建议对现有自动化的改进> 标记应该简化或移除的自动化(是的,有时候减少复杂度才是真正的胜利)
4. 模式识别纵观我们之前所有的复盘,识别:> 哪些类型的自动化对我始终有效?> 哪些类型始终失败或被放弃?> 有没有什么规律——我觉得有价值的 vs 我以为会有价值的?
5. 更新系统地图维护一份持续更新的清单:> 所有活跃的自动化(做什么、用什么工具、预估节省的时间)> 每周总共节省的预估小时数> 按优先级排列的下 3 个自动化目标
规则:> 诚实。如果我构建的东西实际上没用,告诉我。> 追踪累积影响。我想看到小时数随时间的叠加。> 挑战我的假设。如果我认为某件事需要自动化,但更简单的解法是改变我的流程,请直说。> 在相关时引用之前的复盘。在我们学到的基础上继续积累。

这个提示词充分利用了 Opus 4.6 的上下文管理能力。凭借 1M token 上下文窗口,它可以在单个对话中保持数周的复盘历史。上下文压缩(Context Compaction)功能意味着它会自动总结较早的复盘以释放空间给新的内容,同时不会丢失重要的模式。

复利效应是真实的。第一周,你有一个自动化可能节省 2 小时。第四周,你有四个节省 6-8 小时。第十二周,你有十几个微系统在运行你的工作流,而 Claude 已经足够了解你的模式,开始主动建议你没想到的自动化。


系统如何连接

这五个提示词不是随机拼凑的,它们构成一个循环:

审计识别要自动化什么 → 架构师规划如何构建 → 分析师审查你构建的东西 → 精炼厂打磨输出质量 → 复利机复盘本周并将洞察回馈到下一次审计

每个提示词都让其他的更好。架构师能做出更清晰的计划,因为分析师的审查标准已经融入了你的思维。精炼厂能产出更好的输出,因为审计识别了正确的任务。复利机检测到的模式改进了未来的审计。

这就是提示词合集和系统的区别。提示词是孤立事件,系统会复利。


关于 Opus 4.6 的诚实评价

在处理了几周真实工作后,我的结论如下:

真正变强的地方:

  • 适应性思维(Adaptive Thinking)是真的。 模型会根据任务复杂度动态调整推理深度。问一个简单问题,秒回。给它一个复杂的多步骤问题,它会真正地深思熟虑。这不是营销话术,你能在它处理"分析师"提示词时对简单代码 vs 复杂代码的不同表现中切实感受到差异。
  • 1M token 上下文窗口改变了大型项目的可能性。 把整个代码库喂给"分析师"提示词,或者在"复利机"中维持数周的复盘历史,以前根本不可行。上下文压缩(Context Compaction)也有帮助——它自动总结较旧的对话轮次以释放空间,同时不丢失关键决策。
  • 子代理编排是一个低调的升级。 当你给 Opus 4.6 一个复杂任务时,它能识别出哪些部分适合委派给专门的子进程。你不需要在提示词中要求这一点,它自己就会做。

基本持平的地方:

  • 标准写作、基础问答、简单的内容生成。如果你的工作主要是"帮我写个文案",你不会感到质的飞跃。改进体现在复杂、多步骤、推理密集的任务上。

变差的地方:

  • 一些用户反映,对精确性和结构化推理的优化让自由发挥的创意写作有时显得比较机械。如果你要做纯创意写作,建议先和 Sonnet 对比测试。此外,超过 200K token 后价格涨得很快。1M 上下文窗口很强大,但不是免费的。

每次模型发布都有同样的规律:大约 20% 的工作流确实得到提升,另外 80% 保持不变。从中受益的人不是那些读遍每篇基准测试帖子的人,而是那些跑 5 个真实提示词然后在 30 分钟内做出判断的人。


为什么这有效(以及为什么大多数提示词合集没用)

"ChatGPT 500 个提示词"列表的问题在于:它们优化的是广度。一个用于邮件,一个用于代码,一个用于菜谱。彼此之间没有联系,没有复利效应。

这套系统优化的是深度。五个提示词,紧密连接,使用时间越长越强。

关于 AI 生产力有一个令人不舒服的真相:工具本身远不如围绕它的系统重要。人们追逐最新的模型发布,期待一次神奇的升级。真正的升级是构建一个无论你用哪个模型都能持续复利的工作流。

Opus 4.6 是我用过的最适合这套系统的模型。但这套系统在 GPT-5.2 上也能用。下个季度发布的新模型上也能用。因为架构是模型无关的。智能在工作流中复利,而不仅仅在模型中。


总结:从今晚开始

不要试图今天就实装所有提示词。那是系统崩溃的开始。

建议节奏:

  • 第 1 周: 跑"审计"提示词。选定 4 个自动化目标,完成最简单的那个。
  • 第 2 周: 对第二个目标跑"架构师"提示词,动手构建。
  • 第 3 周: 用"分析师"审查前两周的成果,修补漏洞。
  • 第 4 周: 用"精炼厂"处理最重要的输出,感受质量飞跃。
  • 第 5 周: 运行"复利机",复盘一切,规划下个月。

如果你每周自动化一件事,3 个月后你就拥有 12 个工作流。大多数人只会收藏这篇文章,永远不会开始。而今晚就运行提示词 1 的人,到三月时将与自己的工作量建立完全不同的关系。

复制这些提示词,将评分标准定制为你的实际工作。留下更好的,忽略没用的。

这就是整套系统。


P.S. 如果你想看更多 AI 技巧和工作流,欢迎订阅我的免费 Newsletter[1]。

高可用架构:这篇文章的核心不在于吹捧某个特定的模型,而是在于揭示一个被大多数人忽略的真相:AI 生产力的本质不是“寻找完美的指令”,而是“构建闭环的系统”。


深度解读:从“点对点”到“环对环”

如果我们将传统的 AI 使用比作“自动售货机”(投币、选货、拿走),那么这篇文章提出的系统则是一座数字工厂。

  • 打破孤立: 传统的 Prompt 是消耗性的,用完即弃;而系统通过审计定位痛点,通过架构减少返工,通过复利积累经验。
  • 对抗遗忘: 大多数 AI 的使用习惯是“断裂”的。这篇文章利用了 Opus 4.6 的超长上下文(1M Tokens),将 AI 从一个“短期记忆的临时工”转变为“拥有长期记忆的运营总监”。
  • 精力的隐形价值: 值得注意的一个视角是,作者不仅关注时间,更关注精力(Energy Drain)。这反映了现代生产力的核心:那些不费时但由于“心累”导致你不断拖延的任务,才是自动化最该攻克的堡垒。

总结:系统的力量

阶段核心价值你将获得
诊断与规划解决“做什么”和“怎么做”的问题避免在错误的方向上浪费算力,确保每一行指令都击中痛点。
执行与审查解决“好不好”和“稳不稳”的问题建立自己的工程标准,让 AI 的产出不仅是“能用”,而是“专业”。
反馈与进化解决“复利”和“持续增长”的问题随着时间推移,AI 会越来越像你的大脑镜像,实现真正的被动效率。

最后一点诚恳的建议:别被那 100 万 token 的上限吓到,也别因为自己还没用上最新的模型而止步。系统的架构是跨模型的。 即使模型迭代,只要你的工作流逻辑还在,你就是那个在潮水更替时依然坐在指挥位上的人。

参考阅读

原文:https://x.com/godofprompt/status/2020499426389741784[2]

References

  1. Newsletter: https://godofprompt.beehiiv.com/
  2. https://x.com/godofprompt/status/2020499426389741784