Howie和小能熊

agent 生产力 = Insight × Context × Model

上周五晚上用 2 小时做了一场 agent 专题讲座。现在,高度压缩后的大纲笔记来了。

本讲义的产生方式,也是纯agentic方式:

  • 把claude code和 openai codex作为通用agent(general agent)
  • 运行在 vs code环境
  • 由 sonnet 4.5 和gpt-5 模型驱动
  • 使用自定义的三级笔记 skill,
  • 一次性整理而成。
Image

我不想对agent的产出内容过度整理,毕竟,这篇笔记的存在目的不过是:帮助还没来得及听直播讲座的人快速了解内容,帮助已经听过直播的人复习回顾,提升学习效果。

欢迎大家给我反馈,我会按需迭代。迭代到位,我单独写文章来分享相关技巧。

点击“阅读原文”,直达原始讲座视频。重要主题,实战分享,值得你宝贵的注意力资源。

Image

《ai agents 专题讲座》三级笔记

笔记 by howieserious.agent, using 三级笔记 skill

2025年是Agent之年,标志着AI从简单的聊天机器人(Chatbot)和推理模型(Reasoner)进化到能够主动采取行动、完成目标的智能系统。

Agent范式的本质是让AI从"预测下一个token"转变为"在循环中主动完成目标",这将从根本上改变人们使用AI的方式。

关键不在于Prompt Engineering的技巧,而在于三个要素的乘法关系: Insight(洞察) × Context(上下文) × Model(模型) = Output(产出)。

Image

一、Agent范式的实践演示

Coding Agent的通用化应用

演示者将Claude Code和Codex这两个专业的编程Agent转化为通用的读写Agent/白领任务agent,在VS Code环境中处理日常的阅读和写作任务。

核心做法:

  • 将Markdown编辑器从传统工具(如iA Writer)迁移到VS Code和Cursor
  • 在VS Code环境中创建”Agentic Writing"项目,配置agent的运行环境
  • 通过CLAUDE.md定义agent的"长时记忆",描述项目结构、文件夹用途
  • 在commands文件夹中存放一系列的skill prompts(三级笔记、五百字费曼、Markdown排版等)

实践案例:

  1. 阅读辅助: 对Claude Code最佳实践文档执行"三级笔记"命令,Agent自动读取文件、理解目标、调用工具、产出结构化笔记
  2. 翻译任务: 翻译Sam Altman的"Abundant Intelligence"文章,或65个儿童必读绘本介绍(2万多字),一次性完成
  3. 写作流程: 接收Word文档 → Markdown排版 → 起标题 → 生成费曼导读,每个环节都可以用agent skill完成

关键洞察: Coding agent不只是为程序员服务,它能够灵活调用工具、操作文件系统、执行批处理脚本,完全可以成为普通人的通用agent。

Agent的运作环境

Agent在VS Code这样的环境中运行,具备:

  • 文件系统访问: 读写各种格式的文件
  • 工具调用能力: 内部工具(Python、bash)和外部工具(通过MCP连接)
  • 多种运行模式: 对话模式、agent模式、完全授权模式、plan mode(制定计划后再执行)
  • 长时间运行: 当前agent最长可运行30小时,相当于人类一周的有效工作时间

与传统方式的对比:

  • 传统: 在浏览器Web APP中chat,局限于对话框
  • Agent: 在本地工作环境中,agent可以主动读写文件、执行脚本、调用各种工具,直到完成目标

二、Agent的定义与本质

严格的Agent定义

真正的LLM Agent(大语言模型Agent)必须具备以下核心特征:

  1. 目标导向: 能够理解并执行用户设定的目标
  2. 制定计划: 将复杂目标分解为多步骤的执行计划
  3. 推理能力: 具备顶级的逻辑推理和思考能力
  4. 主动行动: 不断采取行动去改变外部环境
  5. 工具调用: 灵活调用内部和外部的各种工具
  6. 反思调整: 根据执行结果反思,调整计划和行动
  7. 循环执行: 形成"计划-执行-反思-调整"的loop,直到完成目标

简洁定义: Agent是由LLM驱动的系统,它能够灵活调用各种工具,通过循环(loop)的方式主动完成目标。

真Agent vs 伪Agent

真正改变世界的Agent:

  • Deep Research Agent: 从根本上改变了人类做研究的方式
  • Coding Agent: Claude Code、Codex等,改变了编程工作流
  • 写作类Agent: 知识工作agent、白领agent(正在发展中)

伪Agent(不符合定义):

  • 国内很多"智能体"只是简单的prompt + 简单的RAG知识库
  • 形如"你是一个算卦的/中介/专家"的角色扮演prompt
  • 缺乏主动行动、工具调用、反思循环等核心能力
  • 很多宣称是“智能体”的ai,其实只是简单的RAG,不是真正的agent

三、AI范式的三次跃迁

范式演进: 从Chatbot到Agent

根据OpenAI的AGI分级框架,AI发展经历了三个主要范式:

Level 1: Chatbot(2023年)

  • 预测机制: Predict next token(概念)
  • 核心能力: 生成式对话,像"鹦鹉学舌"一样产出文本
  • 限制: 被困在Web APP或iOS APP中,只能聊天
  • 最小生成单位: Concept(概念)

Level 2: Reasoner(2024年)

  • 预测机制: Predict next thought(推理步骤)
  • 核心能力: Think step-by-step,逻辑推理能力突飞猛进
  • 里程碑: O1模型开启推理范式,O3、GPT-5不断进化
  • 成就: 一年内从小学数学水平进化到国际数学奥赛金牌水平
  • 最小生成单位: Thought(推理步骤)

Level 3: Agent(2025年)

  • 预测机制: Predict next action(行动)
  • 核心能力: 主动采取行动,改变外部环境,完成目标
  • 突破: 从iOS/Web APP中"释放"出来,进入本地工作环境(如VS Code)
  • 工具能力: MCP外部工具、bash、Python、Computer Use等
  • 最小生成单位: Action(行动)
    Image

3.2 范式转变的深刻意义

从Chat到Agent的矛盾:

  • 一方面: 人们认可"compute会吃掉一切",AI革命即将到来
  • 另一方面: 日常使用只是简单chat,消耗不了多少token
  • 核心问题: 用2023年的Chat方式使用2025年的Agent模型

TOKEN消耗量的意义:

  • TOKEN消耗量将成为衡量个人和公司的重要指标(类似收入、利润)
  • Chat模式: 即使24/7使用,一个月也就消耗100万token(15美元)
  • Agent模式: 理论上可以消耗海量token,创造成倍的价值
  • 价值公式: 消耗100美元token → 产出300美元价值;消耗1000美元 → 产出3000美元价值

四、Agent的底层逻辑:三要素乘法公式

产出公式的推导

传统误区: Prompt Engineering是关键真实情况: Prompt Engineering没什么用,真正重要的是内容

经典案例(宝玉老师的雷军演讲prompt):

  • 尝试各种Prompt Engineering技巧 → 效果一般
  • 加入一条网友总结的"雷军演讲特点"洞察 → 质量立刻特别高
  • 启示: 一个人类的洞察 > 所有的Prompt技巧

Prompt Engineering的本质:

  • 真正的Prompt Engineering只有一句话:写Prompt需要结构化
  • 结构化 = 定义角色 + 清晰的任务指示 + 输出格式
  • 真正重要的是prompt里的内容,而内容来自人的洞察

三要素公式

Output(产出) = Insight(洞察) × Context(上下文) × Model(模型)

要素一: Insight(洞察)

  • 你对任务本身的深度理解和专业认知
  • 对写作/学习/投资/领域的insight越深,prompt质量越高
  • 不是prompt技巧,而是你把洞察用结构化方式描述出来的能力
  • 示例: 如何写10万+文章、如何在Twitter涨粉、如何做投资

要素二: Context(上下文)

  • 你给模型提供的高质量上下文,决定了产出的上限
  • 包括: 个人知识库(Obsidian/Logseq)、专业资料、历史数据、相关文档
  • Context engineering的价值在AI时代被极大放大
  • 示例: 60万字的《内驱式学习》作为agent的context

要素三: Model(模型)

  • 使用当下最顶级的模型(GPT-5、Claude Sonnet 4.5等)
  • 模型具备的超能力: 推理、工具调用、反思、长时间运行
  • 这是我们唯一"等待"的要素,只要用最好的即可

公式特点:

  • 乘法关系,不是加法: 任何一项为0,产出就是0
  • Insight和Context是完全由自己把控的
  • 在AI时代不能再"线性努力",要用符合时代的新范式创造价值

五、如何拥抱Agent范式

第一步:建立概念性理解

概念理解 > 操作掌握:

  • 不需要成为程序员,也不需要会写代码
  • 需要对agent的运作方式、能力边界形成清晰的心理模型
  • 理解大语言模型生态、技术范式、各种模型特点
  • 建立关于agent的知识体系和核心概念

推荐学习路径:

Image

Claude Code in Action: Anthropic官方课程,半天可学完

  • 内容: Claude Code是什么、安装设置、上下文管理、实践应用
  • 对象: 非程序员也可以学,重在概念性理解
Image

Agentic AI(吴恩达课程): deeplearning.ai免费课程,5天学完

  • 内容: agent工作流、设计范式、反思机制、工具调用、实践经验
  • 特点: 系统讲解agent的设计思想和底层逻辑

第二步:设计 Agentic Workflow

Know Thyself(认识你自己):

  • 理解"你是如何工作的" → 就能设计出"你的agent"
  • 梳理你擅长的领域、工作流程、成功经验
  • 把隐性知识显性化,形成SOP(标准操作流程)

Workflow设计要点:

  • 明确你在哪个领域是专家/高手
  • 梳理清晰的工作流程、规范、验收标准
  • 定义每个环节的目标、输入、输出
  • 像写"新员工手册"一样,把做事方法教给agent

可能的agent方向:

  • 写作agent: 公众号写作、Twitter内容、视频脚本
  • 翻译agent: 高质量英文书籍翻译
  • 投资agent: 投资研究、标的分析、信息收集
  • 学习agent: 基于《内驱式学习》等方法论的学习辅助

第三步:写出结构化Prompt(Skills)

Prompt管理的新方法:

  • 模块化管理 > 整体管理
  • 不要写又臭又长的prompt,而是拆解成可复用的模块

模块化分类:

  1. Role模块: 不同的角色定义(教练、专家、翻译家等)
  2. Task模块: 翻译、做研究、写推特、写公众号、写视频脚本、排版等
  3. Format模块: 语言风格(Paul Graham、余华、马尔克斯、马克吐温等)

模块化优势:

  • 灵活组装: 今天用PG风格+翻译任务,明天用余华风格+写作任务
  • 持续沉淀: 每个模块不断迭代优化
  • 知识管理: 像管理概念和思维模型一样管理prompt模块

面向Agent的Prompt:

  • 针对GPT-5这样的agent model,要写"Agentic Prompt"
  • 包含: planning(如何制定计划)、reflection(如何反思)等模块
  • 强调行动导向、工具调用、循环执行

第四步:Context Engineering

Context的重要性:

  • 在Agent范式中,context engineering的作用无比巨大
  • 个人知识管理的价值在AI时代才真正发挥出来

如何构建高质量Context:

  • 使用Obsidian、Logseq等工具做个人知识管理
  • 积累领域内的专业资料、经验笔记
  • 将毕生所学转化为系统的方法论(如60万字的书)
  • 随时补充、随时修改CLAUDE.md(agent的长时记忆)

Context vs 玄学Prompt:

  • 有context: 基于60万字专业内容的agent → 最好的agent
  • 无context: 从网上东拼西凑的玄学prompt → 不靠谱
  • 很多"流行prompt"都是AI写的,又臭又长,没有实际价值

Context Window的优势:

  • GPT-5 agent: 40万context window + 20万输出限制
  • 能力极强,可以长时间运行,处理大量信息

六、Agent范式的深远影响

计算力的转移:从人脑到GPU

核心逻辑:

  • 过去人脑做的compute(计算),将转移到GPU做的compute
  • 很多脑力劳动没必要由人来做,agent可以做得更好

具体案例:

  1. 翻译:

  • 过去: 顶级译者3个月,3万元/月 = 10万元
  • 现在: Agent一个晚上,消耗1000万token ≈ 100-200美元
  • 心理咨询:

    • 过去: 1000元/小时 × 30小时 = 3万元
    • 现在: 善解人意的心理咨询agent,100美元token就够了
  • 翻译生意:

    • 案例: 有人做优质外文信息流订阅,年收入1000多万
    • 核心: 只是把流程打磨清楚,用AI做中英对照
    • 他们甚至还没用到最顶级的AI

    TOKEN消耗量作为新指标

    公司层面:

    • Duolingo、Figma、Canva: 每年在OpenAI消耗1万亿token
    • TOKEN消耗量将像收入、利润一样成为重要财务指标

    个人层面:

    • TOKEN消耗量 = 认知劳动的强度和价值
    • 对比: 消耗500万短视频 vs 消耗500万高质量reasoning token
    • 理想状态: 每月消耗100-1000美元的高质量token

    当前现状:

    • 很多人: 付200美元/月,只用了2美元(99%剩余)
    • 原因: 用chat模式,即使24/7使用也用不完
    • 目标: 用agent模式,把额度"用爆",创造成倍价值

    工作方式的革命性改变

    传统线性努力 vs Agent时代:

    • 传统: 工作8小时不够 → 10小时 → 12小时,疯狂搬砖
    • Agent: 用更少的时间,更快更好地完成擅长的事

    Agent的想象空间:

    • 投资理财agent: 研究标的、制定策略,可能成为付费服务
    • 写作agent: 替代日常写作工作,"摸鱼"的同时效率提升
    • 复制你自己: 把你的insight和context给agent,相当于复制了一个你

    不是更忙,是更从容:

    • 有限的脑力去做更高级、更有创造性的事
    • 开拓新边界、探索新领域
    • Insight变得更深,变得更智慧和从容

    VS Code vs Obsidian

    相似性:

    • Obsidian本来就是"普通人的VS Code"
    • 开发者在2020年的理念: 给普通人做一个能用的Cursor
    • 都是插件生态、都支持Markdown、都是知识管理工具

    当下实践:

    • VS Code + Claude Code/Codex: 已经可以用于日常读写
    • 未来可能: Obsidian插件版的agent(针对普通人优化)
    • 短期内不会有: 所以现在就可以把VS Code用起来

    七、关键概念与术语

    • Agent: 由大语言模型驱动、能够灵活调用工具、通过循环主动完成目标的系统
    • LLM Agent: 大语言模型Agent,区别于其他类型的agent(如AlphaGo)
    • Agentic Prompt: 面向agent model编写的prompt,强调行动、工具调用、循环
    • Context Engineering: 为agent提供高质量上下文的能力,在agent范式中极其重要
    • TOKEN消耗量: 衡量认知劳动强度和价值的新指标
    • MCP: Model Context Protocol,让agent连接外部工具的协议
    • Computer Use: Agent直接操作电脑的能力(文件、bash、Python等)
    • Tool Use: Agent灵活调用工具的能力
    • Plan Mode: Agent先制定计划、等待批准再执行的模式
    • Reflection: Agent的反思能力,根据结果调整计划和行动
    • Loop: Agent的循环机制(计划-执行-反思-调整),直到完成目标
    • GPT-5: OpenAI的agent model,40万context window + 20万输出限制
    • Claude Sonnet 4.5: Anthropic的顶级模型
    • Codex: OpenAI专门针对编程优化的agent
    • Claude Code: Anthropic的coding agent
    • Obsidian/Logseq: 个人知识管理工具
    • VS Code: 程序员的IDE,也是agent的运行环境

    八、实践要点与注意事项

    人与Agent的协作

    人的不可替代性:

    • Agent不能替代人对结果负责
    • 每个环节都需要人来把控质量
    • 基于品位、判断力和经验做筛选

    反例警示:

    • 有人用agent写文章,但他不知道什么是好文章。即使用最先进的agent,产出的也可能是"slop"(低质量内容)。
    • 限制产出质量的不是模型,而是人的水平

    Prompt管理的误区

    玄学Prompt:

    • 期待从网上找一个prompt,copy后神奇产出高质量结果
    • 很多流行prompt是AI写的,又臭又长,没有实际价值
    • 这是一种不靠谱的"玄学期待"

    正确做法:

    • 把自己的insight和洞察转化为真正的prompt
    • 模块化管理,持续迭代优化
    • 结合高质量context,而不是玄学技巧

    九、未来展望

    2025:Agent元年

    • 前半年: Claude Code、GPT-5 Codex相继火起来
    • 核心特征: 从Web APP中"释放"出来,进入本地工作环境
    • 发展速度: 几个月内快速迭代,能力飞速提升
    • 影响范围: 将直接冲击大家习以为常的现状

    Agent的想象力

    取决于你的想象力和洞察:

    • 目前最火: 编程agent、主题研究agent
    • 潜力巨大: 写作agent、投资agent、学习agent、健康agent
    • 核心: 只要你梳理清楚workflow,提供好的context,就能创造价值

    Me.Agent:

    • 把"你是如何工作的"设计成你自己的agent
    • me.agent(例如,howieserious.agent): 每个人都可以有自己的专属agent
    • 复制你的能力: 把你的insight、context、skills给agent

    价值创造的新范式

    不存在玄学:

    • 不存在玄学的Prompt Engineering
    • 不存在玄学的Prompt
    • 真正有价值的: Insight + Context + Model

    新的工作方式:

    • 不是让你更忙,而是更从容
    • 用更少的脑力,做更多更好更快的事
    • 端起咖啡,看着agent干活
    • 脑力用于更高级、更有创造性的事

    总结

    Agent范式代表了从"chat"到"action"的根本性转变。2025年,我们不能再用2023年的Chat方式使用AI。真正的Agent是一个由大语言模型驱动的系统,它能够:制定计划、主动行动、灵活调用工具、反思调整、循环执行,直到完成目标。

    关键不在于Prompt Engineering的技巧,而在于Insight(洞察) × Context(上下文) × Model(模型) 这三要素的乘法。在这个新范式下,个人知识管理的价值被极大放大,TOKEN消耗量成为衡量认知劳动的新指标,而人的角色从执行者转变为设计者和把关者。

    拥抱Agent范式的路径是:建立概念性理解 → 设计Agentic Workflow → 写出模块化的结构化Prompt → 提供高质量的Context。最终,每个人都可以创造出自己的"Me.Agent",用AI时代的新方式创造价值。