agent 生产力 = Insight × Context × Model
上周五晚上用 2 小时做了一场 agent 专题讲座。现在,高度压缩后的大纲笔记来了。
本讲义的产生方式,也是纯agentic方式:
把claude code和 openai codex作为通用agent(general agent) 运行在 vs code环境 由 sonnet 4.5 和gpt-5 模型驱动 使用自定义的 三级笔记skill,一次性整理而成。
我不想对agent的产出内容过度整理,毕竟,这篇笔记的存在目的不过是:帮助还没来得及听直播讲座的人快速了解内容,帮助已经听过直播的人复习回顾,提升学习效果。
欢迎大家给我反馈,我会按需迭代。迭代到位,我单独写文章来分享相关技巧。
点击“阅读原文”,直达原始讲座视频。重要主题,实战分享,值得你宝贵的注意力资源。
《ai agents 专题讲座》三级笔记
笔记 by howieserious.agent, using
三级笔记skill
2025年是Agent之年,标志着AI从简单的聊天机器人(Chatbot)和推理模型(Reasoner)进化到能够主动采取行动、完成目标的智能系统。
Agent范式的本质是让AI从"预测下一个token"转变为"在循环中主动完成目标",这将从根本上改变人们使用AI的方式。
关键不在于Prompt Engineering的技巧,而在于三个要素的乘法关系: Insight(洞察) × Context(上下文) × Model(模型) = Output(产出)。
一、Agent范式的实践演示
Coding Agent的通用化应用
演示者将Claude Code和Codex这两个专业的编程Agent转化为通用的读写Agent/白领任务agent,在VS Code环境中处理日常的阅读和写作任务。
核心做法:
将Markdown编辑器从传统工具(如iA Writer)迁移到VS Code和Cursor 在VS Code环境中创建”Agentic Writing"项目,配置agent的运行环境 通过CLAUDE.md定义agent的"长时记忆",描述项目结构、文件夹用途 在commands文件夹中存放一系列的skill prompts(三级笔记、五百字费曼、Markdown排版等)
实践案例:
阅读辅助: 对Claude Code最佳实践文档执行"三级笔记"命令,Agent自动读取文件、理解目标、调用工具、产出结构化笔记 翻译任务: 翻译Sam Altman的"Abundant Intelligence"文章,或65个儿童必读绘本介绍(2万多字),一次性完成 写作流程: 接收Word文档 → Markdown排版 → 起标题 → 生成费曼导读,每个环节都可以用agent skill完成
关键洞察: Coding agent不只是为程序员服务,它能够灵活调用工具、操作文件系统、执行批处理脚本,完全可以成为普通人的通用agent。
Agent的运作环境
Agent在VS Code这样的环境中运行,具备:
文件系统访问: 读写各种格式的文件 工具调用能力: 内部工具(Python、bash)和外部工具(通过MCP连接) 多种运行模式: 对话模式、agent模式、完全授权模式、plan mode(制定计划后再执行) 长时间运行: 当前agent最长可运行30小时,相当于人类一周的有效工作时间
与传统方式的对比:
传统: 在浏览器Web APP中chat,局限于对话框 Agent: 在本地工作环境中,agent可以主动读写文件、执行脚本、调用各种工具,直到完成目标
二、Agent的定义与本质
严格的Agent定义
真正的LLM Agent(大语言模型Agent)必须具备以下核心特征:
目标导向: 能够理解并执行用户设定的目标 制定计划: 将复杂目标分解为多步骤的执行计划 推理能力: 具备顶级的逻辑推理和思考能力 主动行动: 不断采取行动去改变外部环境 工具调用: 灵活调用内部和外部的各种工具 反思调整: 根据执行结果反思,调整计划和行动 循环执行: 形成"计划-执行-反思-调整"的loop,直到完成目标
简洁定义: Agent是由LLM驱动的系统,它能够灵活调用各种工具,通过循环(loop)的方式主动完成目标。
真Agent vs 伪Agent
真正改变世界的Agent:
Deep Research Agent: 从根本上改变了人类做研究的方式 Coding Agent: Claude Code、Codex等,改变了编程工作流 写作类Agent: 知识工作agent、白领agent(正在发展中)
伪Agent(不符合定义):
国内很多"智能体"只是简单的prompt + 简单的RAG知识库 形如"你是一个算卦的/中介/专家"的角色扮演prompt 缺乏主动行动、工具调用、反思循环等核心能力 很多宣称是“智能体”的ai,其实只是简单的RAG,不是真正的agent
三、AI范式的三次跃迁
范式演进: 从Chatbot到Agent
根据OpenAI的AGI分级框架,AI发展经历了三个主要范式:
Level 1: Chatbot(2023年)
预测机制: Predict next token(概念) 核心能力: 生成式对话,像"鹦鹉学舌"一样产出文本 限制: 被困在Web APP或iOS APP中,只能聊天 最小生成单位: Concept(概念)
Level 2: Reasoner(2024年)
预测机制: Predict next thought(推理步骤) 核心能力: Think step-by-step,逻辑推理能力突飞猛进 里程碑: O1模型开启推理范式,O3、GPT-5不断进化 成就: 一年内从小学数学水平进化到国际数学奥赛金牌水平 最小生成单位: Thought(推理步骤)
Level 3: Agent(2025年)
预测机制: Predict next action(行动) 核心能力: 主动采取行动,改变外部环境,完成目标 突破: 从iOS/Web APP中"释放"出来,进入本地工作环境(如VS Code) 工具能力: MCP外部工具、bash、Python、Computer Use等 最小生成单位: Action(行动)
3.2 范式转变的深刻意义
从Chat到Agent的矛盾:
一方面: 人们认可"compute会吃掉一切",AI革命即将到来 另一方面: 日常使用只是简单chat,消耗不了多少token 核心问题: 用2023年的Chat方式使用2025年的Agent模型
TOKEN消耗量的意义:
TOKEN消耗量将成为衡量个人和公司的重要指标(类似收入、利润) Chat模式: 即使24/7使用,一个月也就消耗100万token(15美元) Agent模式: 理论上可以消耗海量token,创造成倍的价值 价值公式: 消耗100美元token → 产出300美元价值;消耗1000美元 → 产出3000美元价值
四、Agent的底层逻辑:三要素乘法公式
产出公式的推导
传统误区: Prompt Engineering是关键真实情况: Prompt Engineering没什么用,真正重要的是内容
经典案例(宝玉老师的雷军演讲prompt):
尝试各种Prompt Engineering技巧 → 效果一般 加入一条网友总结的"雷军演讲特点"洞察 → 质量立刻特别高 启示: 一个人类的洞察 > 所有的Prompt技巧
Prompt Engineering的本质:
真正的Prompt Engineering只有一句话:写Prompt需要结构化 结构化 = 定义角色 + 清晰的任务指示 + 输出格式 真正重要的是prompt里的内容,而内容来自人的洞察
三要素公式
Output(产出) = Insight(洞察) × Context(上下文) × Model(模型)
要素一: Insight(洞察)
你对任务本身的深度理解和专业认知 对写作/学习/投资/领域的insight越深,prompt质量越高 不是prompt技巧,而是你把洞察用结构化方式描述出来的能力 示例: 如何写10万+文章、如何在Twitter涨粉、如何做投资
要素二: Context(上下文)
你给模型提供的高质量上下文,决定了产出的上限 包括: 个人知识库(Obsidian/Logseq)、专业资料、历史数据、相关文档 Context engineering的价值在AI时代被极大放大 示例: 60万字的《内驱式学习》作为agent的context
要素三: Model(模型)
使用当下最顶级的模型(GPT-5、Claude Sonnet 4.5等) 模型具备的超能力: 推理、工具调用、反思、长时间运行 这是我们唯一"等待"的要素,只要用最好的即可
公式特点:
乘法关系,不是加法: 任何一项为0,产出就是0 Insight和Context是完全由自己把控的 在AI时代不能再"线性努力",要用符合时代的新范式创造价值
五、如何拥抱Agent范式
第一步:建立概念性理解
概念理解 > 操作掌握:
不需要成为程序员,也不需要会写代码 需要对agent的运作方式、能力边界形成清晰的心理模型 理解大语言模型生态、技术范式、各种模型特点 建立关于agent的知识体系和核心概念
推荐学习路径:
Claude Code in Action: Anthropic官方课程,半天可学完
内容: Claude Code是什么、安装设置、上下文管理、实践应用 对象: 非程序员也可以学,重在概念性理解
Agentic AI(吴恩达课程): deeplearning.ai免费课程,5天学完
内容: agent工作流、设计范式、反思机制、工具调用、实践经验 特点: 系统讲解agent的设计思想和底层逻辑
第二步:设计 Agentic Workflow
Know Thyself(认识你自己):
理解"你是如何工作的" → 就能设计出"你的agent" 梳理你擅长的领域、工作流程、成功经验 把隐性知识显性化,形成SOP(标准操作流程)
Workflow设计要点:
明确你在哪个领域是专家/高手 梳理清晰的工作流程、规范、验收标准 定义每个环节的目标、输入、输出 像写"新员工手册"一样,把做事方法教给agent
可能的agent方向:
写作agent: 公众号写作、Twitter内容、视频脚本 翻译agent: 高质量英文书籍翻译 投资agent: 投资研究、标的分析、信息收集 学习agent: 基于《内驱式学习》等方法论的学习辅助
第三步:写出结构化Prompt(Skills)
Prompt管理的新方法:
模块化管理 > 整体管理 不要写又臭又长的prompt,而是拆解成可复用的模块
模块化分类:
Role模块: 不同的角色定义(教练、专家、翻译家等) Task模块: 翻译、做研究、写推特、写公众号、写视频脚本、排版等 Format模块: 语言风格(Paul Graham、余华、马尔克斯、马克吐温等)
模块化优势:
灵活组装: 今天用PG风格+翻译任务,明天用余华风格+写作任务 持续沉淀: 每个模块不断迭代优化 知识管理: 像管理概念和思维模型一样管理prompt模块
面向Agent的Prompt:
针对GPT-5这样的agent model,要写"Agentic Prompt" 包含: planning(如何制定计划)、reflection(如何反思)等模块 强调行动导向、工具调用、循环执行
第四步:Context Engineering
Context的重要性:
在Agent范式中,context engineering的作用无比巨大 个人知识管理的价值在AI时代才真正发挥出来
如何构建高质量Context:
使用Obsidian、Logseq等工具做个人知识管理 积累领域内的专业资料、经验笔记 将毕生所学转化为系统的方法论(如60万字的书) 随时补充、随时修改CLAUDE.md(agent的长时记忆)
Context vs 玄学Prompt:
有context: 基于60万字专业内容的agent → 最好的agent 无context: 从网上东拼西凑的玄学prompt → 不靠谱 很多"流行prompt"都是AI写的,又臭又长,没有实际价值
Context Window的优势:
GPT-5 agent: 40万context window + 20万输出限制 能力极强,可以长时间运行,处理大量信息
六、Agent范式的深远影响
计算力的转移:从人脑到GPU
核心逻辑:
过去人脑做的compute(计算),将转移到GPU做的compute 很多脑力劳动没必要由人来做,agent可以做得更好
具体案例:
翻译:
过去: 顶级译者3个月,3万元/月 = 10万元 现在: Agent一个晚上,消耗1000万token ≈ 100-200美元
心理咨询:
过去: 1000元/小时 × 30小时 = 3万元 现在: 善解人意的心理咨询agent,100美元token就够了
翻译生意:
案例: 有人做优质外文信息流订阅,年收入1000多万 核心: 只是把流程打磨清楚,用AI做中英对照 他们甚至还没用到最顶级的AI
TOKEN消耗量作为新指标
公司层面:
Duolingo、Figma、Canva: 每年在OpenAI消耗1万亿token TOKEN消耗量将像收入、利润一样成为重要财务指标
个人层面:
TOKEN消耗量 = 认知劳动的强度和价值 对比: 消耗500万短视频 vs 消耗500万高质量reasoning token 理想状态: 每月消耗100-1000美元的高质量token
当前现状:
很多人: 付200美元/月,只用了2美元(99%剩余) 原因: 用chat模式,即使24/7使用也用不完 目标: 用agent模式,把额度"用爆",创造成倍价值
工作方式的革命性改变
传统线性努力 vs Agent时代:
传统: 工作8小时不够 → 10小时 → 12小时,疯狂搬砖 Agent: 用更少的时间,更快更好地完成擅长的事
Agent的想象空间:
投资理财agent: 研究标的、制定策略,可能成为付费服务 写作agent: 替代日常写作工作,"摸鱼"的同时效率提升 复制你自己: 把你的insight和context给agent,相当于复制了一个你
不是更忙,是更从容:
有限的脑力去做更高级、更有创造性的事 开拓新边界、探索新领域 Insight变得更深,变得更智慧和从容
VS Code vs Obsidian
相似性:
Obsidian本来就是"普通人的VS Code" 开发者在2020年的理念: 给普通人做一个能用的Cursor 都是插件生态、都支持Markdown、都是知识管理工具
当下实践:
VS Code + Claude Code/Codex: 已经可以用于日常读写 未来可能: Obsidian插件版的agent(针对普通人优化) 短期内不会有: 所以现在就可以把VS Code用起来
七、关键概念与术语
Agent: 由大语言模型驱动、能够灵活调用工具、通过循环主动完成目标的系统 LLM Agent: 大语言模型Agent,区别于其他类型的agent(如AlphaGo) Agentic Prompt: 面向agent model编写的prompt,强调行动、工具调用、循环 Context Engineering: 为agent提供高质量上下文的能力,在agent范式中极其重要 TOKEN消耗量: 衡量认知劳动强度和价值的新指标 MCP: Model Context Protocol,让agent连接外部工具的协议 Computer Use: Agent直接操作电脑的能力(文件、bash、Python等) Tool Use: Agent灵活调用工具的能力 Plan Mode: Agent先制定计划、等待批准再执行的模式 Reflection: Agent的反思能力,根据结果调整计划和行动 Loop: Agent的循环机制(计划-执行-反思-调整),直到完成目标 GPT-5: OpenAI的agent model,40万context window + 20万输出限制 Claude Sonnet 4.5: Anthropic的顶级模型 Codex: OpenAI专门针对编程优化的agent Claude Code: Anthropic的coding agent Obsidian/Logseq: 个人知识管理工具 VS Code: 程序员的IDE,也是agent的运行环境
八、实践要点与注意事项
人与Agent的协作
人的不可替代性:
Agent不能替代人对结果负责 每个环节都需要人来把控质量 基于品位、判断力和经验做筛选
反例警示:
有人用agent写文章,但他不知道什么是好文章。即使用最先进的agent,产出的也可能是"slop"(低质量内容)。 限制产出质量的不是模型,而是人的水平
Prompt管理的误区
玄学Prompt:
期待从网上找一个prompt,copy后神奇产出高质量结果 很多流行prompt是AI写的,又臭又长,没有实际价值 这是一种不靠谱的"玄学期待"
正确做法:
把自己的insight和洞察转化为真正的prompt 模块化管理,持续迭代优化 结合高质量context,而不是玄学技巧
九、未来展望
2025:Agent元年
前半年: Claude Code、GPT-5 Codex相继火起来 核心特征: 从Web APP中"释放"出来,进入本地工作环境 发展速度: 几个月内快速迭代,能力飞速提升 影响范围: 将直接冲击大家习以为常的现状
Agent的想象力
取决于你的想象力和洞察:
目前最火: 编程agent、主题研究agent 潜力巨大: 写作agent、投资agent、学习agent、健康agent 核心: 只要你梳理清楚workflow,提供好的context,就能创造价值
Me.Agent:
把"你是如何工作的"设计成你自己的agent me.agent(例如,howieserious.agent): 每个人都可以有自己的专属agent 复制你的能力: 把你的insight、context、skills给agent
价值创造的新范式
不存在玄学:
不存在玄学的Prompt Engineering 不存在玄学的Prompt 真正有价值的: Insight + Context + Model
新的工作方式:
不是让你更忙,而是更从容 用更少的脑力,做更多更好更快的事 端起咖啡,看着agent干活 脑力用于更高级、更有创造性的事
总结
Agent范式代表了从"chat"到"action"的根本性转变。2025年,我们不能再用2023年的Chat方式使用AI。真正的Agent是一个由大语言模型驱动的系统,它能够:制定计划、主动行动、灵活调用工具、反思调整、循环执行,直到完成目标。
关键不在于Prompt Engineering的技巧,而在于Insight(洞察) × Context(上下文) × Model(模型) 这三要素的乘法。在这个新范式下,个人知识管理的价值被极大放大,TOKEN消耗量成为衡量认知劳动的新指标,而人的角色从执行者转变为设计者和把关者。
拥抱Agent范式的路径是:建立概念性理解 → 设计Agentic Workflow → 写出模块化的结构化Prompt → 提供高质量的Context。最终,每个人都可以创造出自己的"Me.Agent",用AI时代的新方式创造价值。