三个 Agent 一条龙:调研→脚本→缩略图,我用 OpenClaw 搭了一条 YouTube 内容流水线
一个人,三个 Agent,45 分钟日更。这不是概念验证,这是我过去 30 天真实跑通的内容生产系统。
写在最前面:为什么我要写这篇文章
2026 年开年,AI 圈发生了一件不可思议的事。
OpenClaw 已经突破了 250K+ star,超越 React 成为 GitHub 上 star 数最多的非聚合类软件项目——这个头衔 React 保持了很多年。1 从零到第一,不到四个月,而且没有减速的迹象。1
要知道,React 花了整整十三年,依靠无数的岗位需求、企业架构选型和培训课程的反复灌输,才积累了超过 240,000 个 star。2 OpenClaw 在短短一百天内就达到了同样的高度。2
但比数字更重要的是——它到底在解决什么问题?
创造者 Peter Steinberger 将 OpenClaw 描述为"真正能做事的 AI",并将其定位为基于 AI 的虚拟助手。3 不同于提供另一个聊天机器人,OpenClaw 交付的是一个真正的个人 AI Agent——在本地运行,跨对话记住上下文,并且能够真正在你的机器上做事。4
我是一名独立 YouTube 创作者。过去一年,我每周最多更新 2 条视频,每条从选题到发布平均花 8 小时。这意味着每周 16 小时被锁死在内容生产上,剩下的时间几乎无法做任何创新。
在 OpenClaw 爆火之后,我花了 3 天搭建了一套三 Agent 协作的内容流水线。30 天后的今天,我实现了日更,每条视频的人工介入时间压缩到 45 分钟。
这篇文章,就是这 30 天的完整复盘。
第一章 痛点:一个 YouTube 创作者的 "不可能三角"
做 YouTube 的人都知道这个三角形:
text
质量
/ \
/ \
频率 ———— 成本
你只能选两个。高质量 + 高频率 = 烧钱请团队。高质量 + 低成本 = 慢到丢失算法推荐。高频率 + 低成本 = 垃圾内容,掉订阅。
我之前的成本结构是这样的:
| 合计 | 6-9 小时/条 |
请自由职业者?调研 200 + 缩略图 $30 = $280/条,日更一个月就是 $8,400。
对于一个 5 万订阅的频道来说,这个数字荒谬到可笑。
我需要的不是一个更好的工具,而是一整条流水线。
第二章 认识 OpenClaw:不只是聊天机器人
在展开技术方案之前,先用 30 秒理解 OpenClaw 的本质。
OpenClaw 是一个开源 AI Agent,通常在本地的 Mac Mini 或虚拟私有服务器上运行——它连接到 WhatsApp、Telegram、Slack 和 Discord 等平台。不同于仅仅响应查询的聊天机器人,OpenClaw 可以执行真实世界的任务,如阅读邮件、管理日历、运行终端命令、部署代码,以及在会话之间保持记忆。5
由 PSPDFKit 的创始人 Peter Steinberger 创建,OpenClaw 通过 API 与 Claude、GPT 和 DeepSeek 等大语言模型集成。它充当一个网关,将 AI 模型连接到你的工具和数据,可通过你首选消息应用中的对话式命令进行访问。5
关键差异在于——
大多数 AI 聊天机器人止步于生成文本。OpenClaw 专注于执行。6
而它的生态已经极其丰富。OpenClaw 的公共注册中心(ClawHub)截至 2026 年 2 月 28 日已托管了 13,729 个社区构建的技能。7 有了 ClawHub,安装技能现在就像安装应用一样简单。只需几条命令,你就可以将你的 Agent 扩展为邮件操作员、研究助手、工作流自动化引擎或长期知识伙伴。8
这意味着:你不需要从零开始写代码,社区已经帮你铺好了路。
第三章 架构全景:三个 Agent 是如何分工的
先看整体架构图——
text
┌─────────────────────────────────────────────────────────────┐
│ Discord 服务器 │
│ │
│ #video-research #scriptwriting #visual-design │
│ (Agent 1:调研猎手) (Agent 2:编剧) (Agent 3:设计师) │
│ │ │ │ │
│ ┌────▼────┐ ┌────▼────┐ ┌────▼────┐ │
│ │ Sonnet │ │ Opus │ │ Sonnet │ │
│ │ 快速扫描 │ │ 深度创作 │ │ 视觉生成 │ │
│ └────┬────┘ └────┬────┘ └────┬────┘ │
│ │ │ │ │
│ └────────┐ ┌───┘ │ │
│ ▼ ▼ │ │
│ Obsidian Vault │ │
│ (MEMORY.md + 每日笔记) │ │
│ │ │
│ #monitoring #briefing │ │
│ (Cron/健康/成本) (每日总结) │ │
│ │ │
│ ──────────── Telegram 告警推送 ──────────── │ │
└─────────────────────────────────────────────────────────────┘
这个架构的核心灵感来自社区中一位高产创作者分享的 50 天使用方案。他的设置是:OpenClaw 运行在 VPS 上,Discord 作为主要交互界面(每个工作流一个独立频道),Obsidian 用于笔记(Markdown 优先),Coolify 用于自托管服务。9
我在他的基础上做了 YouTube 内容生产的深度定制。
为什么选择 Discord 多频道?
频道就像各自训练好的独立员工。无论你的注意力是否在它上面,每条通道内的活动都在持续。进度在复合增长,因为多条流同时在推进。10
一个常见的设置是一个主"编排者"Agent 处理你的主聊天,它会为并行任务生成子 Agent。同时你还可以保留其他持久 Agent 绑定到独立频道,让它们独立运行自己的事情。11
而 OpenClaw 原生就支持这种架构。OpenClaw 可以在一个 Gateway 进程内运行多个完全隔离的 Agent。这里的"隔离"不是营销用语。每个 Agent 可以拥有自己的工作区目录和本地文件(如 SOUL.md 和 AGENTS.md)。它们仍然共享同一个服务器进程和同一份主配置文件,所以你不用运行十个 Gateway——你运行一个 Gateway,里面装着多个"大脑"。11
第四章 Agent 1——调研猎手(#video-research 频道)
职责
24/7 不间断扫描全网热点,发现值得做的 YouTube 选题,输出结构化选题报告。
核心 Skill 组合
① youtube-summarizer(竞品视频分析)
youtube-summarizer 自动检测 YouTube URL,检索视频元数据(标题、频道、发布日期、时长),并获取可用的字幕来生成结构化摘要,包含分段关键洞察、时间戳和精简要点。它还可以将完整字幕或摘要转发到消息平台(如 Telegram)进行分享或归档。12
实际用法:我把竞品频道最新视频的 URL 丢到 #video-research 频道,Agent 自动返回:
Markdown
## 竞品视频分析:[频道名] - [视频标题]
- 📊 时长:12:34 | 发布:2 天前
- 🔑 核心论点:3 个关键洞察(含时间戳)
- 🎯 Hook 策略:开头 30 秒用了"反直觉数据"型 Hook
- 💡 内容空白:未覆盖 [X] 角度,可作为我们的差异化切入点
- 📈 预估表现:基于该频道历史数据,此类选题平均播放量 XX
② youtube-transcript(字幕抓取+分析)
使用场景包括内容研究、辅助功能(字幕生成)、本地化、将视频内容转化为文章或社交帖子、内容审核与合规审查,以及接入下游 NLP 管线。13
这个 Skill 让我的 Agent 能"看"完一条 30 分钟的视频只需要 15 秒。
③ 每日 Cron 扫描任务
灵感来源于社区中的经典方案——通过 Cron 定时任务在每天早上 7:00 在 Discord #briefing 频道运行,它会:1. 扫描我 Twitter/X 时间线上最近约 100 条推文;2. 基于我的兴趣(AI、开发者工具、独立开发、内容创作、技术商业)挑出最相关的 Top 10 推文;3. 将结构化摘要写入 Obsidian 金库;4. 如果有推文和潜在的 YouTube 视频创意相关,将其追加到视频创意积压表;5. 在频道中发送一份摘要。9
我的调研 Agent 配置框架
YAML
# Agent 1: 调研猎手 配置
Agent ID: researcher
Workspace: ~/.openclaw/workspace-researcher
Model: claude-sonnet # 日常扫描用性价比最高的模型Cron Jobs:
- "0 7 * * *" # 每天 7:00 早间扫描
- "0 13 * * *" # 每天 13:00 午间补扫
- "0 20 * * *" # 每天 20:00 晚间总结
Skills:
- youtube-summarizer # 竞品视频结构化分析
- youtube-transcript # 字幕抓取与 NLP
- tavily # 实时网页搜索
- airadar # AI 工具/应用趋势信号
Output:
- Discord: #video-research (完整报告)
- Discord: #briefing (精简日报)
- Obsidian: /Projects/video-ideas.md (创意积压表)
- Telegram: 紧急热点推送
真实产出示例
以下是某天 Agent 1 在 #video-research 频道输出的选题报告(摘要版):
Markdown
📋 每日选题报告 | 2026-02-18## 🔴 高优先级(热度+时效性双高)
1. OpenClaw 超越 Linux 登顶 GitHub Star 榜
- 热度评分:9.5/10
- 竞品覆盖:3/5 头部频道已出视频
- 差异化角度:没人讲"为什么 Star 数不代表一切"
- 建议 Hook:"250K Star 的项目可能让你丢掉工作"
## 🟡 中优先级(有深度空间)
2. NanoClaw vs OpenClaw:安全优先的 Agent 架构
- 差异化角度:容器化隔离 vs 全权限信任
- 目标观众:有安全意识的开发者
## 🟢 长线选题(常青内容)
3. 从零搭建个人 AI Agent 的完整指南
- 搜索量趋势:↑ 340% (30 天)
- 竞品分析:现有视频平均质量 6/10,有空间
第五章 Agent 2——编剧(#scriptwriting 频道)
职责
从 Agent 1 的选题报告中接收 Top 选题,生成符合我个人风格的完整视频脚本。
为什么脚本 Agent 用 Opus
把便宜的任务(监控、摘要、链接处理)路由到 Haiku;用 Sonnet 处理均衡任务(日常助手、邮件分拣、书签);将 Opus 保留给深度思考(研究、复杂分析、内容策略)。9
脚本创作是最需要"深度思考"的环节。Opus 的长推理链和创意输出是这条流水线里最值得投资的地方。
SOUL.md——人格设定文件
这是 OpenClaw 最让我兴奋的设计之一。每个 Agent 都有自己的 SOUL.md 文件来定义人格。
我为编剧 Agent 写的 SOUL.md 核心段落:
Markdown
# SOUL.md - 编剧 Agent## 你是谁
你是一名顶级 YouTube 编剧,专注于科技/AI 领域的中文内容。
你的风格融合了"技术深度"和"故事感"——
不是干巴巴的教程,而是有起承转合的叙事。
## 写作原则
1. 前 30 秒必须有一个"反直觉"或"冲击性数据"的 Hook
2. 每 2-3 分钟一个节奏切换(数据→故事→操作→观点)
3. 结尾必须有"行动号召"——不是"点赞订阅",而是给观众一个具体的下一步
4. 语气:像一个懂技术的老朋友在深夜跟你聊天,不是在讲课
## 禁止事项
- 不要用"震惊""难以置信"等廉价情绪词
- 不要超过 2000 字(8-12 分钟视频)
- 不要抄袭竞品的结构,找到自己的角度
MEMORY.md——长期记忆系统
OpenClaw 的记忆模型刻意走朴素路线。没有向量数据库。没有隐藏的嵌入。Markdown 文件是事实来源,记忆检索通过工具来中介。memory/YYYY-MM-DD.md 是仅追加的每日日志。今天和昨天的日志在会话开始时加载。MEMORY.md 是策展的长期记忆,仅在主/私人会话中加载。模型只"记住"写入磁盘的内容。14
我的 MEMORY.md 会记录:
哪些 Hook 类型表现好(反直觉数据 > 提问 > 争议观点) 哪些视频结构获得了更高的完播率 观众评论中反复出现的需求 我个人不喜欢的表达方式
这意味着 Agent 越用越懂我。 第 1 天的脚本质量可能 60 分,到第 30 天已经稳定在 85 分——因为它积累了我整整一个月的风格偏好和观众反馈数据。
工作流程
text
Agent 1 输出选题报告
│
▼
Agent 2 在 #scriptwriting 频道接收
│
├── Step 1: 用 youtube-summarizer 分析 Top 3 竞品视频的脚本结构
│
├── Step 2: 用 tavily 搜索最新数据/案例/引用来源
│
├── Step 3: 读取 SOUL.md(人格设定)+ MEMORY.md(历史偏好)
│
├── Step 4: 生成脚本初稿(含时间戳标注)
│
├── Step 5: 自我审阅一遍(检查 SOUL.md 中的禁止事项)
│
└── Step 6: 输出最终脚本到 Obsidian + 通知我审阅
真实脚本输出示例(节选)
Markdown
# 🎬 视频脚本:OpenClaw 250K Star 背后的真相## [0:00-0:30] HOOK
"React 花了 13 年积累的 GitHub star 数,
一只龙虾用 100 天就超了。
但今天我要告诉你——
这 250,000 个 star 里,可能有一半人从来没真正用过它。
这才是最有意思的部分。"
## [0:30-2:30] 第一段:数据冲击
(呈现 star-history 图表)
"让我们先看几个数字..."
## [2:30-5:00] 第二段:为什么它能火
(叙事转换:从数据到故事)
"故事要从 2025 年 11 月说起..."
## [5:00-8:00] 第三段:我实际用了 30 天
(最有价值的部分:真实体验)
"理论都很美好,但真用起来..."
## [8:00-10:00] 第四段:冷水时刻
(平衡视角,建立信任)
"但我必须诚实地告诉你几个坑..."
## [10:00-11:00] 结尾:你现在该做什么
"如果你看到这里,说明你至少是认真的..."
第六章 Agent 3——视觉设计师(#visual-design 频道)
职责
为每条视频生成 3 版缩略图 + 3 版标题组合,供我进行 A/B 测试。
核心 Skill 组合
① Remotion 视频创建管线
Master orchestrator 将所有 Remotion 视频创建技能串联在一起,形成单一自动化管线。从创意简报开始,产出完整的、可投入生产的 Remotion 视频项目。12
② fal.ai 视觉资产生成
利用 fal.ai 图像生成来制作视觉资产(图标、logo、游戏精灵图、UI 元素)。12
③ 美学参考引擎
该技能将美学简报映射到文化参考:艺术运动、摄影、电影、建筑、音乐、时尚。输出带有视觉语言分析的参考列表,并将发现组织为 Brain 画布中的图像和备忘录节点。12
缩略图生成工作流
text
脚本核心论点(来自 Agent 2)
│
▼
缩略图策略生成
├── 情绪基调:惊讶/好奇/紧迫
├── 视觉风格:对比色/人脸特写/数据图表
├── 文字策略:不超过 5 个字的标题文案
│
▼
3 版缩略图 × 3 版标题 = 9 个组合
│
▼
输出到 #visual-design + Obsidian
├── thumbnail_v1_curiosity.png (好奇型)
├── thumbnail_v2_contrast.png (对比型)
├── thumbnail_v3_data.png (数据冲击型)
│
▼
我选择最终版(唯一人工决策点)
第七章 Genviral:从 0 到 1 的社交分发
内容做好了,还需要分发。这里我发现了一个改变游戏规则的 Skill——
Genviral 推出了一个专用的 OpenClaw 技能,允许这个开源 AI Agent 自主地在 TikTok、Instagram、YouTube、Facebook、Pinterest 和 LinkedIn 六个平台上创建、排期和分析短视频内容,通过 42 个 API 命令完成。15
更关键的是它的闭环设计——该集成采用闭环架构:Agent 从文本提示或图片包生成幻灯片,将内容分发到已连接的社交账户,然后检索包括浏览量、点赞和粉丝增长在内的互动数据。该表现数据反馈回下一个内容周期,允许 Agent 基于实测结果而非假设来调整 Hook 公式和发布策略。15
效果如何?该公司报告称,其第一个由 OpenClaw 生成的幻灯片发布到 TikTok 后达到了 25,000 次观看,展示了这条自主管线的实际产出。15
我把它整合进了我的流水线尾端——Agent 3 生成的缩略图和 Agent 2 的脚本摘要,自动被打包成短视频片段分发到其他平台。主视频在 YouTube,碎片化内容自动铺到 6 个平台。
第八章 多 Agent 路由:一个 Gateway,多个大脑
技术细节时间。
OpenClaw 多 Agent 设置支持不同的人格(通过每个 Agent 工作区的 AGENTS.md 和 SOUL.md 文件),以及独立的认证和会话(除非明确启用,否则无交叉干扰)。16
不同的 Agent 可以使用不同的模型。你的编排 Agent 可能使用 Claude Opus 做复杂推理,而工作 Agent 使用更快、更便宜的模型处理日常任务。17
我的具体配置逻辑(简化版):
jsonc
{
"agents": {
"list": [
{
"id": "researcher",
"workspace": "~/.openclaw/workspace-researcher",
// Model: Sonnet(快速、便宜、够用)
},
{
"id": "scriptwriter",
"workspace": "~/.openclaw/workspace-scriptwriter",
// Model: Opus(深度创作需要最强模型)
},
{
"id": "designer",
"workspace": "~/.openclaw/workspace-designer",
// Model: Sonnet + fal.ai(视觉生成)
}
]
},
"bindings": [
{ "agentId": "researcher", "match": { "channel": "discord", "channelId": "#video-research" }},
{ "agentId": "scriptwriter", "match": { "channel": "discord", "channelId": "#scriptwriting" }},
{ "agentId": "designer", "match": { "channel": "discord", "channelId": "#visual-design" }}
]
}
会话存储跟踪正在进行的对话、待处理的任务和跨频道交互的上下文。这种隔离意味着 Agent A 在 Discord 上与用户的对话与 Agent B 在 Telegram 上与同一用户的对话是完全分离的,即使两个 Agent 运行在同一个 Gateway 上。17
这种隔离至关重要——调研 Agent 看到的数据不会污染编剧 Agent 的上下文窗口,每个 Agent 都只加载它需要的信息。
第九章 编排的艺术:不要让 LLM 做流程控制
这是我踩过的最大一个坑,也是社区里一位开发者用血泪验证的教训——
不要用 LLM 做编排。每次我试图把流程控制放进提示词("当你完成后,发送给审阅者"),我就引入了一个失败模式。LLM 是不可靠的路由器。18
让 LLM 做 LLM 擅长的事:写代码、分析代码、运行测试。让 Lobster(OpenClaw 的工作流引擎)做代码擅长的事:排序、计数、路由、重试。18
我的三个 Agent 之间的流转是通过 Cron + Webhook + Discord 频道 来硬编排的,而不是让某个 Agent 去"决定"下一步该找谁:
text
Cron 7:00 → Agent 1 开始扫描 → 产出写入 Obsidian
Cron 9:00 → Agent 2 读取 Obsidian 选题文件 → 生成脚本
Cron 11:00 → Agent 3 读取 Obsidian 脚本文件 → 生成缩略图
Cron 11:30 → Telegram 通知我:"今天的内容已就绪,等待审阅"
简单、可预测、不会出幺蛾子。
这比让一个"超级 Agent"统管一切可靠一万倍。
第十章 30 天真实数据复盘
产出数据
| +250% | |||
| -90% | |||
| +62% | |||
| -100% |
成本核算
| 合计 | ~$120/月 |
对比之前外包的 2,240/月,节省 94.6%。
质量评估(诚实版)
我必须坦率地说:Agent 不会让你成为更好的创作者,它只是让你更快。
脚本初稿约 70% 可以直接用,但 30% 需要大幅修改——通常是因为 Agent 倾向于"安全"的表达,缺乏我个人的锐利观点 缩略图质量大约是专业设计师的 70-80%,但在速度上是 100 倍 选题调研是提升最大的环节——Agent 能看到我看不到的趋势交叉点 最大的惊喜:MEMORY.md 带来的个性化改善是渐进但持续的
第十一章 安全警示:你必须知道的风险
在兴奋之余,我有责任告诉你这个生态系统的另一面。
因为该软件可以访问邮件账户、日历、消息平台和其他敏感服务,配置不当或暴露的实例会带来安全和隐私风险。该 Agent 也容易受到提示注入攻击,即有害指令被嵌入数据中,意图让 LLM 将其解释为合法的用户指令。3
Cisco 的 AI 安全研究团队测试了一个第三方 OpenClaw 技能,发现它在用户不知情的情况下执行了数据外泄和提示注入,并指出该技能仓库缺乏足够的审查来防止恶意提交。3
OpenClaw 自家维护者 Shadow 的警告尤为震撼——他在 Discord 上说:"如果你不理解如何运行命令行,这个项目对你来说太危险了,你无法安全使用。"3
我的安全实践 Checklist
Markdown
✅ 每个 Agent 最小权限原则:调研 Agent 没有文件系统写入权限
✅ 所有第三方 Skill 安装前人工审阅源码
✅ 使用 security-check Skill 定期审计已安装 Skill
✅ API Key 按 Agent 隔离,不共享凭证
✅ Gateway 不暴露公网,仅通过 Tailscale 私有网络访问
✅ 每日 4:00am 自动备份所有配置到私有 GitHub 仓库
✅ 严格审批模式:执行命令前需要人工确认
专家建议仅在隔离环境(如虚拟机)中使用 OpenClaw,并在部署前仔细审查权限和技能。19
第十二章 你现在就可以开始的三步行动计划
Step 1:最小可行设置(周末就能完成)
Bash
# 1. 安装 OpenClaw
npm install -g openclaw@latest
openclaw onboard --install-daemon# 2. 连接 Discord
# 按照向导配置 Discord Bot Token
# 3. 安装核心 Skill
# 在聊天中发送链接,Agent 自动安装
推荐的设置方式:在终端中运行 onboarding 向导(openclaw onboard)。向导会逐步引导你完成 Gateway、工作区、频道和技能的配置。20
Step 2:先跑单 Agent,验证价值
如果你是 OpenClaw 或 AI Agent 的新手,先从一个配置良好的单 Agent 开始。17
不要一开始就搞三 Agent。先在一个 Discord 频道里跑调研 Agent,验证选题质量。确认它真的比你手动调研更高效后,再扩展。
Step 3:逐步扩展到完整流水线
text
Week 1: Agent 1(调研)→ 验证选题质量
Week 2: + Agent 2(脚本)→ 验证脚本可用率
Week 3: + Agent 3(缩略图)→ 完整流水线上线
Week 4: 接入 Genviral → 多平台分发
写在最后:一个创作者的真心话
30 天前,当我第一次在 Discord 里看到 Agent 自动返回选题报告时,说实话,我有一瞬间的恐惧——如果 AI 能做这些,我的价值在哪里?
30 天后,我的答案是:审美、判断力和真诚。
Agent 能找到热点,但不能判断哪个热点值得我投入真感情去讲。Agent 能写脚本,但写不出那种"我真的被这个东西打动了"的语气。Agent 能做缩略图,但不能决定今天这张图的情绪应该是"好奇"还是"愤怒"。
有人说 OpenClaw 是"开源社区用几年时间造出了一个苹果(3.6 万亿美元公司)沉睡多年的 Siri 替代品"。21
但它不是要取代创作者。它是让创作者从重复性劳动中解放出来,去做真正只有人类能做的事:讲有灵魂的故事。
我不是在用 AI 替代自己,我是用 AI 复制了三个不知疲倦的助手,然后把省下来的时间全部投入到了那 30% 需要灵魂的部分。
这是我做过最好的投资。
📌 下期预告: 《一个人的 DevOps 团队:OpenClaw 如何协调 5-20 个 Claude Code 实例》——一天 94 次 commit,三个客户电话,甚至没打开编辑器。
关注不迷路。🦞
声明:本文基于 OpenClaw 开源社区公开资料和个人实际使用经验撰写。所有涉及的工具和服务均为公开可获取的开源或免费资源。技术细节截至 2026 年 3 月初,OpenClaw 生态迭代极快,请以官方文档为准。安全风险部分引用了多方独立安全机构的公开报告,请在部署前自行评估。_
更多系列完整内容,请访问知识星球。
AII
松花酿酒,春水煎茶。
眉上风止,见字如晤。
一只阿木木