Stagehand,给浏览器装个会动手的实习生。。。
今天刷到个新玩意儿,Stagehand,有点意思…别急着给它贴“又一个爬虫库”的标签,我更想把它当成:给浏览器装了个“会动手的实习生”。你在代码里丢句“去官网点快速开始,然后把定价页抓下来”,它就能把浏览器拽起来干活:定位元素、点击、填写表单、抽取信息,整套流程像搭乐高一样拼起来,关键还不脆,出错会自己补救两下再试。官方说它是给生产级自动化和 AI Agent 用的框架,兼容一票 Chromium 家族,Chrome、Edge、Arc、Brave 都行,开发体验不挑食。
好玩的点在于它把“AI+代码”的分工做得很顺手:底层还是 Playwright 的稳定盘,面上却给了三个超顺口的小原语——act / extract / observe,像喊人干活一样自然;要写脚本,就像给实习生发清单,剩下细枝末节交给它。官方还有个示例 Agent 就靠这三板斧在跑。
我最会心一笑的是它把 MCP 拉进来了。简单说,你可以把 Stagehand 接成 Claude 等模型的“浏览器手”,用聊天的方式让它开网页、点按钮、扒数据,甚至把外部工具(搜索、数据库、API)串成一条链,变成一个可追问、可复用的小工作流。装法也不复杂,支持本地 STDIO 和托管的 SHTTP,开箱即用。
“可靠”这事它也有点工程味:交互被拆成原子步骤,脚本更可预期;页面忽然变形了?让 LLM来兜底找元素;同一流程跑多次还能命中缓存、越跑越便宜;最关键是可观测性做得清清楚楚——你能看到发给模型的指令、返回、以及命中几次缓存,排错不再看玄学日志。
顺带插一句“模型选择焦虑”:默认走 Gemini 2.0 Flash,但也能自己换成别家(OpenAI、等等),自备 API Key 就行。这个对团队很友好——谁便宜用谁,谁稳用谁。
要真落地,我脑补了几个“上头场景”——
内容团队做“半自动出稿”:act 导航搜集、extract 结构化成段,末尾丢给写作链路润色;遇到网站 A/B 实验换了按钮文案也不慌。 增长同学跑竞品巡检:每天登录 N 个后台抓两张关键报表,失败自动重试一次,失败原因日志可读,人一眼就能补刀。 Agent 团队把它当“浏览器外设”:对话里一句“去把 Hacker News 今天 Top10 做个结构化摘要”,MCP 驱动一遍点、看、抽取,回头给个干净的 digest。
部署层面,它既有开源 SDK,也有配套的云侧 API 与浏览器基础设施(Browserbase)打配合:你写的就是动作意图,云上替你管大规模浏览器、扩缩、维护,这对不想自己运维 CDP 的团队太省心了。
当然别神化。所有“AI 驱动自动化”的老毛病它也逃不开:模型偶尔会看走眼、网页极端态会抽风;所以第一周建议开着详细日志,把关键页面做兜底校验(例如校验到期望文本或响应码再继续),别把“可用性”全压在模型上。这个思路它官方也在强调:原子化步骤+自愈重试+可观测,组合拳才能稳。 要不要上手?给你一个“午后就能跑起来”的三步闭环: 1.用 TypeScript 或 Python 拉起脚手架,跑通一个最小流程:打开站点→点击“快速开始”→extract 标题与链接;跑完把日志过一遍,熟悉它的“指令—动作—回执”节奏。 2.把流程切成两类块:强规则(登录、跳转)用选择器/断言兜底,弱规则(按钮文案变体、动态列表)交给 act/observe;用缓存把高频步骤收敛成本。 3.接上 MCP,给你的 Agent 多长一只“浏览器手”,把外部 API 一起接进来,做一次真场景演练(比如:搜票→筛→下单前校验)。
对了,它今年还更了 v3,社区动静不小,往“更快、更开放”的方向在走,这种节奏对想押生产的团队挺友好。
反正嘛,如果你也在被“脚本易碎、选择器地狱、回归一改全崩”折磨,Stagehand算是个像样的止痛片。不是魔法棒,但把“人写规则”和“AI补感知”掺在一起——噪音关小、重点放大,能省下你不少调试时间…行了,我去把我们家那个“周一晨报”机器人也换上它试试,看看能不能少掉两条告警。
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html