程序员老鬼

BrowserAct Skills:AI Agent 跑浏览器,最怕的那堵墙它想直接拆掉

老鬼看这种浏览器自动化项目,第一眼通常不看宣传词,先看它怎么处理“卡住”。

因为 Agent 操作网页,最烦的不是点按钮、填表单,这些 Playwright、Selenium 早就能干。真正恶心的是跑到一半弹人机验证,Cookie 串了,账号状态乱了,或者一个页面 HTML 塞回来,模型光读 DOM 就先烧掉一截 Token。

BrowserAct Skills 抓的就是这个脏活。

Image

它不是单纯给 Agent 套个浏览器壳,而是把反卡死链路做成了三层:环境层做指纹、TLS、代理这类隔离;执行层处理受保护页面和验证;真搞不定时,直接生成远程接管链接,让人从手机或电脑接手,完事后 Agent 继续跑。这个设计挺现实,README 里也明确把它叫成给 AI Agent 用的浏览器 CLI。

啧,重点其实是第三层。

很多自动化工具最会吹“全自动”,但网页世界哪有那么干净。验证码、登录风控、二次确认,随便一个都能把 Agent 按死。BrowserAct 这里选择留一个人类接管口子,我反而更信一点。以前做小 Demo,最怕的不是第一天跑通,是第二天 429、502、登录态过期一起冒出来,日志还看不清。

还有个细节,适合多账号、多任务场景:它支持并行浏览器,每个任务有独立 Cookie、指纹、代理,README 里写的是避免不同任务互相污染。这个点别小看,Agent 批量跑网页时,状态串一次,后面数据基本就别信了。

但先别急着吹成“万能反爬神器”。

Image

这种工具越强,越要看边界。目标网站规则、账号权限、数据授权,这些不是换个指纹就能绕过去的。尤其是抓公开数据和批量操作账号,中间差一条线,后果完全不一样。老鬼会把它放在合规数据采集、内部系统自动化、自己账号的重复操作里试,不会拿它去硬怼别人的风控。

对模型友好的输出也挺关键。BrowserAct 没让大模型硬啃完整 HTML,而是提供更紧凑的索引文本格式,交互也变成类似“看状态、点第几个、填第几个”的方式。对 Claude Code、Cursor、Codex CLI 这种能跑命令的 Agent 来说,这比传统 JSON/HTML 省心不少。

Skill Forge 更像是附带的“抓站脚手架”:先探索网站结构,再生成可复用 Skill,后面批量跑同类数据不用每次重新摸路。README 里还提到它能生成面向重复抓取的 Skill 包,适合几百到几千条记录这种场景。

Image

老鬼会怎么用?

不是拿来炫自动化。更像是给 Agent 做网页任务时,先装一个兜底层:少烧 Token,少串 Cookie,卡验证码时有人能接一下。项目目前在 GitHub 上开源,README 显示 MIT License,项目页大约 2.4k star。兄弟们可以扫一眼,尤其是正在用 Claude Code、Cursor 做浏览器自动化的。

GitHub地址:github.com/browser-act/skills