camofox-browser:给 AI Agent 用的“低指纹”浏览器底座
做网页 Agent,最烦的不是让它点按钮。
是它还没开始干活,网站先把它当机器人拦了。
我之前也折腾过一圈反检测插件,思路大多差不多:在页面层打补丁,改改 navigator,藏藏 WebGL,补几段 JavaScript。
能过一部分简单检测。
但碰到指纹抓得深一点的网站,很快就露馅。
最近看到一个项目,叫 camofox-browser,它的思路就不太一样。
它不是在网页加载之后再临时“糊墙”,而是基于 Camoufox,在浏览器底层去伪装指纹。
这个差别挺关键。
因为很多检测不是只看你页面里暴露了什么 API,而是看浏览器整体行为、环境特征、指纹组合是不是像一个真实用户。
只改表层,容易出现那种“每个字段都像人,但拼起来不像人”的尴尬。
camofox-browser 更像是给 AI Agent 准备了一台专用浏览器。
它封装了一套面向代理的接口,不直接把原始 HTML 一股脑塞给模型,而是返回精简后的无障碍快照。
项目里给出的说法是,快照比原始网页小约 90%。
这点我很喜欢。
很多网页 Agent 项目,真正烧 token 的地方不是推理,而是每次打开页面都把一大坨导航栏、广告位、脚本噪音丢进上下文。
模型还没开始判断“下一步点哪”,先被页面垃圾信息淹了一遍。
精简快照的意义就在这里。
它把页面变成更适合 Agent 读的结构:按钮、输入框、链接、标题、可交互元素。
模型不用像人一样“看网页”,但它需要知道哪里能点,哪里能填,当前页面处在什么状态。
这个项目还内置了十多个搜索宏。
Google、YouTube、Amazon、Reddit 这些常用站点,可以不用从首页开始一步步模拟搜索,直接调用对应宏。
这不是炫技功能。
很多 Agent 工作流里,搜索是高频入口。每次都打开页面、找输入框、输入关键词、等待结果,既慢又容易出错。
宏把这些固定动作收掉,Agent 才能把精力放在真正需要判断的地方。
还有几个工程细节也比较实用。
它支持导入浏览器 Cookie,能复用已有登录态。
每个用户会话独立隔离,避免一个任务里的状态污染到另一个任务。
代理和自动地理位置匹配也做进去了,适合跑一些对地区环境敏感的网页任务。
内存占用也挺克制。
项目里提到,闲置时大概 40MB 左右,树莓派或者 5 美元的小服务器都能跑。
这对个人开发者很友好。
很多浏览器自动化方案一开就是一整套 Chromium,没跑几个会话,机器先开始喘。
当然,它不是万能钥匙。
网站的风控规则一直在变,自动化访问也得看目标站点规则,别把它当成“随便绕限制”的工具。
但如果你正在做需要深度交互网页的 AI 应用,比如自动检索、后台操作、网页表单处理、跨站点信息整理,这类底层浏览器引擎确实值得看一眼。
比起继续在 JS 层缝缝补补,我更愿意把这种能力放到底座里解决
GitHub地址:jo-inc/camofox-browser。