Agent in the Shell,豆包手机是敲键盘的“机械手指”吗?
本文想讨论的不是具体某个技术,而是一个更底层、更长期的问题:
当 Agent 成为新行动者,而互联网仍默认行动者必须是“人”,系统会如何排异?又会如何被迫重写规则?
第一幕:敲键盘的“机械手指”——未来已经到了,但通道还是旧的
看见豆包手机有模有样地操作各类 APP,我总会想起一个流传甚广的工程寓言:承载人类征服太空的火箭,尺寸却可能被数千年前“两匹战马屁股的宽度”所限制。
传说美国航天飞机的固体燃料助推器,造好后必须通过铁路运往发射场,沿途要穿过山区隧道,所以直径被卡在铁路的标准轨距里。
轨距来自更早的有轨电车;有轨电车沿用了马车轮距;马车轮距为了适配欧洲老路上既有的辙印。
辙印是谁留下的?传说是古罗马军团战车。
最后,战车的宽度又由什么决定?据说是为了把两匹拉车战马并排放下。
于是逻辑闭环:两千年前两匹战马屁股的宽度,影响了航天器的关键尺寸。
这故事未必完全可信,但它讲对了一件真实到残酷的事:路径依赖。未来不是没来,而是经常被迫从旧通道里挤进来——于是你看到的“未来”,总带着一种滑稽的别扭感。
《攻壳机动队》里那个“机械手指敲键盘”的画面,本质上也是同一种历史惯性。注意:电影里一个无名角色——在高度信息化、义体化的世界里,一个顶尖行动者为了完成入侵/输入,居然还要把手分裂成十几根机械义指,在物理键盘上以极低带宽的方式疯狂敲击。
在工程师眼里,这近乎“脱裤子放屁”:明明更直接的数据通道触手可及,却偏偏要用最原始的人类输入方式硬塞过去。放到今天,小朋友都会追问一句:“为什么不用 Wi‑Fi 呢?”
可现实比电影更讽刺:在大模型成为公共基础设施之后,“机械手指”没有消失,反而被规模化复制、工业化量产了——自动化脚本、RPA、浏览器插件、无头浏览器、模拟点击、自动填表……一整套成熟的“装成人类”的技术栈,正在把 Agent 硬生生塞回 GUI 那条狭窄、拥堵、充满路障的旧通道里。
荒诞的重点并不在于“机器会点按钮”,而在于:
Agent 明明是软件,却被迫用人的方式生活。
它要打开网页、等加载、找按钮、滚动页面、躲验证码、维持登录态、处理弹窗确认——像一个被安排去柜台取号、排队、盖章的超能力者。你以为这叫“兼容性”,但很多时候,它更像一种“伪装”:Agent 想做事,必须先把自己打扮成一个“正在使用手机的人”。
于是我们得到一个非常当代、也非常《攻壳》的局面:
一个强大的意图与规划能力(像 ghost),被困在一个为人类手眼设计的交互外壳(shell)里。
这就是我们要说的第一层含义:Agent in the Shell。
但请先别急着把问题归结为“技术还不够成熟”。恰恰相反:技术越成熟,这种系统性失配越刺眼。模型越聪明、越能完成复杂委托;也越会在每一个关键动作前撞上同一堵墙——当今世界绝大多数数字基础设施,默认行动者必须是“人”。
这堵墙一点也不抽象,它长得很具体:验证码、设备指纹、短信验证、频繁重登、异常行为检测、反爬策略、端内闭环、强绑定账号体系。
所以接下来我们要讨论的不是“某个模型强不强”“某个产品好不好”,而是更底层的问题:
为什么整个系统会把 Agent 挤回‘机械手指’的形态?
以及:要让 Agent 不再伪装成人,我们必须重写哪些规则?
第二幕:Ghost、Shell 与行动资格——《攻壳》的问题,在今天重演
《攻壳机动队》这部电影,其实和如今的各类 browser-use / computer-use / android-use 有着惊人一致的哲学骨架:它讨论的不是“手更快了”,而是——当行动者变了,世界是否承认它?用什么方式承认?
在电影设定里:
• Ghost 指意识、自我、意图——驱动行为的源头。 • Shell 是容器、身体、接口——不仅承载 Ghost,也决定它能否被社会系统识别、授予权限、追溯责任。
没有 Shell,Ghost 只是无法与世界交互的幽灵。
把这组词放回今天,就很容易得到映射:
• Agent 是一种新的 Ghost:能理解、能规划、能执行委托。 • 它被迫穿上的 Shell,往往不是“协议意义上的身份”,而是更原始、更滑稽的东西:
“看起来像人类用户在操作 GUI 的行为外壳”。
这里需要把一个容易混淆的概念一次讲清楚,否则全文会自相矛盾:
我们真正要“脱掉”的 Shell,并不是一切规则与接口(那不现实也不安全);
我们要脱掉的是 Humanoid Shell(人皮壳)——“伪装成用户、通过点击屏幕偷渡通行权”的那层壳。
未来需要建立的,是 Protocol Shell(协议壳)——以 Agent 身份被承认、可治理、可追责的制度化接口。
理解了这一点,你就会发现:所谓“Agent in the Shell”并不是一句梗,而是一条诊断——当新行动者出现,而旧世界没有为它准备合法接口,它只能伪装成人,从 GUI 的缝隙里偷渡。
而这也解释了为什么冲突会如此剧烈:因为一旦默许“机器以人的身份出现”,过去几十年围绕“人类默认”建立起来的界面、流程、身份体系、商业变现与风险控制,会被瞬间穿透。
第三幕:被撕毁的“隐形契约”——躯壳背后的商业与风险
到这里,我们可以揭示一个残酷但非常有用的事实:
这层看似“过时”的壳(GUI、流程、账号体系),并不只是历史遗留的技术包袱;它还是支撑消费互联网商业模式与治理体系的装甲。
旧世界之所以能运转,靠的往往不是“人人高尚”,而是两条默认成立、但很少被写进协议的隐形条款——你可以把它叫做隐形契约:
1. 你用注意力缴税。 2. 你用人类身份承担风险。
Agent 的出现,同时撕毁了这两条。平台的反弹,本质上是对契约被单方面破坏的免疫反应。
3.1 注意力税:商业场的坍塌
很多 App 表面上是工具,实际上是一个“商业场”:
你看到的每一屏信息流是库存;你走过的每一步路径是转化动线;你停留的每一秒钟都是可计量资产。
在这种结构里,“免费”只是入场券,真正的收费方式是:让你在场。
让你多点一次、多等两秒、多做一遍确认,并不总是“做不到更好”;在某些商业模型里,它甚至是收益结构的一部分——它保证了广告曝光、推荐位分发、以及平台对路径的控制权。
Agent 则天然倾向于把“商业场”压缩成“能力管道”:
订票、比价、提交、支付……目标直达。对用户是效率,对平台是税基塌陷。
所以你会看到一种非常典型的张力:
• 你要它比价,它会绕开展示位与广告位; • 你要它联系客服,它会把留存路径压缩成一句摘要; • 你要它批量处理事务,它会把每一道“人工摩擦”变成可规模化绕过的障碍。
3.2 风险定价:无法承担责任的幽灵
如果说注意力税是收入模型,那么风险定价是成本模型。旧世界控制风险的核心逻辑并不是“消灭风险”,而是“让风险变贵”,并把风险通过身份锚定到可追责主体上:
• 人会累,频率有限(天然限流器) • 人怕麻烦,会被摩擦劝退(天然反滥用机制) • 人的行为有噪声(天然风控特征)
Agent 让这三种“免费风控插件”同时失效:并发、试错、重复接近零成本。于是平台只能本能地加税——更频繁的验证码、更严格的设备校验、更激进的异常封禁。
但真正的底线在于:责任链。
“替人行动”意味着交易、资金、安全信息、隐私、法律后果。平台可以接受人犯错,因为责任能挂回到可追溯主体;但平台很难接受一个“出事后无法取证、无法仲裁、无法定责”的幽灵代理。
所以平台反抗的不是智能本身,而是:
绕开隐形契约的智能
(既绕开注意力税,又绕开身份担责)
到这里,问题就从“能不能做出更灵巧的机械手指”,升级成制度设计问题:
一个机器代理要获得合法通行权,必须与世界重签一份新契约。
在这份契约里,谁为效率付费?谁为风险担责?谁拥有入口?谁拿走分成?
在走向终局之前,我们先从历史里找一段几乎一模一样的回响。
第四幕:历史回放——网站与爬虫,上一次技术冲击如何从对抗走向协同
围绕 Agent 的争执看似新,其实互联网经历过一轮极为相似的剧本:爬虫(Crawler)的出现,让机器访问从边缘行为变成基础设施。
那一次,世界最终没有走向“网站全面封死机器”。相反,它走向了更现实、更经典的结局:
战争没有赢家,于是边界被协议化,冲突被产品化,风险被制度化。
把这段历史压缩成一条清晰的演化线,核心是三步(也是第五幕要复用的模板):
4.1 对抗:机器来了,但没有“边检”
早期爬虫高频抓取造成资源冲击、内容权益冲突、商业模型冲击。网站能对“人”做治理,对“机器”只能靠猜,于是封 IP、改结构、加对抗手段,进入猫鼠游戏。
这不是技术问题,是制度缺席:
什么样的机器访问被允许?允许到什么程度?出了问题怎么追责? 没答案。
4.2 协议化:robots.txt 的意义不是技术,而是“边界语言”
转折点不是谁更强,而是网站开始用规则声明主权边界:哪些能抓、哪些不能抓、频率如何。这让冲突从“全有或全无”变成“可谈判的梯度”。
4.3 共生:搜索引擎把爬虫“洗白”为分发基础设施
真正让协同成立的,不是君子协定本身,而是利益结构变化:
当搜索引擎索引能给网站带来可观流量时,“被抓取”不再是纯损失,它成为一种交换关系。于是网站愿意提供 sitemap、结构化数据,主动喂给搜索引擎更好的理解入口,换取更好的展示与点击。
4.4 产品化:API 让机器公民拿到“护照”
当机器访问成为常态,仅靠 robots 这种软规则不够,网站开始提供 API,并配套:
• 身份(key/token) • 权限边界(scope) • 配额与限流(rate limit) • 审计与追责(log) • 计费(pricing)
于是“机器访问”从灰色地带变成可运营、可定价、可治理的产品。
4.5 将历史照进现实:Agent 更难,因为它不是“读”,而是“替你做”
爬虫时代的核心矛盾是“读与索引”。
Agent 时代的核心矛盾是“行动与交易”。风险等级、责任链、商业模型穿透程度都更高。
但历史仍给出一个非常稳定的结论:
协同不是因为平台突然拥抱技术,
而是因为“机器能力”被装进了三种制度容器:
可表达的边界、可结算的利益、可追责的身份。
这三件事,决定了第五幕的谈判筹码。
第五幕:重签契约——让 Agent 获得通行权的三张证件(以及一套结算)
如果说第四幕是“上一轮机器公民如何上岸”,这一幕就是:Agent 如何上岸。
一句话概括新合同的交易结构:
平台给通行权(能力接口/交易通道)
↔ Agent/系统提供:可识别、可控、可追责
↔ 双方再补上:可结算(能力税/结果分成/风险溢价)
把它落成制度,最直观的表达就是:发三张证件,再建一套结算。
5.1 第一张证:Agent 身份证(可识别)——“你到底是谁的手?”
今天平台风控真正恐惧的不是“智能”,而是“不可归因的自动化”:不可归因就不可定价,不可定价就只能一刀切封死。
所以第一张证的目标不是“更像人”,而是:
更不像人,但更可管。
它至少包含三类能力:
• 可信执行环境证明(Attestation):证明 Agent 运行在受信环境(比如系统安全区),而不是黑产脚本场。 • 可区分的 Agent 标识:平台能明确知道“这是合法代理”,而不是把它混进“用户本人手动操作”里。 • 可吊销、可轮换、可分级:出事能吊销;不同风险等级不同能力边界。
Agent 的身份证不是为了自由,而是为了治理。
不再靠猜“像不像人”,而是靠验“是不是合法代理”。
5.2 第二张证:授权委托书(可表达边界)——“你能替我做什么,做到哪一步?”
爬虫时代的授权很粗:“这个路径能不能抓”。
Agent 时代的授权必须精细到行动链条粒度:
• 可以查询订单,但不能取消 • 可以下单到支付前,但最终支付必须用户确认/强认证 • 可以改地址,但必须可回滚、可解释 • 可以代表对话,但不得群发、不得越权营销
这张委托书需要把“授权”从一句空话,变成机器可执行的政策(Policy),至少包含:
A) 最小权限(Least Privilege)
从“拿到账号就啥都能做”,变成细粒度 scope:读、写、退款、支付、改密等分开。
B) 行为约束(速率/金额/频次/时段)
风险本质是规模化滥用,所以委托书必须自带限速器与熔断条件。
C) 人在回路(Human-in-the-loop)
把过去那种“用 GUI 摩擦风控”的模式,升级为制度化的关键节点确认:
低风险自动执行,中风险显式确认,高风险强认证。
5.3 第三张证:审计账本 / 黑匣子(可追责)——“出了事,谁背锅?怎么证明?”
只要涉及“替人行动”,就必须有证据链。平台不可能接受一个事后无法取证的代理体系。
因此第三张证不是权限,而是可仲裁的证据:每一次关键动作都应回答四个问题:
1. 谁发起的?(用户/企业/自动任务) 2. 谁执行的?(哪个 Agent、哪个设备、哪个版本) 3. 依据是什么?(授权条款、确认记录、策略) 4. 当时看到了什么?(关键字段快照/页面状态的摘要哈希)
这会催生一个很关键的新组件:Agent 版黑匣子。
它不是为了监控用户,而是为了在平台、用户与 Agent 之间提供“争议解决接口”。
5.4 结算:把注意力税改写为能力税(以及高频结算网络)
即便身份、授权、审计齐备,如果利益结构不成立,协同也不会发生。平台过去收的是注意力税:必须在场、必须看流程、必须经过广告与推荐位。Agent 的方向是压扁流程,因此平台必然寻找新的收费方式。
典型的“能力税”组合是:
1. 按调用计费:像 API 一样按动作类型/次数计费 2. 按结果分成:下单/订阅/预约成功后分成 3. 按风险溢价:更高额度、更高自动化等级对应更高保证金/费率
这里“高频结算”就非常关键:
当 Agent 把大量细碎操作变成海量动作调用,结算也必须能承载“高频、小额、自动化”的特征——否则协议存在,商业也跑不起来。换句话说:Agent 时代的支付与清结算,可能会比 Agent 本身更早成为基础设施瓶颈。
5.5 谁来做“发证与边检”?——身份分发与认知体系的缺口
如果让每个 App 各自定义 Agent 身份、授权、审计标准,会碎片化到不可用;但如果让某一家平台垄断标准,又会引发新的权力问题。
更现实的路径往往是三方制衡:
• 操作系统/手机厂商:提供可信执行环境、统一授权面板、系统级吊销与审计(像“边检/经纪人”) • 平台(银行/电商/内容/政务):提供能力接口、风险策略、计费与仲裁(像“海关/市场”) • Agent 提供方:提供规划与执行、可解释与可回滚(像“代理公司”)
到这里,Agent 才可能从“屏幕层游击队”变成“生态内合法代理”。
第六幕:当代理成为默认——GUI 退位与新权力结构诞生
第五幕解决的是“如何合法上岸”。第六幕讨论的是更刺痛的后果:一旦合法代理成为默认,互联网不会只是“更方便”,它会发生权力重排——谁控制入口、谁定义价格、谁拥有用户关系、谁承担风险,都会变。
6.1 GUI 不会消失,但会退位:从主通道变成橱窗、驾驶舱与仲裁庭
先拆一个误区:GUI 不会像某些旧技术那样消失。它仍然存在,但角色变化:
1. 橱窗:展示商品/内容/服务样本 2. 驾驶舱:用户设定偏好、预算、风险等级、默认策略 3. 仲裁庭:异常/争议/高风险动作时的人类确认与证据呈现界面
也就是说:GUI 从“你必须走的路”,变成“你偶尔需要回来的地方”。
平台最不愿发生的,就是这件事:路权丢失。
6.2 第一轮分化:谁先开放,谁最抵抗?
开放与否不取决于“是否拥抱 AI”,而取决于经济结构与风险结构:
• 更可能先开放:高频低风险、强工具属性场景(预约、查询、低额交易、企业 SaaS、开发者服务) • 更可能强抵抗:高风险高监管、责任链极重场景(转账、授信、关键政务、资产交易) • 最纠结:内容与社交(Agent 提效但会掏空注意力税)
6.3 新入口争夺:谁拥有“默认代理”,谁拥有新流量
历史上的入口迁移从门户到搜索到信息流到超级 App。
Agent 时代,入口可能变成:默认代理(Default Agent)。
于是会出现新的流量定律:
谁是用户的默认代理,谁就能在用户没打开任何 App 时,把需求导向哪里。
这将把竞争从“装机量/DAU”推向“授权面板里的默认权限”“代理的路由权”“推荐优先级的竞价与治理”。
6.4 新中介:Agent Broker(代理经纪人)可能成为最大赢家之一
当任务被拆分、路由、审计、结算,一个新角色会自然浮现:代理经纪人(可能是系统、浏览器、云端服务,或多方组合)。
它做三件事:
1. 把用户意图拆单 2. 把子任务路由给不同平台/不同 Agent 3. 打包证据链与责任链用于仲裁
这意味着平台未必直接面对最终用户,而是面对经纪人;用户关系、议价能力与利润都可能被抽走一层。
6.5 平台的反制:反代理设计将守住税基与风控
平台不会坐以待毙。即便有合法代理接口,也会用“反代理设计”守住两件事:税基与风控边界,例如:
• 把关键权益绑定在在场体验(互动、会员权益、创作者关系) • 把补贴/最低价绑定在特定渠道 • 对代理渠道收更高能力税/保证金(风险溢价) • 强制关键动作回到平台确认(把 GUI 变成仲裁庭)
最终很可能形成一个现实妥协:
Agent 可以压扁流程,但压不扁平台的定价权与风控权。
6.6 终局悬念:更自由,还是更锁定?
Agent 常被包装为“用户解放”,但它也可能带来新的锁定,关键不在技术,而在制度:
• 授权标准是否开放 • 黑匣子是否可第三方审计 • 路由是否透明可解释 • 反垄断与监管是否跟上
两种未来都可能成立:更自由,或更集中化。
尾声:真正的主角不是 Agent,而是“可代理的社会”
爬虫让信息可索引;API 让能力可调用;Agent 让行动可代理。
当“行动可代理”,人类的默认交互方式会从“点按钮”转向“设规则”。你不再在每个 App 里生活,而是在更上层的策略层里生活。
那层策略是谁写的?谁审计?谁收费?谁负责?
这四个问题,决定 Agent 时代到底是一次解放,还是一次新型的集中化。
而回到开头的那双“机械手指”:
它不只是一个技术笑话,它是一种时代症状——当新行动者出现,而旧世界没有为它准备合法身份与协议通道,它只能披上人皮,从 GUI 的缝隙里偷渡。
真正的进步,不是让机械手指敲得更像人;
而是让 Agent 不必伪装成人,也能被世界承认为行动者——
用它本来的身份,走正门,通过新契约。