AI 操作系统:从指令到意图
我们可能从第一天就把人机关系搞反了...
错综复杂的背景并非无迹可循,从 Agent 到 AI 浏览器,再到 OpenClaw,似乎一切都在朝着某个方向稳步前进。我很多文章也都表达过类似观点,推荐阅读:
- OpenClaw:疯狂背后的隐患
- OpenClaw:我们在虚空中造物
- 深度解读:OpenClaw 架构及生态
- Agent 趋势浅思:原生化 & CLI 化
- GPT-5.4:专业工作流进入“可执行时代”
- 深度解析:Google Workspace CLI
- 元技能:让 AI 像你一样思考
- 从 Prompt Engineering 到 Context Engineering
- 微信杂谈:AI 产品 & 品味
- 深度思考:聊聊 AI 发展趋势
- 深度解析:Anthropic MCP 协议
反直觉
这些年,人类一直以为自己在“使用电脑”。其实更准确地说,我们是在替电脑完成它本该自己完成、却长期做不到的那一部分认知劳动。你以为你在工作,很多时候你只是在翻译。你脑子里明明只有一个目标,落到屏幕上,却被拆成一串僵硬动作:打开这个,切到那个,复制,粘贴,确认,导出,上传,发送。意图只有一个,步骤却总是十几个。不是因为事情真的有那么复杂,而是因为机器长期听不懂你的目标,只能吃下你提前嚼碎的指令。
所以,过去几十年所谓“数字化能力”,里头有很大一块,其实并不是什么高级能力,而是对机器低理解力的补偿。你会快捷键,你会切软件,你会在一堆菜单和弹窗里迅速找对入口,这些当然有价值,但它们的价值,本质上来自一个很尴尬的前提:电脑不够聪明,所以你必须替它当中间人。
真正值得警惕的地方在于,我们已经把这种补偿性劳动看成了天经地义。按钮是给手指点的,菜单是给眼睛找的,弹窗是给人确认的,滚动条是给人慢慢拖的。整个 GUI 世界,从头到尾都是一套为“人类肉身”量身定制的补丁系统。我们发明了极其强大的机器,却又花了几十年去学习怎么伺候它,最后还把“伺候得熟练”命名为能力,包装成效率,甚至上升成职业素养。
如果从一种更反人类直觉的角度回头看,这整套东西其实一直都很可疑。真正好的工具,本不该逼着人去学习那么多“如何操作它”的细枝末节。你不会说自己“精通椅子的使用方法”,也不会说自己“熟练掌握水杯工作流”。一个工具越要求你记忆、适配、忍受,越说明它还停留在某种粗糙而原始的阶段。今天我们之所以仍把“会操作软件”当作一种本领,很大程度上,并不是因为这件事天然高级,而是因为旧时代的计算系统根本无法直接理解人的目的,只能逼着人去做中间那层翻译。
Perplexity 捅破窗户纸
在 Agent 刚冒头的时候,我脑子里就一直有一种模糊却挥之不去的直觉:GUI 这套东西,本质上是给碳基生物准备的,对硅基执行体来说,它天生就是累赘,甚至有点反硅基。Perplexity 这次把这种感觉彻底捅破了。
它发布的 Personal Computer(Everything is Computer[1]),官方定义得非常直接:一台可 24/7 常驻的 Mac mini,连接本地文件、应用与会话,同时接入 Perplexity 的系统,作为持续在线的数字代理替你工作;敏感操作需要审批,所有会话有审计轨迹,还内置 kill switch。这个描述已经不太像“桌面助手”,更像一个开始具备常驻代理属性的个人计算控制面。
真正值得反复咀嚼的,不是它今天做得有多完整,而是它把一个长期被忽略、甚至被刻意回避的问题,直接捅破了:传统操作系统的核心,从来不是帮助人类表达目标,而是逼着人类把目标翻译成机器能够执行的一连串动作。
这不是一句产品口号,而是一种视角反转。过去你面对电脑,默认自己是操作者,系统是工具;未来你更像委托人,系统更像执行体。过去你得学会它的语言、它的菜单、它的逻辑;未来它应该学会你的目标、你的约束、你的偏好。两者表面看只差一层接口,实际上差的是整个计算秩序的主从关系。
OpenClaw 放大器
OpenClaw 不是终局,它更像未来借旧系统显的一次灵
OpenClaw[2] 的爆火,恰恰把这种历史错位照得更亮了。官方 GitHub 把它定义成“你自己的个人 AI assistant”,强调它可以运行在自己的设备上,接入 WhatsApp、Telegram、Slack、Discord、Signal、iMessage、Feishu 等大量入口;截至 2026 年 3 月 13 日,其仓库约有 30.8 万 stars、5.85 万 forks。与此同时,它在国内的扩散速度快到引发政府机构和国企的安全警惕:一边是培训、试点和地方推动,另一边是对数据泄露、误删和越权访问的担忧。它已经不是边缘黑客玩具,而是一块现实世界里异常醒目的控制面原型。
但 OpenClaw 真正值得思考的,不是它有多火,而是它为什么会同时让人兴奋又失落。
兴奋很好理解。因为它第一次大规模击中了市场那种压抑已久的欲望:人们早就不满足于一个“会聊天的 AI” 了,人们真正想要的,是一个能持续待命、能跨入口存在、能接触真实工具、能替自己动手的 AI。失落也同样真实,因为你看完一堆 demo 之后,往往会发现它们和你的日常之间始终还隔着一层膜:很多演示说到底仍然是在做同一件事——AI 看屏幕、认按钮、挪鼠标、点输入框,模拟人类完成一整套 GUI 操作。
所以我越来越觉得,今天大量 agent demo,并不是未来本身,它们更像是“未来借旧系统的壳,提前显了一次灵”。
这就像汽车刚被发明出来时,人类最省力的理解方式,是把它看成一辆“没有马的马车”。于是车的形态像马车,规则像马车,路也还是马车时代的路。直到后来,人们才意识到,既然马已经没了,那真正该重做的,就不只是动力系统,而是整套车的结构、道路的设计、城市的组织方式,乃至整个交通文明本身。今天很多 GUI 自动化 agent,恰恰就处在这个阶段:人被抽走了,但“人怎么操作电脑”的那整套流程却被完整保留了下来。它不是终局,更像是旧秩序被新能力强行撬开之后,裸露出来的一条尴尬裂缝。
真正该问的问题,从来不是“怎样让 AI 更像人一样去用电脑”,而是:如果 AI 成了主要操作者,电脑为什么还要长成今天这样?
App 被掏空
App 不会立刻死,但它的主权会被一点点掏空
这个问题一旦问出口,很多原本看起来坚固无比的东西,都会开始发虚。
比如 App。
过去我们默认,不同任务就该对应不同 App:写东西进这个,做表格开那个,发消息切到另一个,管项目再换一个入口。久而久之,我们甚至把这种切换当成了数字世界的自然秩序。但站在代理的视角看,这些边界其实荒唐得近乎可笑。代理根本不在乎你的数据被锁在哪个软件里,也不在乎哪个入口属于哪家公司,它只在乎目标能不能被完成。完成目标需要同时读取五个系统的数据,它就该直接读取五个系统;需要跨三套服务做协商,它就该直接协商。
对人类来说,App 是入口;对代理来说,App 更像一层壳。它真正关心的,不是图标摆在哪、界面长什么样,而是这层壳背后有没有可直接调用的能力,接口是否标准,连接是否稳定,权限是否可控。
这背后最关键的变化,其实可以压缩成一句话:软件正在从“给人看的界面”,退化成“给代理调用的能力”。
注意,这里说的不是 App 明天就会死光,更不是说所有界面都会立刻消失。真正会发生的,是 App 的主权被一点点掏空。未来用户面对的,不再主要是一个个固定的软件壳子,而更可能是一层持续理解你、持续待命的智能中间层。具体到某一步,真的需要视觉反馈、需要你比较选项、审批动作、确认结果时,它再临时为你生成一块界面。这块界面只为当下任务而存在,用完即散。界面不会彻底消失,但它不再是王,不再是整个系统的核心舞台。真正持续在线、真正连续存在的主体,会越来越像代理本身。
三大协议
MCP 连能力,A2A 跑协作,A2UI 递界面
这也是为什么 MCP[3] 这类协议的意义,远比表面看起来更大。MCP 官方把自己定义成连接 AI 应用与外部系统的开放标准,甚至明确把它比作 AI 应用的 “USB-C”。它真正解决的,不是“给软件加一点 AI”,而是把“模型如何接入工具、数据和工作流”这件事标准化。换句话说,它想动的不是前台界面,而是能力层,是过去被一个个 App 壳子包裹起来、如今正在被重新抽象出来的底层结构。
但光有 MCP 还不够。MCP 解决的是 agent 怎么连上工具和数据,却不自动解决 agent 怎么和别的 agent、应用乃至人类协作。这也是 ACP[4] 和 A2A[5] 这一层真正重要的地方。ACP 官方说明与 Linux Foundation[6] 的公告都表明,ACP 已经并入 Linux Foundation 旗下的 A2A;A2A 的定位则很明确:让不同框架、不同厂商、不同执行体之间实现任务委派、信息交换与复杂工作流协作。说得再直白一点:MCP 更像在打通“能力接口”,A2A 则是在建立“协作语义”。没有后一层,前一层最多只是会调用工具的单体智能;有了后一层,代理才开始逼近真正的工作流系统。
再往前一步,连“界面”本身也开始被重新定义。过去界面是固定的,是软件预先画好的,是人去适应它;未来很多界面很可能会变成瞬时生成的,是围绕当前目标临时长出来的。你不是先打开某个 App,再沿着它预设好的路径去操作;而是先表达目标,系统再根据当前任务,把需要你看、需要你比、需要你确认的那一小块界面临时生成出来,用完即散。Google 推出的 A2UI[7] 项目把这件事说得很清楚:agent 发送的不是可执行代码,而是描述 UI 意图的声明式 JSON;客户端再用自己本地、受信任的组件库把它渲染出来,而且它可以通过 A2A 等传输在跨信任边界场景中工作。它的核心不是炫技,而是把“代理生成界面”从不安全的代码注入,降级成可控的数据交换。
把这几层放在一起,轮廓就清楚了:MCP 解决“怎么连能力”,A2A 解决“怎么跑协作”,A2UI 解决“怎么把临时界面安全地递交给人”。 一旦这三层慢慢长出来,传统 App 的地位就一定会松动。因为未来真正连续存在的,未必还是一个个固定的软件壳子,而更可能是一层持续在线、持续理解你、持续替你调度能力的代理系统。
Skills 技能包
协议解决的是“怎么连”,skills 解决的是“怎么干”。
但光有协议还不够。协议打通的,只是“能力如何被接入”、“代理如何彼此说话”、“界面如何被安全递交”;它们解决的是基础设施问题,不自动解决经验问题。真正让 agent 开始摆脱“每次都从头现想一遍”的,往往是另一层东西:skills。
如果说 MCP、A2A、A2UI 这几层,回答的是“能不能连、怎么协作、怎么呈现”,那么 skills 回答的就是另一件更接近现实工作的问题:连上之后,到底怎么干。
它不是一句 prompt,也不是一次孤立的工具调用,而更像是把某个领域里反复被验证过的经验、判断顺序、工具组合、边界约束和异常处理方式,压缩成一个可复用、可迁移、可组合的执行单元。说得再直白一点,skills 本质上是在把原本只存在于人脑里的“行活”、“套路”、“经验手感”,逐步编译成代理可以直接挂载的外部能力。
这层东西一旦成熟,很多过去只能依赖熟手的工作,就会开始发生结构变化。因为系统不再只是“连上了工具”,而是开始“继承了做事的方法”。一个好的 skill,封装的不只是步骤,更是某种领域技能经验:先看什么,再看什么;什么信号最重要;什么情况下该停;什么情况下要升级;出了偏差该怎么纠正。它把零散的工具调用,变成一种带有经验密度的行动模板。
也正因为如此,skills 的意义并不只是提高效率。它更像是在意图时代,把经验从“人肉熟练度”转化成“系统可调用资产”的桥。过去很多软件的价值,建立在你是否熟悉它的菜单、路径和操作顺序;以后越来越多的价值,会转移到另一边:你是否拥有高质量的 skill,是否能把领域知识、流程判断和边界意识,沉淀成代理可执行的结构化能力。
权力更替
操作系统不再负责分发界面,而开始接管目标、调度能力、维持约束。
顺着这个逻辑再往下推,操作系统的定义也开始悄悄变味了。
过去我们理解操作系统,想到的是窗口、文件、输入输出、权限、调度。未来这些当然不会消失,但它们的重要性会被重新排序。新的中心,不再只是“给人一个可以点来点去的桌面”,而是替人维持一个持续运行、受到约束、可以审计、能够调度各种能力去完成目标的执行体。
OECD 在 2026 年关于 agentic AI 的工作论文里(The agentic AI landscape and its conceptual foundations[8]),并不是把重点放在“更会聊天”上,而是放在另一类能力上:围绕目标展开行动、拆解并委派任务、在更长时间跨度内持续推进,以及在更复杂、更不可预测的环境中,以更少的人工逐步监督运行。翻成人话就是:系统不再只是等你问一句、回一句,而是会围着一个结果自己拆步骤、排优先级、持续往前走;人不必盯住每一个中间动作,但仍会在关键节点保留监督、审批和纠偏的权力。
换句话说,下一代操作系统如果真的成立,它更像一个目标编排系统,而不是一个界面分发系统。
到了那个阶段,系统首先要管的,已经不再是“哪个窗口排在最前面”,而是“现在到底哪个目标在执行、它能调用哪些能力、权限边界画在哪里、哪些动作必须先经过审批、出了问题该怎么立刻掐断、整条责任链又该如何被完整记录”。Perplexity 在 Personal Computer 里反复强调 approval、audit trail、kill switch,其实已经把这个时代真正的门槛提前泄露出来了:未来最关键的护城河,未必是谁模型更聪明,而是谁能做出更可信的控制面。
这也就不难理解,为什么 OpenClaw 越火,安全焦虑反而越大。因为一旦一个系统开始 24 小时常驻,跨入口存在,握着文件、消息、会话、浏览器乃至自动执行的权限,它就不再只是一个回答问题的工具,而是一个带着行动能力的半自治实体。到那时,风险也不再停留在“它回错一句话”“它理解歪了一次需求”这种层面,而会真正落到现实世界:权限有没有被越界使用,钱有没有被错误调动,数据有没有被带走,责任最后又该算在谁头上。
人的价值
真正被重写的,不只是软件,而是人的价值分布。
写到这里,人类不愿真正面对的那层遮羞布,其实已经被撕的差不多了。
很多人嘴上讨论的,是 AI 会不会取代某个职业;可他们心里真正发慌的,往往不是“我会不会失业”,而是“我花了二十年练熟的那套操作性能力,会不会突然被打成不值钱的基础设施”。这种不安非常真实,而且一点都不矫情。因为历史上每一次大的技术迁移,本质上都在干同一件事:把旧时代那些曾经稀缺、曾经能卖出溢价的能力,一层层压缩成新时代的默认配置。
自动化从来都不是简单粗暴地把工资一起打烂,它真正改写的,是一个职业内部到底哪一部分还值钱。被自动化拿走的,如果只是低阶、重复、机械、更多属于执行层的部分,那么留下来的人,反而可能因为承担更复杂的判断和整合而变得更贵;可一旦技术继续侵入到过去最能体现专业门槛的那部分能力,工资、门槛和职业结构就可能一起塌。
把这个逻辑放到意图时代,结论就更刺耳了:未来真正快速贬值的,不是“劳动”本身,而是把目标翻译成步骤的那段中间劳动。
以前,一个人会做很多事,往往意味着他能在复杂工具链里穿针引线,手工把事情推进。以后,这段能力会越来越像电力和宽带——不是没用,而是不再值得单独溢价。新的稀缺性会继续往上漂,漂到三个更冷、更硬的位置上。
- 目标定义:你到底要什么,不再是一个模糊愿望,而必须是一个可以被代理系统理解、拆解、执行、验证的目标。
- 边界设定:什么可以做,什么不可以做,做到什么程度需要停下来问你,什么指标不能被当成唯一目标。
- 责任承担:系统替你行动,不等于责任也能一起外包。最后要为后果负责的,仍然得是人。
这就是我为什么一直不太喜欢那种廉价口号,说什么“以后人人都只要会提需求就行”。不是的!未来不是需求变简单了,而是人再也不能靠操作上的忙碌来逃避思考。以前你做不出方案,可以先打开 PPT 调模板;写不出内容,可以先去改排版、配图、调字号,让自己看起来很忙。那是旧系统给人的一种缓冲,也是一种自我欺骗。代理时代会把这层缓冲砍薄。你不再能轻松躲进动作里,你会被更直接地逼问:你到底想表达什么?你到底要达成什么?你愿意为这个目标承担什么代价?
这才是最反人类直觉、也最接近真相的一点:AI 时代不一定先剥夺人的工作,它更可能先剥夺人用动作假装自己在思考的权利。
顺便说一句,skills 会越来越重要,因为它让经验开始脱离具体的人,变成可挂载、可复用、可组合的系统资产。但它仍不是最深的护城河。它更像是 AI 时代承载领域知识的一种中间介质。真正更稀缺的,仍然是定义问题、压缩目标、设定边界和在复杂情境中作出判断的能力。
巨头装傻
巨头不是看不见未来,而是太看得见了!
一旦这套秩序真的成立,被重写的就不只是人的工作方式,也会是平台世界的租值结构。对个体来说,被掏空的是操作性溢价;对巨头来说,被掏空的则可能是入口、分发和前台控制权本身。
Apple 2025 财年 Services 净销售额约为 1091.58 亿美元,全年总营收约 4161.61 亿美元;2024 年 App Store 生态促成约 1.3 万亿美元的 billings and sales。Alphabet(Google)在 2025 年年报中明确写道,其当年总收入中超过 70% 来自在线广告。Microsoft 则在 2025 财年年报与财报中强调,Azure 年收入首次超过 750 亿美元。三家的处境并不一样:Apple 更容易被 App 主权被掏空这件事刺中,Google 更容易被“人不再亲自搜索、点击、停留”这件事刺中,Microsoft 反而更有机会把自己重新定位成代理时代的基础设施层。
所以,巨头不是看不见未来,而是太看得见了。因为未来一旦成立,伤到的不是边缘功能,而是它们今天最肥的那块肉。一个真正成熟的代理世界,会天然削弱前台界面的统治力,削弱入口的独占价值,削弱用户必须亲自停留、点击、切换、消费广告和被抽税的那套旧秩序。它们当然会做 agent,也会做 AI OS,但它们更倾向于在旧结构上改良,而不是先把自己的租金结构炸掉。
结语
所以,这场转向不会是线性的,也不会是干净利落的。它会先以很多看起来别扭、粗糙、甚至荒诞的形态出现:会点鼠标的 agent,会挂在聊天入口里的 assistant,会跑在一台专用小主机上的常驻代理,会一边强调自主、一边又拼命加审批、沙箱、日志和 kill switch。
很多东西现在当然还下不了准确结论。可有几件事,大方向上反而越来越清楚:操作系统会被重新定义,App 不会立刻消失但一定会降级,人机关系会发生翻转,而最残酷也最有希望的一点是——当“怎么做”越来越便宜,人类终于不得不把注意力挪回那个一直被回避的问题:什么值得做,为什么要做,做到哪里为止。
四十年前,Personal Computer 的意思是,一台属于你的电脑。现在这个词正在悄悄变质。它不再只是“属于你”,而开始逼近另一个更危险、也更强大的定义:一台理解你,并替你持续行动的电脑。
“属于你”和“理解你”,看起来只差一点,实际上是两个时代...
References
Everything is Computer:https://www.perplexity.ai/pl/hub/blog/everything-is-computer
[2]OpenClaw:https://github.com/openclaw/openclaw
[3]MCP:https://github.com/modelcontextprotocol
[4]ACP:https://github.com/agentclientprotocol
[5]A2A:https://github.com/a2aproject/A2A
[6]Linux Foundation:https://www.linuxfoundation.org
[7]A2UI:https://github.com/google/A2UI
[8]The agentic AI landscape and its conceptual foundations:https://www.oecd.org/en/publications/the-agentic-ai-landscape-and-its-conceptual-foundations_396cf758-en.html