从养虾(OpenClaw)到养马(Hermes),鹅厂AI概念“过山车”式追赶背后
不管是龙虾,还是Harness,Hermes,这些AI变种的快速崛起,折射出AI行业从“模型竞赛”转向“工程落地”时的集体焦虑与探索。
回顾这三年多的发展,大模型已经历了从“觉醒”到“执行”的多次跨越。中间,我们兴奋过、恐慌过,然后坦然接受,这个有可能替代人类大脑的“数字生命体”,正在以最快的速度进化着,每一个新技术概念推出背后,其实都是它成为“最强自我”的一次蜕变。
对于身处其中的我们而言,与其焦虑,不如积极拥抱变化,学会与之协作。这应该是被称为“鹅厂”的腾讯,以及更多的互联网大厂,在全新AI时代的自我定位。
鹅厂眼中的AI“线束”变阵
今天,无意中看到“腾讯集团高级执行副总裁、云与智慧产业事业群CEO汤道生”的一篇署名文章,标题是《人工智能正式进入 Harness 时代》。于是,整个人好像一下被外力击中。
最近几个月,腾讯一直在“全力搞虾”。除了一口气上线五只龙虾(桌面AI智能体WorkBuddy、接入企业微信的OpenClaw、接入QQ的OpenClaw、腾讯云轻量云部署OpenClaw,以及腾讯电脑管家推出的QClaw),公司还会把所有产品都“虾化”。腾讯CEO马化腾发朋友圈称:自研龙虾、本地虾、云端虾、企业虾、云桌面虾,安全隔离虾房、云保安、知识库……还有一批产品陆续赶来。
之后的时间里,腾讯不负众望。办公虾、情报虾、盯盘虾、家教虾……每一款“虾品”,都直戳用户痛点!
就在人们看到“鹅厂”已成为这场“龙虾大战”中的“顶尖玩家”时,Harness这个AI“新宠”出现。而腾讯的表现是,没有任何犹豫,选择立刻接入。战略变化之快,让人始料未及。
但如果你仔细阅读汤道生的这篇文章,就会理解腾讯最新变化的心路历程,同时还会深刻认同一个核心观点——AI落地是一道工程难题,为了让模型能够长出手脚、能真正干活,所有技术概念都是“变量”,是外部的“壳”,所以不管是OpenClaw,还是Harness,本质上都是把“贵族玩具”变成“大众工具”的那套系统。模型没变,变的是驾驭它的“线束”。
那么,问题来了,Harness到底有着怎样的“魔力”,让今年非抓住点什么的“鹅厂”,必须要迎头赶上?先捋一捋Harness发展的时间线!
新AI公式诞生,Agent = Model + Harness
要理解Harness为什么突然成为“鹅厂”的最新追捧对象?得先看AI工程这几年走过的路线!
2022年:模型从"能说"开启新时代。ChatGPT的诞生,全世界震惊。能写诗、能编故事、能解释相对论。但很快大家就发现了一个尴尬的现实:模型能生成,但不能行动。能写邮件,但发不出去。能写代码,但跑不了。工程上的产物是Prompt Engineering——怎么问才能让模型答得更好。
2023-2024年:模型学会了连接。Function Calling、LangChain、AutoGPT……这些技术的本质,只有一个,那就是让模型能够调用外部工具。但连接不等于能干活。AutoGPT那种"让模型自己跑"的尝试,像极了让一个刚学会走路的孩子去跑马拉松。尽管demo惊艳全场,但一上生产环境就翻车。所以,热潮来得快,去得也快。
2024年:推理模型登场。这回不一样了,模型学会了思考,代码能力也突飞猛进。但仍面临一个窘迫的现实,干活干到一半突然“断片”,原因是:短期记忆不够用,长期目标保持不住。
2025年:AI迎来Agent元年。Agent能自主工作数小时了,但新的问题是,它无法判断自己是否完成工作,多个Agent并行时小错误会被放大,直至系统崩掉。代码库出现大量"AI slop",系统结构出了问题。
2026年:治理时代Harness来了。Harness ,中文意思是“马具”、“缰绳”,Harness Engineering被正式命名后,工程师的工作重心变成了"设计环境、明确意图、构建反馈回路"。
从这个时间轴来看,虽然Harness只用3个月时间就火遍AI圈,但其实是AI工程集体进化的结果。
Harness 的诞生缘起于2026年2月,HashiCorp联合创始人、Terraform缔造者Mitchell Hashimoto在一篇博客中,首次提出了 “Harness Engineering” 这一说法。他将自己使用AI编程的进化拆成了六个阶段,第五个阶段就叫Engineer the Harness。他的定义非常朴素:“每当你发现Agent犯了一个错误,你就花时间去工程化一个解决方案,让它再也不会犯同样的错”。
之后,OpenAI迅速跟进,发布技术博客《Harness Engineering: Leveraging Codex in an Agent-First World》,用一场激进的实验向行业展示了什么是Harness。该实验是,一个仅由3名工程师组成的团队,在5个月内用Codex Agent生成了超过100万行生产级代码,合并了约1500个Pull Request,没有一行代码是人类手写的。
进入3月份,Harness开始真正“出圈”。Anthropic发布重磅工程博客《Effective harnesses for long-running agents》,正式将Harness定义为“支撑复杂AI智能体运行的外部框架、控制机制与编排系统”。他们还展示了经典的三智能体分离架构:规划者(Planner)、生成者(Generator)、评估者(Evaluator),将生成与评估的职责拆分后,任务验收准确率直接提升到了94%。
3月中旬,LangChain发布了一篇题为《The Anatomy of an Agent Harness》的实证文章,彻底点燃了行业热情——仅仅是给同一个大模型换上一套更精巧的Harness架构,它在Terminal Bench 2.0上的通过率,就从52.8%直接拉升到了66.5%,排名从三十名开外狂飙到前五。
4月初,腾讯集团高级执行副总裁汤道生指出:“在同样的模型能力下,不同的脚手架设计,对实际使用效果与tokens成本有很大影响。”。AI明星林俊旸也公开表示:“现在模型+harness的模式已经超过单纯的AI模型。Harness的设计和质量能显著影响AI智能体性能,开发Harness是正确的道路。”
自此,行业共识达成,新AI公式诞生——Agent = Model + Harness。
Harness与OpenClaw、Hermes Agent之间的爱恨情仇
新的问题是,有人可能会问了。有了Harness,以OpenClaw为代表的龙虾们,还能继续玩下去吗?答案是:不仅能继续玩,还能玩出新花样!
现在,除了OpenClaw这只龙虾,AI界又出了一个爱马仕Hermes Agent,据说这个东西的强大之处在于,Agent自己能做Harness Engineering。
这里,需要插播一条消息:就在笔者撰稿之际,腾讯云传来新动态。腾讯云轻量应用服务器Lighthouse正式上线Hermes Agent专属应用模板,这也是行业首家实现该开源AI智能体的云端一键快速部署,其企业级ClawPro产品也将于本周内完成适配支持。在竞争白热化的AI世界,“鹅厂”的技术嗅觉和反应速度,真是令人惊叹。
那么,Harness与OpenClaw、Hermes Agent之间到底是怎样一种关系?很明显,既有竞争,又能互补!从竞争层面看,一个新技术出来,必然是在上一代技术基础上进行了迭代;互补,是因为没有任何一项技术能做到十全十美,永恒不变。就三者关系而言,大家都是各有所长。OpenClaw负责触达用户,Hermes Agent负责持续进化,而Harness Engineering则负责可靠性。
对于用户而言,短期内OpenClaw更实用。能快速上手,技能生态成熟,IM渠道齐全,日常自动化够用。中期看,Harness Agent的自主进化能力会拉开差距。一个能自己学习、自己改进的Agent,跟一个只会执行预设流程的Agent,长期效率肯定会差一个数量级。但到最后,决定输赢的胜负手在于,谁先把Harness Engineering的方法论融入产品,谁就能在"聪明"和"靠谱"之间找到平衡。
事实上,Hermes Agent能够快速走进大众视野,也是AI工程相互融合的结果,本质上都是为解决“一个会思考的大脑”和“一个能干活员工”之间的那三道坎:记忆、工具和安全问题。
写在最后
从某种角度来说,不管是龙虾,还是Harness,Hermes,这些AI变种的快速崛起,折射出AI行业从“模型竞赛”转向“工程落地”时的集体焦虑与探索。
不管它们是否会昙花一现,但至少现在,人们已经意识到:要想让AI更靠谱,模型强还不行,还需要一套可靠的“缰绳”,这套缰绳还得Agent自己去生、去养,最后要实现的目标是——靠谱、能干活这一AI终途!
以为能躺赚,结果“养虾”变成了“养雷”,第一批“养虾人”已经失眠了……
DeepSeek被针对,Anthropic指控三家中国AI蒸馏剽窃,马斯克硬刚“贼喊抓贼”!
明明大厂裁员滚滚,为什么运维还这么难招?
在 SQL 中写了 in 和 not in,技术总监让我明天不用来了
年底了!系统稳如狗,甲方觉得我们没工作量,怎么收运维费?
为什么DeepSeek火之后,人们想到的是大量裁员,而不是实行上三休四?
《AI数据分析之ChatBI发展与应用实践》白皮书(附下载)正式上线啦
号外!《核心系统分布式数据库选型指南》电子书(附下载)正式上线
解锁数据架构现代化密码,《实时数仓选型指南》电子书(附下载)正式上线啦