老黄断言 Harness 才是 AI 时代真正的操作系统
2026 年 7 月 17 日,英伟达 CEO 黄仁勋与 LangChain 创始人 Harrison Chase 进行了一次 26 分钟的公开对谈。
全程,没有提一次 GPU,没有提一次算力,没有提一次新模型参数。
26 分钟,两个硅谷最懂 AI 工程的人,聊的只有一个词: Harness。
黄仁勋把它称为 "下一代软件公司的操作系统"。
如果你只看标题,可能会以为这是一篇蹭热点的解读。
但我想花 5000 字讲清楚: 为什么这个信号,比 GPT-5 发布、比 Claude Opus 5 上线,都更重要。
因为它意味着 AI 行业的竞争焦点,已经从"模型有多强"切换到了"模型周围那套系统(harness 工程)有多稳" 。这是一次范式级别的洗牌。
一、一组让整个 AI 圈沉默的数据
先抛一组数据,来自 NVIDIA 和 LangChain 的官方联合测试:
用 Nemotron 3 Ultra(英伟达自家的 550B 开源模型)配合 Harness 优化,在 Deep Agents 评测中:
得分:0.86(满分 1.0) 与第一名的差距: 0.01 单次任务成本:从 43.48 美元压到 4.48 美元 降本幅度:89.7%
请把这几个数字默念三遍。
第一名用什么模型?大概率是 Claude Opus 5 或 GPT-5.3-Codex,单次成本 43.48 美元。 第四名用什么模型?Nemotron 3 Ultra,本身能力中上,但单次成本仅需 4.48 美元。 模型没变。 变的是模型周围那套系统。 结果:性能追到只差 0.01,成本砍掉九成。
黄仁勋把这个 "模型周围的系统" 叫做 Harness。
LangChain 创始人 Harrison Chase 在对谈里说了一句很狠的话:
"我们意识到,过去两年我们一直在教开发者怎么写 Prompt。其实他们真正需要的是一套 Harness。"
翻译成大白话: 绝大多数 AI 应用的瓶颈不是模型,是模型之外的东西。
那些 "之外的东西",黄仁勋给了一个清单:
Prompt 管理、工具说明、记忆存储、上下文调度、任务拆分、重试策略、评测体系、权限控制。
一共 8 大模块。
任何一个模块做对了,单次任务成本就能砍一半;8 个都做对了,成本砍九成是常态。
这就是为什么老黄这次 26 分钟不谈 GPU。
二、Harness 是什么?为什么它叫"操作系统"
Harness 这个词的本义是 "马具"——把一匹野马(model)驯服成一匹战马的整套装备。
在 AI 工程里,它被借用来指代: 围绕大模型运行时搭建的一整套系统,让模型的推理能力变成可验收、可计费、可调度的工作。
更直白地说:
模型是发动机,Harness 是变速箱、传动轴、车架、刹车、油门、仪表盘。
没有 Harness 的模型,是实验室里的发动机——能转,但上不了路。
有 Harness 的模型,是一辆能跑的车——能载人、能拉货、能上高速。
黄仁勋把它叫做"操作系统",是因为它和 Windows 干的是同一件事
操作系统做的是"把硬件能力封装成应用可调用的服务"。
Harness 做的是"把模型能力封装成 Agent 可调用的服务"。
抽象层一立,上层的应用就不需要懂底层细节——这是软件工业能持续繁荣 70 年的根本原因。
现在,AI 时代第一次有了自己的抽象层。
三、三个独特观察:为什么这件事比你想的更重要
观察 1:黄仁勋不谈 GPU,是 NVIDIA 的一次精妙"反水"
表面上看,这是黄仁勋在为 Harness 站台。
深层看,这是 NVIDIA 的一次战略转身——从"卖铲子"升级到"定义下一代操作系统"。
为什么?
因为 GPU 是会被替代的,但操作系统不会。
Intel 当年是 PC 时代的王者,靠的是 x86 架构垄断。 但 Intel 之后市值的天花板,被 Windows 时代的微软、和 Windows 之上的应用软件(Oracle、SAP、Adobe)反复超越。 定义"操作系统"心智的人,比"卖硬件"的人活得久得多。
黄仁勋清楚这一点。所以他这次 26 分钟不谈 GPU 谈 Harness,本质上是在用 NVIDIA 的品牌信用,为 "Harness 这套游戏规则" 背书。
这套游戏规则一旦确立:
Nemotron 3 Ultra 这类开源模型(NVIDIA 自家产品)会成为 Harness 生态的"默认底座" LangChain 这类中间件框架(NVIDIA 重仓投资)会成为 Harness 生态的"默认语言" 任何想绕过 NVIDIA 直接做"AI 应用"的公司,都要先经过 Harness 这层抽象
老黄不是在反水,是在用更高级的方式重新定义自己的护城河。
观察 2:90% 降本 + 1.2% 性能差,揭示了一个反摩尔定律的真相
过去 20 年,硬件遵循摩尔定律——性能每 18 个月翻一倍,价格不变。
但 AI 大模型打破了这个规律: 模型升级带来的边际性能提升,越来越小,边际成本越来越高。
GPT-3 → GPT-4:性能跃升 50%,但训练成本涨 10 倍。 GPT-4 → GPT-4 Turbo:性能提升 10%,推理成本降 50%(这是异常值)。 GPT-4 → GPT-5:性能提升 15%,推理成本涨 2 倍。 GPT-5 → GPT-5.3:性能提升 5%,推理成本涨 1.5 倍。
仅通过模型升级带来的边际收益正在递减。
但 Harness 升级呢?
加一个重试机制:成功率 +5%,成本 +0% 加一个上下文压缩:单次 token 消耗 -30%,性能 +1% 加一个任务拆分:长任务成功率 +40%,成本 -20% 加一个权限沙箱:错误率 -80%,性能 +0%(但生产可用性 +N 倍)
Harness 升级 = 边际收益递增。
这是软件工程的复利效应——和硬件的摩尔定律恰好相反。
当黄仁勋说"模型没变,变的是模型周围的系统"时,他真正在说:
AI 行业的下一个 10 年,赢家不是模型公司,是 Harness 公司。
观察 3:开源 Harness 阵营已经形成"复仇者联盟"
让我列一下 2026 年 7 月这一波密集动作:
NVIDIA:Nemotron 3 Ultra 开源(Hugging Face、build.nvidia.com、OpenRouter) LangChain:Deep Agents 1.0 重写,估值 12.5 亿美元 DeepSeek:V4-Flash 公测,Deep Code 开源,Harness 团队招募 Anthropic:Claude Code 把 Harness 做到极致(5 层架构 / 43+ 工具 / 26 个 Hook 事件) OpenAI:Codex CLI 开源 Harrison Chase(LangChain) :直接和黄仁勋对谈 26 分钟
你看到了吗?
GPU 霸主 + 模型中间件霸主 + 开源大模型新贵 + 闭源大模型霸主 + 模型 API 霸主——五家看似竞争的公司,在 Harness 这件事上罕见地站到了同一阵营。
这不是巧合。
这是整个产业链意识到:"模型之争"已经打完了,"Harness 之争"才刚开始。
四、中国玩家的卡位战
看完硅谷,再看中国。
DeepSeek Harness——开源 + 桌面端 Agent,由 Jane Street 9 年量化老兵崔添翼挂帅。这是 DeepSeek 从"模型公司"转向"产品公司"的关键一跳。
字节 Trae——VS Code 内核 IDE,国内永久免费基础版,600 万注册用户、92% 字节内部工程师使用、抖音生活服务团队 AI 代码贡献率 43%。这是字节用 "IDE 替代品" 卡位,靠 "IDE + 模型" 一体化吃市场。
阿里通义千问 / 百度文心 / 腾讯元宝 / Kimi / 月之暗面——还在拼模型 + App 的旧战场,没有明确的 Harness 战略。
我的判断是: DeepSeek Harness 是中国玩家最有希望突围的方向,原因是它和美国 Harness 阵营在同一个开源 Harness 生态下竞争。
具体三个理由:
开源基因:DeepSeek 历来"开源周"传统 + Nemotron 3 Ultra 是开源 + LangChain Deep Agents 是开源。开源 Harness 生态是中美共同的底座。
桌面端优先:中国市场的特点是 IDE 用户群小于美国,但"全民 AI 应用"市场远大于美国。桌面端 Agent(非 IDE)才是中国主流。
成本优势:DeepSeek V4-Flash 已经做到单 token 推理成本接近开源模型水平,再叠加 Harness 优化,单次任务成本可能做到 Claude Code 的 1/10。
Trae 是 IDE 之争,DeepSeek Harness 是 Agent 之争——这是两个赛道,不是同一个赛道。
《德说-第530期, 昨天见了 2 位老友, 不约而同的展示了 AI 的上乘武功, 他们都有一把“屠龙刀”》 我也聊到过, 易景作为一家以技术为核心竞争力的数据库公司, 也在秘密研发 Agent (核心也是Harness工程, 用更低的成本, 更高效稳定的交付 coding任务)
五、给程序员的忠告:从"打字员"进化成"作家"
黄仁勋在对谈里说了一句很漂亮的话:
"写代码就像打字。打字能力很重要,但打字从来不是作家的全部工作。"
这句话的杀伤力,比它字面意思要大得多。
未来 5 年,最稀缺的程序员,不是会写代码的程序员,而是会"调度 Agent 写代码"的程序员。
这种程序员长什么样?我叫他们 "作家型程序员" 。
他们和传统程序员的区别:
具体建议三件事,现在就可以开始做:
第一件事:把你的 Claude Code / Codex CLI 当成"实习生"带
不要把它当成"自动补全工具",要把它当成"刚入职的实习生"。
给它布置完整任务,让它独立完成,事后 review。3 个月后你会发现:你花在 review 上的时间,比它替你节省的时间更重要——因为你在 review 中学会了"什么该让 Agent 做、什么不该让 Agent 做"。
第二件事:读 Claude Code 的 Harness 架构源码
Claude Code 的 Harness 是当前业界最成熟的工程实践(1900+ TypeScript 文件、51.2 万行严格类型代码、5 层架构、43+ 工具、26 个 Hook 事件)。
读完一遍,你对"AI 时代的工程化"会有质变级别的理解。
第三件事:学一点量化交易思维
不是让你去炒币,而是让你学 Jane Street 那种"把策略转化为执行"的能力:
回测 → Agent 轨迹回放 风控 → 沙箱 + 权限控制 异常处理 → 重试 + Fallback 可观测性 → Trace + 日志
会写代码的程序员满大街都是,会写 Harness 的程序员,全中国可能不到 10 万人。
你愿意做哪一种?
六、写在最后:每一次操作系统革命,都催生一代新的亿万富翁
1980 年代:MS-DOS → 微软 → 比尔·盖茨 1990 年代:Windows 95 → 微软 + 一代应用软件公司(Oracle、SAP、Adobe) 2007 年代:iOS / Android → 苹果 + 谷歌 + 一代移动应用公司(Uber、Airbnb、字节) 2020 年代:Linux 云时代 → 亚马逊 AWS + 一代 SaaS 公司(Salesforce、ServiceNow、Datadog)
每一次"操作系统"级别的抽象层革命,都会催生一代新的亿万富翁。
AI 时代的 Harness,就是下一个抽象层。
定义这一层的人,会成为下一个时代的微软、苹果、亚马逊。
现在这一层还在跑马圈地:
Anthropic 用 Claude Code 卡位 OpenAI 用 Codex CLI 卡位 LangChain 用 Deep Agents 卡位 DeepSeek 用 Harness 卡位 NVIDIA 用 Nemotron + LangChain 联盟卡位
谁会赢?
我不知道。但我知道一件事:
5 年后回头看,今天这场"黄仁勋 26 分钟不谈 GPU"的访谈,会被公认为 AI 时代的"Windows 95 时刻"。
而我们正在见证它的发生。
附录:Harness 8 大模块速查表
把这 8 个模块做到极致,你就能复制出"43.48 美元 → 4.48 美元"那个奇迹。
Harness 是 AI 时代真正的杠杆。