PostgreSQL码农集散地

老黄断言 Harness 才是 AI 时代真正的操作系统

2026 年 7 月 17 日,英伟达 CEO 黄仁勋与 LangChain 创始人 Harrison Chase 进行了一次 26 分钟的公开对谈。

全程,没有提一次 GPU,没有提一次算力,没有提一次新模型参数。

26 分钟,两个硅谷最懂 AI 工程的人,聊的只有一个词: Harness。

黄仁勋把它称为 "下一代软件公司的操作系统"。

如果你只看标题,可能会以为这是一篇蹭热点的解读。

但我想花 5000 字讲清楚: 为什么这个信号,比 GPT-5 发布、比 Claude Opus 5 上线,都更重要。

因为它意味着 AI 行业的竞争焦点,已经从"模型有多强"切换到了"模型周围那套系统(harness 工程)有多稳" 。这是一次范式级别的洗牌。

一、一组让整个 AI 圈沉默的数据

先抛一组数据,来自 NVIDIA 和 LangChain 的官方联合测试:

用 Nemotron 3 Ultra(英伟达自家的 550B 开源模型)配合 Harness 优化,在 Deep Agents 评测中:

  • 得分:0.86(满分 1.0)
  • 与第一名的差距: 0.01
  • 单次任务成本:从 43.48 美元压到 4.48 美元
  • 降本幅度:89.7%

请把这几个数字默念三遍。

  • 第一名用什么模型?大概率是 Claude Opus 5 或 GPT-5.3-Codex,单次成本 43.48 美元。
  • 第四名用什么模型?Nemotron 3 Ultra,本身能力中上,但单次成本仅需 4.48 美元。
  • 模型没变。
  • 变的是模型周围那套系统。
  • 结果:性能追到只差 0.01,成本砍掉九成。

黄仁勋把这个 "模型周围的系统" 叫做 Harness。

LangChain 创始人 Harrison Chase 在对谈里说了一句很狠的话:

"我们意识到,过去两年我们一直在教开发者怎么写 Prompt。其实他们真正需要的是一套 Harness。"

翻译成大白话: 绝大多数 AI 应用的瓶颈不是模型,是模型之外的东西。

那些 "之外的东西",黄仁勋给了一个清单:

Prompt 管理、工具说明、记忆存储、上下文调度、任务拆分、重试策略、评测体系、权限控制。

一共 8 大模块。

任何一个模块做对了,单次任务成本就能砍一半;8 个都做对了,成本砍九成是常态。

这就是为什么老黄这次 26 分钟不谈 GPU。

二、Harness 是什么?为什么它叫"操作系统"

Harness 这个词的本义是 "马具"——把一匹野马(model)驯服成一匹战马的整套装备。

在 AI 工程里,它被借用来指代: 围绕大模型运行时搭建的一整套系统,让模型的推理能力变成可验收、可计费、可调度的工作。

更直白地说:

模型是发动机,Harness 是变速箱、传动轴、车架、刹车、油门、仪表盘。

没有 Harness 的模型,是实验室里的发动机——能转,但上不了路。

有 Harness 的模型,是一辆能跑的车——能载人、能拉货、能上高速。

黄仁勋把它叫做"操作系统",是因为它和 Windows 干的是同一件事

操作系统(1980s~)
Harness(2020s~)
文件系统
上下文存储 / MEMORY.md
进程调度
任务拆分 / 子 Agent 委派
内存管理
Token 预算 / 上下文压缩
设备驱动
Tool 适配层(MCP 协议)
网络协议栈
API 网关 / 工具编排
权限系统
沙箱 / 权限控制
系统调用
Prompt + Function Calling
中断 / 信号
重试 / 异常处理

操作系统做的是"把硬件能力封装成应用可调用的服务"。

Harness 做的是"把模型能力封装成 Agent 可调用的服务"。

抽象层一立,上层的应用就不需要懂底层细节——这是软件工业能持续繁荣 70 年的根本原因。

现在,AI 时代第一次有了自己的抽象层。

三、三个独特观察:为什么这件事比你想的更重要

观察 1:黄仁勋不谈 GPU,是 NVIDIA 的一次精妙"反水"

表面上看,这是黄仁勋在为 Harness 站台。

深层看,这是 NVIDIA 的一次战略转身——从"卖铲子"升级到"定义下一代操作系统"。

为什么?

因为 GPU 是会被替代的,但操作系统不会。

  • Intel 当年是 PC 时代的王者,靠的是 x86 架构垄断。
  • 但 Intel 之后市值的天花板,被 Windows 时代的微软、和 Windows 之上的应用软件(Oracle、SAP、Adobe)反复超越。
  • 定义"操作系统"心智的人,比"卖硬件"的人活得久得多。

黄仁勋清楚这一点。所以他这次 26 分钟不谈 GPU 谈 Harness,本质上是在用 NVIDIA 的品牌信用,为 "Harness 这套游戏规则" 背书。

这套游戏规则一旦确立:

  • Nemotron 3 Ultra 这类开源模型(NVIDIA 自家产品)会成为 Harness 生态的"默认底座"
  • LangChain 这类中间件框架(NVIDIA 重仓投资)会成为 Harness 生态的"默认语言"
  • 任何想绕过 NVIDIA 直接做"AI 应用"的公司,都要先经过 Harness 这层抽象

老黄不是在反水,是在用更高级的方式重新定义自己的护城河。

观察 2:90% 降本 + 1.2% 性能差,揭示了一个反摩尔定律的真相

过去 20 年,硬件遵循摩尔定律——性能每 18 个月翻一倍,价格不变。

但 AI 大模型打破了这个规律: 模型升级带来的边际性能提升,越来越小,边际成本越来越高。

GPT-3 → GPT-4:性能跃升 50%,但训练成本涨 10 倍。 GPT-4 → GPT-4 Turbo:性能提升 10%,推理成本降 50%(这是异常值)。 GPT-4 → GPT-5:性能提升 15%,推理成本涨 2 倍。 GPT-5 → GPT-5.3:性能提升 5%,推理成本涨 1.5 倍。

仅通过模型升级带来的边际收益正在递减。

但 Harness 升级呢?

  • 加一个重试机制:成功率 +5%,成本 +0%
  • 加一个上下文压缩:单次 token 消耗 -30%,性能 +1%
  • 加一个任务拆分:长任务成功率 +40%,成本 -20%
  • 加一个权限沙箱:错误率 -80%,性能 +0%(但生产可用性 +N 倍)

Harness 升级 = 边际收益递增。

这是软件工程的复利效应——和硬件的摩尔定律恰好相反。

当黄仁勋说"模型没变,变的是模型周围的系统"时,他真正在说:

AI 行业的下一个 10 年,赢家不是模型公司,是 Harness 公司。

观察 3:开源 Harness 阵营已经形成"复仇者联盟"

让我列一下 2026 年 7 月这一波密集动作:

  • NVIDIA:Nemotron 3 Ultra 开源(Hugging Face、build.nvidia.com、OpenRouter)
  • LangChain:Deep Agents 1.0 重写,估值 12.5 亿美元
  • DeepSeek:V4-Flash 公测,Deep Code 开源,Harness 团队招募
  • Anthropic:Claude Code 把 Harness 做到极致(5 层架构 / 43+ 工具 / 26 个 Hook 事件)
  • OpenAI:Codex CLI 开源
  • Harrison Chase(LangChain) :直接和黄仁勋对谈 26 分钟

你看到了吗?

GPU 霸主 + 模型中间件霸主 + 开源大模型新贵 + 闭源大模型霸主 + 模型 API 霸主——五家看似竞争的公司,在 Harness 这件事上罕见地站到了同一阵营。

这不是巧合。

这是整个产业链意识到:"模型之争"已经打完了,"Harness 之争"才刚开始。

四、中国玩家的卡位战

看完硅谷,再看中国。

DeepSeek Harness——开源 + 桌面端 Agent,由 Jane Street 9 年量化老兵崔添翼挂帅。这是 DeepSeek 从"模型公司"转向"产品公司"的关键一跳。

字节 Trae——VS Code 内核 IDE,国内永久免费基础版,600 万注册用户、92% 字节内部工程师使用、抖音生活服务团队 AI 代码贡献率 43%。这是字节用 "IDE 替代品" 卡位,靠 "IDE + 模型" 一体化吃市场。

阿里通义千问 / 百度文心 / 腾讯元宝 / Kimi / 月之暗面——还在拼模型 + App 的旧战场,没有明确的 Harness 战略。

我的判断是: DeepSeek Harness 是中国玩家最有希望突围的方向,原因是它和美国 Harness 阵营在同一个开源 Harness 生态下竞争。

具体三个理由:

  1. 开源基因:DeepSeek 历来"开源周"传统 + Nemotron 3 Ultra 是开源 + LangChain Deep Agents 是开源。开源 Harness 生态是中美共同的底座。

  2. 桌面端优先:中国市场的特点是 IDE 用户群小于美国,但"全民 AI 应用"市场远大于美国。桌面端 Agent(非 IDE)才是中国主流。

  3. 成本优势:DeepSeek V4-Flash 已经做到单 token 推理成本接近开源模型水平,再叠加 Harness 优化,单次任务成本可能做到 Claude Code 的 1/10。

Trae 是 IDE 之争,DeepSeek Harness 是 Agent 之争——这是两个赛道,不是同一个赛道。

《德说-第530期, 昨天见了 2 位老友, 不约而同的展示了 AI 的上乘武功, 他们都有一把“屠龙刀”》  我也聊到过, 易景作为一家以技术为核心竞争力的数据库公司, 也在秘密研发 Agent (核心也是Harness工程, 用更低的成本, 更高效稳定的交付 coding任务)

五、给程序员的忠告:从"打字员"进化成"作家"

黄仁勋在对谈里说了一句很漂亮的话:

"写代码就像打字。打字能力很重要,但打字从来不是作家的全部工作。"

这句话的杀伤力,比它字面意思要大得多。

未来 5 年,最稀缺的程序员,不是会写代码的程序员,而是会"调度 Agent 写代码"的程序员。

这种程序员长什么样?我叫他们 "作家型程序员" 。

他们和传统程序员的区别:

维度
打字员型程序员
作家型程序员
工作内容
写函数、写类、写测试
设计 Prompt、写 Harness 规则、编排 Agent 流程
核心技能
语法、算法、数据结构
系统设计、可观测性、容错设计、Agent 编排
价值评估
代码行数、PR 数
Agent 成功率、单次任务成本、生产可用性
学习路径
LeetCode → 框架源码 → 操作系统
Claude Code 源码 → Harness 架构 → 量化思维

具体建议三件事,现在就可以开始做:

第一件事:把你的 Claude Code / Codex CLI 当成"实习生"带

不要把它当成"自动补全工具",要把它当成"刚入职的实习生"。

给它布置完整任务,让它独立完成,事后 review。3 个月后你会发现:你花在 review 上的时间,比它替你节省的时间更重要——因为你在 review 中学会了"什么该让 Agent 做、什么不该让 Agent 做"。

第二件事:读 Claude Code 的 Harness 架构源码

Claude Code 的 Harness 是当前业界最成熟的工程实践(1900+ TypeScript 文件、51.2 万行严格类型代码、5 层架构、43+ 工具、26 个 Hook 事件)。

读完一遍,你对"AI 时代的工程化"会有质变级别的理解。

第三件事:学一点量化交易思维

不是让你去炒币,而是让你学 Jane Street 那种"把策略转化为执行"的能力:

  • 回测 → Agent 轨迹回放
  • 风控 → 沙箱 + 权限控制
  • 异常处理 → 重试 + Fallback
  • 可观测性 → Trace + 日志

会写代码的程序员满大街都是,会写 Harness 的程序员,全中国可能不到 10 万人。

你愿意做哪一种?

六、写在最后:每一次操作系统革命,都催生一代新的亿万富翁

1980 年代:MS-DOS → 微软 → 比尔·盖茨 1990 年代:Windows 95 → 微软 + 一代应用软件公司(Oracle、SAP、Adobe) 2007 年代:iOS / Android → 苹果 + 谷歌 + 一代移动应用公司(Uber、Airbnb、字节) 2020 年代:Linux 云时代 → 亚马逊 AWS + 一代 SaaS 公司(Salesforce、ServiceNow、Datadog)

每一次"操作系统"级别的抽象层革命,都会催生一代新的亿万富翁。

AI 时代的 Harness,就是下一个抽象层。

定义这一层的人,会成为下一个时代的微软、苹果、亚马逊。

现在这一层还在跑马圈地:

  • Anthropic 用 Claude Code 卡位
  • OpenAI 用 Codex CLI 卡位
  • LangChain 用 Deep Agents 卡位
  • DeepSeek 用 Harness 卡位
  • NVIDIA 用 Nemotron + LangChain 联盟卡位

谁会赢?

我不知道。但我知道一件事:

5 年后回头看,今天这场"黄仁勋 26 分钟不谈 GPU"的访谈,会被公认为 AI 时代的"Windows 95 时刻"。

而我们正在见证它的发生。

附录:Harness 8 大模块速查表

模块
作用
典型实现
Prompt 管理
System Prompt 模板化、版本化
CLAUDE.md、AGENTS.md
工具说明
Tool Schema、Function Calling 定义
MCP 协议、OpenAPI
记忆存储
跨会话持久化、长期记忆
MEMORY.md、向量数据库
上下文调度
Token 预算、4 级压缩、滑动窗口
Claude Code 的 ctx compression
任务拆分
Plan-then-Execute、子 Agent 委派
LangGraph、Deep Agents
重试策略
指数退避、错误分类、自动恢复
tenacity、custom retry middleware
评测体系
离线 benchmark + 在线 trace + 红队测试
LangSmith、PinchBench、Deep Agents 0.86
权限控制
文件沙箱、网络隔离、操作授权
5 种权限模式(Claude Code)、Docker sandbox

把这 8 个模块做到极致,你就能复制出"43.48 美元 → 4.48 美元"那个奇迹。

Harness 是 AI 时代真正的杠杆。