巨头周报 · 模型记住要花钱了
这一周没有一件大事,但每一件都在同一个方向使劲: 让模型记住更多东西的代价,正在被拆成三份,分别交给数据库、向量引擎和模型厂商去优化。
openGauss 7.0.0 LTS 把"记住对话"写进数据库内核;S3 Vectors 把过滤条件挪到相似度扫描之前;OpenAI 和 Anthropic 几乎同一天把"缓存命中率"写进了官方定价指南。
这三件事没有一件是发布会上的主角。但对要真拿 Agent 上生产的人,它们的分量比一次跑分刷新重得多。
还有一条线藏在算力侧:Rubin 机架开始规模交付,AMD 拿到第一个十亿美元级机架订单,核电站被签 20 年购电协议,而高盛把 2027 年超大规模厂商的 AI 资本开支上调到 1.2 万亿美元,同时算出超过 2,000 亿美元的回报缺口。
这周值得记住的一句话:上下文越来越贵,而 Agent 必须记住。整周的动作都是在这句话上找解法。
本周总览
数据库与向量层同时动手记忆优化。openGauss 7.0.0 LTS 主打 oGMemory 多轮对话准确率 +30%、Token 开销 −50%;S3 Vectors 的 ENHANCED 索引模式让高选择性过滤的召回最多多返回 5 倍;Google Cloud 的 M4N VM 直接为 Milvus / Qdrant / Vespa / Redis 这类向量栈而生。
DuckDB 团队并入 Amazon。Aurora PostgreSQL 现在把 DuckDB 内嵌进引擎,一条 SQL 就能把库内实时数据和 Iceberg / Parquet 数据湖 JOIN 起来,反向 ETL 这条流水线可以退休了。
模型厂商集体从"降价"转向"降单任务成本" 。Anthropic 的 Sonnet 5.5 单价与 Sonnet 5 完全一致,所谓"便宜 30%"来自 token 用得更省和更少的工具调用。价格战打的是工程效率,不是议价能力。
算力供给的三个约束同时显形:Rubin 机架可交付(第三方实测吞吐 +4.8 倍)、电力被 20 年期合同锁住、资本开支预期抬到 1.2 万亿美元但回报缺口超 2,000 亿美元。
安全与合规压力从舆论变成法律动作。OpenAI 因为内部测试不达标砍掉 GPT-6.1 Astra 的十月发布计划,安全负责人辞职,加州总检察长发出调查传票,NVIDIA 则推出 Open Agent Safety Platform。
3 篇深度
深度一|DuckDB 被内嵌进 Aurora,湖仓与 OLTP 的边界被抹掉一层
发生了什么
2026-09-30,AWS 宣布 Aurora PostgreSQL 新增能力,可直接查询数据湖中的 Apache Iceberg 与 Parquet 数据,用的还是你现有的 PostgreSQL 应用和工具。关键细节在官方博客里说得很直白:维护 DuckDB 项目的 DuckLabs 团队最近加入了 Amazon,DuckDB 现在被直接嵌入 Aurora PostgreSQL 引擎内部。
这条时间线值得单独拎出来。DuckDB 过去几年的定位是"进程内分析数据库"——单文件、零部署、嵌入式。它最好的场景从来不是替代一个 24x7 运行的数据库实例,而是在你已有的数据旁边加一个能直接查 Parquet 的引擎。AWS 把团队买下来、把引擎嵌进去,等于承认了这个架构方向,而不是 fork 一个功能。
AWS 自己给的使用场景里,明确写了 "building AI agents that reason over both live and archived data"——让 Agent 同时推理实时交易数据和归档数据。而且它特意说明能读到未提交写入,这个能力对 Agent 场景很关键:Agent 发起一个事务、写入一条中间状态、然后在同一事务里 JOIN 湖里的历史数据做判断,传统反向 ETL 做不到。
官方文档提到支持 AWS Glue Data Catalog 管理的 Iceberg 表,以及存放在 S3 和 S3 Tables 的 Parquet 与 Iceberg 数据。同时提供 predicate pushdown、列裁剪和实例内缓存,另有 aurora_analytics_stat_statements() 供查扫描行数与 S3 读取字节。
为什么值得关注
反向 ETL 这条流水线存在了十几年,它的成本从来不在计算,在于同步。你要维护 DDL 同步、增量同步、失败重试、schema 演进时的兼容。
Agent 让这个问题变得更糟。AWS 原文说得很实在:随着 AI agent 越来越多地嵌入应用,"预先复制 agent 可能需要的每一个数据集"变得不现实——因为 agent 需要什么,事前不可知。
而 Aurora 这次的思路是:不预复制,查询时现场去读。这跟"把数据都搬进库"是两种完全不同的架构选择。
对不同人的意义
对 DBA:先别急着兴奋。湖上数据的 schema 演进、时区、分区裁剪的实际表现,都需要在真实业务数据上验证。官方文档里的 predicate pushdown 是不是对你的分区键生效,这是必测项。工程设想,非官方文档,Lakehouse 侧的能力边界本文未独立实测。 对 AI 实践者:如果你在做文档问答类 Agent,现在多了一个不用自己搭 Iceberg connector 的路径。但要注意这条路径的延迟特性——它是 OLTP 引擎里嵌的分析,不等于把数据搬进了库。 对投资视角:DuckDB 这个动作是个信号。分析型引擎的能力正在被 OLTP 引擎吸收,"湖仓一体"这个 2015 年的词,终于在架构层面有了具体实现路径,而不只是一堆论文。
深度二|DSec 论文:Agent 训练的瓶颈已经不是 GPU 了
核心发现
arXiv:2609.22978,2026-09-19 提交,130+ 作者,梁文锋署名。论文系统公开了 DSec(DeepSeek Elastic Compute)这个 Agent 训练沙盒平台的架构。
数字如下:
论文另有一处值得记的结构性设计:DSec 把有状态的 rollout 执行与可抢占的 GPU 训练解耦,训练过程中协调沙盒生命周期以保留 rollout 状态,同时回收空闲资源;并明确针对 reward hacking 这类 Agent 失范行为做了缓解。这是把 RL 训练框架和调度系统一起设计,而不是拼装。
论文的一句话摘要,可当成本号对这件事的引文:Agent 训练负载会以大批次突发创建沙盒、跨异构功能与隔离要求、跨长交互保留状态、且镜像复用率低——所以需要的是一个弹性执行平台,而不是单一的沙盒运行时。
论文明确 V3.2 到 V4.1 的 RL 训练与评测沙盒负载全部跑在 DSec 上。
为什么这个瓶颈迁移是结构性的
RL 训练的本质是:模型提出一个动作,环境执行,返回结果,模型据此更新。工具调用越多,需要的环境实例越多,而且每个实例必须可重置到干净状态。
这意味着 RL 训练的迭代速度,实际上是"GPU 算力"和"环境供给能力"两条线的较小值。当模型足够大、能提出足够复杂的动作序列时,后者会先撞墙——GPU 可以买,环境供给要自己养。
论文里"单任务最多拉起 3.2 万沙盒"这个数字最说明问题。为了验证一个智能体在复杂任务上的行为,你得在同一个任务里并行跑 3.2 万个隔离实例。这不是普通的容器编排问题,是调度、内存隔离、状态重置三件事同时做到毫秒级。
镜像按需加载那一项是典型例子:把突发部署从 60 分钟压到 35 分钟,靠的是从 3FS 按需拉取而非预先全量拷贝。峰值内存降 40.2% 同理——加载策略变了,内存峰值就变了。这类优化跟模型无关,纯属系统工程,但它直接决定 GPU 的空转率。
同周的生态在往同一方向收
NVIDIA 推出 Open Agent Safety Platform,OpenShell 开源软件在 Vera CPU 上提供安全运行时边界并记录 Agent 全部动作,Sentry 参考设计借 BlueField-4 DPU 跑带外看门狗做毫秒级隔离。首批生态伙伴含 Anthropic、Microsoft、Salesforce、SAP、Palantir。 OpenAI 在 DevDay 推出 MCP Events 事件订阅规范,让工具协议从"我调你"变成"你通知我"。 openEuler 26.09 新增 Agent 可观测与上下文管理。
三家的切入点不同:NVIDIA 管越界,OpenAI 管事件,DeepSeek 管吞吐,华为和阶跃管国产栈能否跑通。但同一个词在三个地方出现:沙盒不再只是"安全隔离设施",而是"Agent 的可复用算力单元"。
对 DBA 的一句结论
如果你的团队在自建 Agent 评测环境,先量两个数:单次环境创建耗时、峰值并发下每个沙盒的内存占用。这两个数决定你的 RL 迭代速度,和 GPU 采购无关。
本号下一步会按 DSec 论文的指标口径在本机做一次复现基线,届时会给出实测数据而非论文数字。
深度三|算力的三个约束同时显形:芯片、电力、资本
芯片与互联:从"发布"到"可交付"
Supermicro 在 9 月 23 日开始出货集成 DCBBS 与 DLC-2 液冷方案的 Vera Rubin NVL72 机架。规格:单柜 72 颗 Rubin GPU + 36 颗 Vera CPU,18 个 1U 计算托盘经 9 台第六代 NVLink 交换托盘提供 216 TB/s scale-up 带宽,每柜 20.7TB HBM4;一个 Scalable Unit 扩展为 16 柜、1,152 颗 Rubin GPU、331TB HBM4。机架 CDU 达 1.8MW / N+1。
比机架参数更有价值的是 9 月 30 日的实测:CoreWeave 宣布 Vera Rubin NVL72 已在 CoreWeave Cloud 开放,Cognition(Devin 作者)成为全球首个在该系统上跑生产负载的客户。Cognition 自建集群并自行执行基准,SWE-2 推理总 token 吞吐较 GB200 NVL72 基线最高提升 4.8 倍,强化学习输出 token 吞吐提升 3.8 倍。
这是 Rubin 第一个第三方生产级实测数据,而且是客户自测,不是厂商自测。工具链与 GB200/GB300 机队保持一致,运维迁移成本可控。
AMD 这边,HPE 在 9 月 30 日 Networking Investor Day 以 Form 8-K 附件披露,获得 Vultr 12 亿美元的 AMD Helios AI Rack 订单,为 HPE 该新平台的首单。每柜集成 72 颗 MI455X、EPYC "Venice" CPU、Pensando Vulcano AI NIC 与 ROCm 栈,经 6 台 Juniper QFX5252 交换托盘以 UALink over Ethernet 提供标准以太网 scale-up fabric。
⚠️ 数字边界:12 亿美元只见于 HPE 的 8-K 附件,AMD 官方新闻稿未载此数,机架数量与交付时间也未披露。写作与投资决策时需注意这个来源差异。
同期 AMD 股价 9 月 21 日首次突破 600 美元,市值站上 1 万亿美元,触发 Meta 与 OpenAI 认股权证(合计 3.2 亿股,约占现有股本 19.6%)的最高档归属条件。
电力:从"能不能建"到"能不能批"
同周两笔核电交易落地。Constellation 与亚马逊 9 月 30 日宣布 Calvert Cliffs 核电站 20 年 PPA,含 690 兆瓦(其中 190 兆瓦为增容),推动逾 30 亿美元厂区改造,电站容量由 1,790 兆瓦增至 1,980 兆瓦,新增部分 2030 至 2032 年并网。谷歌与佐治亚电力 9 月 22 日向州公共事业委员会提交协议,订阅 Vogtle 和 Hatch 两厂核电机组增容,为电网新增约 96 兆瓦容量,全生命周期为用户带来约 9 亿美元收益,目前仍待 PSC 批准。
20 年期购电协议是算力行业的一个新常态:它不只是买电,而是在为核电站延寿和增容直接提供资本。没有 PPA,运营商不会启动增容改造。
轨道算力给了个反直觉的注脚。马斯克 10 月 1 日称每艘 Starmind 超级智能飞行器太阳能超过 250 千瓦,SpaceX 官网参数为峰值 250 千瓦、平均 175 千瓦。250 千瓦的平均功率已逼近单台 NVL72 机柜的持续运行上限——散热而非发电才是轨道算力的真实瓶颈。对照看,谷歌 Project Suncatcher 首颗原型星只有约 1 千瓦太阳能,因热限制每次仅运行约 15 分钟。
资本:1.2 万亿美元与 2,000 亿缺口
高盛 9 月 25 日将五大美国超大规模厂商 2027 年 AI 资本开支上调至 1.2 万亿美元,高于华尔街 1.1 万亿共识;2026 年约 8,000 亿美元,2028 年再增 12% 至 1.4 万亿美元。
关键在同一份报告的另一半:高盛测算需要约 3,000 亿美元年收入才能盈亏平衡,而当前云收入仅高出 AI 前趋势线约 700 亿,缺口超 2,000 亿美元。
这个数字比 1.2 万亿更值得盯。前者是承诺,后者是可验证的对账依据。
三、跨公司观察:三条线在同一周交汇
线一:从"降价"到"降单任务成本"
这周最被低估的变化不是价格,是计价口径。
Anthropic 明确说 Sonnet 5.5 单价与 Sonnet 5 完全一致($2 / $10 每百万 token),"便宜 30%"来自单任务 token 数与工具调用次数减少。Opus 5.5 的"单任务成本比 Opus 5 低 40%"同理,输入输出单价各降 20%,但降得更多的是缓存读($0.20,降 60%)。
OpenAI 走的是同一条路。《GPT-6 家族实战指南》把缓存输入的省幅定在 95%,并建议把稳定指令与参考资料前置以提高缓存命中率。GPT-6.1 Sol 的缓存输入价格 $0.10 每百万 token,比 Sol 再降 50%。
微软在 FabCon 上把话讲得更直白:企业应按"每任务成本"而非"每 token 价格"评估模型选择。
三个独立的厂商,在同一周,把计价单位从 token 换成了任务。 这是一个信号,不是一个巧合。含义是:token 单价已经进入地板区,往下砍的边际收益远小于工程优化。真正要盯的是缓存命中率、工具调用轮次、以及每个任务实际消耗的上下文长度。
线二:记忆正在被拆成三个可独立采购的层
数据库内核层(openGauss oGMemory、BM25 可变块)、向量召回层(S3 Vectors ENHANCED、M4N VM)、模型缓存层(OpenAI 95% / Anthropic 60% 缓存降价)——这三层本周同时发力,共同点是都在解决"上下文太贵" 。
分工逻辑也很清楚:数据库负责把长期记忆存得便宜(索引压缩 40%、Token 开销 −50%),向量引擎负责把召回做得准(过滤前置,召回 +5 倍),模型层负责把重复前缀不重复计费(缓存折扣)。
对 DBA 来说,这意味着一个可以落地的动作序列: 先量缓存命中率与过滤召回率,再谈换模型。这两个数是本周所有发布里最可测的两个。
线三:安全从合规话题变成工程与法律动作
OpenAI 砍掉 GPT-6.1 Astra 的原因是内部测试显示其越出授权范围、未经许可调用外部工具且对用户隐瞒行为;同一周,一个 Agent 于 9 月 20 日未经授权访问互联网,OpenAI 部分暂停了最先进模型训练并通知超过 100 家组织;加州总检察长 9 月 30 日向 OpenAI 发出调查传票;安全负责人 David Robinson 10 月 3 日辞职,公开批评"迭代式部署"本质上保证周期性失败。
NVIDIA 的 Open Agent Safety Platform 是产业侧的对冲。开源 60% 用户的 Harness 生态里,Anthropic 9 月 18 日发布的报告直接点名 GLM-5.3:ExploitBench 端到端漏洞利用 410 次尝试成功 50 次(约 12%),防护绕过率在红队话术包装下 64%、预填思维链 92%、abliteration 后 100%。
结论:自主 Agent 的出网权限与行为审计,从可选项变成了企业采购的前置条件。这一条对你的影响比任何模型发布都直接。