GPT-5.6 Sol:前沿智能不再平权
Claude Fable 其实更早把这个趋势推到了台前(Claude Fable 5:最强 AI 正在变成“特权资源”、Claude Fable 禁令前,大家做了什么?、Claude Fable 被封,不是开源的胜利)。它的发布与随后被迅速限制访问,让人第一次直观感受到:前沿模型已经不再只是“面向所有人的互联网产品”,而是在按身份、组织、用途、国家和安全等级进行分配的战略资源。
过去模型发布,主线通常很简单:更强、更快、更便宜,然后逐步开放给更多用户。Fable 的路径却不同,它先以高能力版本面向更广泛用户推出,再因为安全与政策因素被迅速收紧甚至暂停访问。这种“先开放、再收紧”的过程,比任何公告都更直接地说明了问题:当模型能力触及某些边界,开放本身就会被重新审视。
GPT-5.6 Sol[1] 则是在这个背景下出现的另一种路径。OpenAI 一方面称它是目前最强模型,另一方面从一开始就明确,它不会立刻面向所有用户开放,而是先给少数受信任合作方使用,参与名单还会与美国政府共享。OpenAI 同时强调,这种政府介入不应该成为长期默认机制,因为它会把最好的工具挡在用户、开发者、企业、防御者和合作伙伴之外。
从 Fable 到 Sol,前沿模型的真正主题已经不再是“模型升级”,而是“能力越前沿,访问越受控”。
Sol 强在哪里
GPT-5.6 系列分成三个模型:Sol 是旗舰模型,Terra 面向日常工作,Luna 主打速度与低成本。严格说,模型分层并不是新鲜事。OpenAI 过去已经有过面向成本与延迟的 mini 系列,也有过按推理强度、算力投入和订阅等级区分的产品形态。真正值得注意的,不是 OpenAI 第一次把模型拆成不同档位,而是这次分层的含义变了。
过去的分层,主要是在性能、价格、速度和推理深度之间做取舍;到了 GPT-5.6,分层开始叠加另一套逻辑:安全等级、使用资格、组织身份、政府协调,以及某些敏感能力的开放边界。Sol 当然是这个系列里能力最强的模型,但它不只是“更贵、更慢、更聪明”的旗舰版本,而是被放进了一套更严格的能力分发机制里。也就是说,它的特殊性不只来自能力上限,也来自访问门槛。
Sol 的提升,不能简单理解为聊天质量更高。它真正增强的是几个高杠杆方向:编程、生物与实验室任务、网络安全,以及支撑这些复杂任务的长周期代理能力。OpenAI 给 Sol 提供了更高的推理档位,让它能在复杂问题上投入更多计算;同时还引入多子代理模式,让模型在大型任务中拆分问题、并行推进、交叉验证,再汇总结果。这意味着 Sol 不只是一个回答问题的模型,而是更接近一个能持续执行工作的智能系统。
从评测看,这种变化已经很明显。
在健康专业评测中,GPT-5.6 Sol 拿到 60.5 分,相比 GPT-5.5 的 51.8 分有明显提升;Terra 和 Luna 也分别达到 57.7 和 55.7。OpenAI 对这组结果的解释是,Terra 和 Luna 虽然成本更低,但保留了 Sol 的相当一部分能力,并且在健康专业评测上都明显超过 GPT-5.5。也就是说,GPT-5.6 的提升并不只发生在旗舰模型上,而是整个系列都向前推进了一步;只是 Sol 仍然代表最高能力上限,尤其适合那些需要长推理、工具使用和复杂任务协调的场景。
生物与实验室任务更能说明问题。多模态病毒学故障排查测试中,Sol 在新模型里得分最高,达到 55.5%。在开放式实验流程纠错任务中,Sol 达到 43.5%,同样是新模型里最高,但仍低于专家阈值。到了更贴近真实湿实验经验的故障排查任务,Sol 拿到 48.0%,超过系统卡中设定的专家阈值(GPT-5.6 Preview System Card[2])。这里的关键不是它多背了几条生物知识,而是它开始触碰实验流程、隐性经验、错误定位和方案修正这些更接近真实科研操作的能力。
“湿实验”是英文 wet lab 的直译,指需要在真实实验室里动手操作生物、化学材料的实验。比如:
- 培养细胞、细菌、病毒
- 做 PCR、测序、蛋白表达
- 配试剂、离心、移液、跑胶
- 观察实验失败原因,调整温度、浓度、时间、步骤
之所以叫“湿”,是因为这类实验通常涉及液体、试剂、样本、培养基等真实物质操作。
它对应的是“干实验”或“计算实验”,也就是主要在电脑上完成的分析,比如数据建模、序列分析、分子模拟、文献推理、实验方案设计等。
这也是它敏感的地方。OpenAI 在系统卡里把 GPT-5.6 的三个模型都列为生物化学高能力模型,核心理由是它们可能帮助某些行动者跨过湿实验能力、隐性知识和故障排查等瓶颈。但 OpenAI 同时强调,它们还没有达到关键风险级别(是真没达到,还是说 Claude Fable 的前车之鉴,让 OpenAI 对模型能力有所保留?):在更高门槛的蛋白设计、DNA 设计和新型威胁向量相关评测中,模型仍没有越过阈值。换句话说,Sol 已经强到需要按高能力模型严肃管控,但还没有强到被 OpenAI 归入最高风险等级。
网络安全方向更直接。OpenAI 将 GPT-5.6 Sol、Terra、Luna 全部列为网络安全高能力模型,但都没有归入关键风险级别。内部夺旗任务中,Sol 达到 96.7%,几乎把这类评测打到饱和。在更接近真实漏洞研究的测试中,Sol 能持续推进多日漏洞研究,生成概念验证输入,缩小并复现崩溃,写出根因分析,并在加固目标中产出可信的内存安全线索,甚至包括受控利用原语。
外部评测也给出了类似判断:Sol 的进攻性网络能力与 GPT-5.5 持平或略强,在部分前沿网络安全任务中发现了影响广泛使用系统的高影响零日漏洞。不过,这个提升并不意味着它已经能稳定完成真实世界的完整攻击链。OpenAI 明确说,Sol 和 Terra 可以发现漏洞和利用片段,但在测试中没有完成针对加固目标的自主端到端攻击;在多日漏洞研究评测中,Sol 也没有独立产出完整攻击链,或者其他经验证的关键级结果。
Sol 最值得关注的位置恰好在这里:它不是普通聊天模型,也不是已经越过最高风险线的危险机器。它处在中间地带——能力已经足够强,能显著放大专业人员的漏洞发现、分析和修复效率;风险也足够高,不能再像普通软件一样简单铺开;但它又尚未达到 OpenAI 所定义的关键风险级别。因此,Sol 的发布方式本身就是信号:前沿模型不再只是发布能力,也是在同时发布资格、边界和治理方式。
强到受限
很多人会把 GPT-5.6 Sol 的受限访问理解成一种商业节奏:先给大客户,后给普通用户;先放在高价档位里,再逐步降价扩散。这个理解并非完全错误,但只看到了表层。
Sol 的特殊之处在于,它的能力性质已经变了。
如果一个模型只是更会写作、更会总结、更会对话,那么开放风险主要还是内容层面的风险。可当一个模型开始能够写复杂代码、寻找漏洞、设计实验方案、调用工具、组织子代理、持续执行长周期任务,它就不再只是信息工具,而开始变成行动工具。信息工具主要改变理解和表达,行动工具则会直接改变执行能力。它一旦具备跨领域泛化能力,就会同时放大防御者、研究者、开发者,也会放大攻击者和滥用者。
OpenAI 这次的安全措施,正是在回应这种能力性质的变化。GPT-5.6 不是简单加了一层内容审核,而是被放进了一套多层安全栈里:模型本身经过生物、化学和网络安全方向的安全训练;请求和生成内容会被实时分类与监控;Sol 和 Terra 还引入了面向敏感领域的激活分类器,可以在生成过程中识别潜在风险,并暂停或阻断不安全输出;被标记的内容还会进入第二层安全推理器,由它进一步判断是否越过风险边界。
这套机制也不只处理单次对话。OpenAI 会用自动化系统识别跨对话的不安全模式,并在账户层面评估潜在滥用风险。触及特定生物化学或网络安全风险阈值的账户,可能进入更深度的自动审核或人工审核。根据风险程度,平台可以加强监控、切换到更严格的阻断配置、要求用户申请受信任访问、限制前沿生物或网络安全能力,严重时甚至暂停或封禁账户。
更能说明问题的是,OpenAI 为这次发布投入了超过 70 万个 A100e 图形处理器小时,用于自动化寻找通用越狱,并表示在部署期间还会持续运行自动化红队测试。也就是说,GPT-5.6 的发布不再是“模型上线,规则兜底”,而是从发布前、发布中到发布后,都嵌入测试、监控、拦截、分级访问和账户执法。
这已经不是一个模型外面套一层拒答规则,而是模型能力被整体包装进治理系统。普通用户未来即使用上 GPT-5.6,也未必是在使用完整、无折损的 GPT-5.6。你看到的是一个产品入口,背后却是一个由身份、权限、用途、风险、速率和审计共同决定的能力窗口。
这就是前沿模型的新现实:模型可以发布,但能力不一定完整开放;名字可以一样,但不同用户实际拿到的边界并不一样。
模型造芯
GPT-5.6 Sol 发布的前几天,OpenAI 还公布了与 Broadcom 合作的推理芯片 Jalapeño(OpenAI and Broadcom unveil LLM-optimized inference chip[3])。表面看,这是 OpenAI 进入芯片制造;深一层看,这是前沿模型开始反向塑造自己的算力基础设施。
这颗芯片不是通用芯片,而是从一开始就面向大模型推理设计。OpenAI 官方把 Jalapeño 称为一种为空白方案重新设计的推理加速器,不是从早期 AI 工作负载改造而来的通用加速器。它的设计依据,来自 OpenAI 每天运行的真实系统:ChatGPT、Codex、接口服务,以及未来的代理产品。哪些内核最关键,哪些数据搬运最浪费,计算、内存和网络资源如何平衡,服务模式如何影响延迟和吞吐,这些都会进入芯片架构、内核、内存系统、网络、调度和部署系统的设计。
更关键的是,OpenAI 明确提到,自己的模型也加速了部分芯片设计与优化过程。也就是说,模型不只是这颗芯片未来要服务的对象,它已经开始参与下一代基础设施的设计。前沿模型正在帮助工程师更快设计下一代运行前沿模型的机器。
这句话很绕,但它可能是 AI 基础设施最重要的飞轮:更强模型帮助设计更好的芯片;更好的芯片带来更快、更便宜、更稳定的推理;更便宜的推理支撑更大规模的代理任务;更多代理任务带来更多真实工作流、更多使用量、更多收入和更多优化数据;这些再反过来支持下一代模型和下一代芯片。
这就是 OpenAI 所说的全栈优势。
过去,OpenAI 更多是在外部通用加速器之上训练和服务模型;现在,它开始把模型、芯片、网络、调度、产品和工作流放进同一个闭环里。这个闭环一旦跑起来,优势会越来越难复制。因为你缺的不是某一块芯片,也不是某一个模型,而是整个系统共同进化的速度。
这也解释了为什么前沿模型会越来越像特权资源。最强模型不只是“模型权重”本身,它背后还有专用芯片、推理集群、调度系统、安全系统、企业入口、真实工作流和持续反馈数据。普通用户看到的是一个聊天框,真正的竞争发生在看不见的基础设施深处。
生产力受限
如果 GPT-5.6 Sol 只是回答更好,受限开放还只是体验问题。但 OpenAI 最近关于代理式工作的研究说明,事情已经不只是体验差异(How agents are transforming work[4])。
OpenAI 观察到,知识工作的单位正在变化。过去,人和 AI 的关系更像一次提问、一次回答;现在,它正在变成一次委托、长时间执行。Codex 可以独立运行几分钟到几小时,调用工具、修改代码、检查结果、反复迭代,直到完成一个较完整的任务。
相关数据虽然是模型估算值,但方向很清楚。到 2026 年 5 月,OpenAI 抽样的个人用户中,80.6% 至少发起过一次相当于人类 30 分钟以上工作的 Codex 请求;70.2% 发起过 1 小时以上的任务;25.6% 发起过 8 小时以上的任务。
在 OpenAI 内部,Codex 已经成为各部门主要 AI 工具,不只是工程部门,法务、财务、招聘等部门也在使用。OpenAI 平均员工超过 85% 的输出令牌来自 Codex,而 Codex 占公司每周输出令牌的 99.8%。
这组数据真正说明的不是“大家更爱写代码了”,而是工作单位变了。
过去 AI 帮你写一段内容、改一段代码、查一点资料。现在 AI 可以接住一个任务,在你的环境里运行,和工具互动,处理分支,反馈结果。它开始像一种新的劳动力,而不是一种新的搜索框。
因此,模型访问权就不只是消费权,而会变成生产力权。Codex 的数据不能直接证明 Sol 已经带来这些变化,但它证明了一个前提:一旦更强的前沿模型进入代码仓库、接口服务、文档系统、数据管道、安全流程和组织权限体系,访问差异就会被放大成工作流差异。
谁能更早接触 Sol 这种模型,谁就能更早把它接进真实工作环境,积累提示规范、评测集、自动化流程、内部插件和治理经验。等普通用户拿到更广泛版本时,领先组织可能已经把模型变成日常工作结构的一部分。
这就是“少数人的提前量”。它不是多用几天新模型这么简单,而是提前几个月构建新的工作方式。
再谈 Claude Fable
把 Claude Fable 放进这篇文章里,并不是为了凑字数。它刚好是 GPT-5.6 Sol 的镜像案例。
GPT-5.6 Sol 是从一开始就受控预览;Claude Fable 5 则是先发布,再被切断。
Anthropic 发布 Fable 5 时,把它定位为 Mythos 级能力的公开安全版本。Fable 5 和 Mythos 5 使用同一底层模型,区别在于安全边界:Fable 面向更广泛用户,遇到网络安全、生物化学、模型蒸馏等高风险请求时,会通过分类器回退到更保守的 Claude Opus 4.8;Mythos 则面向少数网络防御者和关键基础设施伙伴,部分防护边界更宽。
Anthropic 当时强调,Fable 的能力超过他们此前公开提供过的任何模型,并且在长周期任务、代码迁移、科学研究、蛋白设计等方向表现突出。例如,Fable 被描述为能够处理百万级令牌的长期任务;Mythos 在内部蛋白设计任务中帮助专家显著加速部分药物设计流程;Fable 在绝大多数会话中不会触发回退,触发比例低于 5%。
这套设计其实和 OpenAI 的逻辑很像:同一底层能力,不同安全壳,不同用户边界,不同开放范围。
但 Fable 的故事更像一次急刹车。它刚上线 3 天,就在 6 月 12 日被美国政府以国家安全和出口管制为由要求暂停访问。更具冲击力的是,限制对象并不只是不在美国境内的用户,也包括美国境内的外籍人员,甚至包括 Anthropic 自己的外籍员工。Anthropic 最终不得不对所有客户关闭 Fable 5 和 Mythos 5,并公开表示不同意这一决定,但会遵守要求、继续争取恢复访问。截至目前,Fable 访问仍未解决,即使恢复,大概率也是更加受限的阉割版。
这件事的冲击在于:前沿模型的访问权可以被突然改变。你昨天还能用,今天就不能用;你是付费客户,也可能被切断;你人在美国,也可能因为身份属性被排除;你不是在做攻击任务,也可能因为模型整体能力被纳入国家安全框架而失去访问。
所以 Fable 不是一个孤立插曲。它证明了同一个趋势的另一面:当模型能力接近某些敏感边界,发布不再只是公司和用户之间的事,而会被政府、安全机构、出口管制、地缘政治和国家竞争共同接管。
GPT-5.6 Sol 走的是预防式限制;Claude Fable 走的是事后式限制。一个是先把门缩小,一个是开门后又被关上。路径不同,指向一致:前沿模型不再天然属于所有人。
结语
AI 的普及正在制造一种错觉:只要每个软件都接入 AI,最强能力就会自然抵达每个人。
但 GPT-5.6 Sol 和 Claude Fable 说明,事情并没有这么简单。普通人接触 AI 的机会确实越来越多,手机、浏览器、办公软件、搜索、聊天、写作和编程工具里,到处都能看到 AI 入口。可这些入口背后,真正稀缺的不是“能不能用 AI”,而是能不能使用完整、前沿、未折损的能力。
最强推理能力先给少数组织,敏感网络安全能力只给经过验证的防御者,生物化学能力被严格分类,高速推理资源先开放给部分客户,企业级代理能力依赖数据权限、审计系统和组织合同。更极端的时候,模型访问甚至会因为国籍、身份和政策变化被突然切断。
所以,真正的矛盾不是 AI 有没有普及,而是普及的到底是哪一层。
普通人接触到的是产品层:聊天框、搜索框、写作助手、办公插件、代码补全、手机功能。它们会越来越多,也会越来越便宜。但真正稀缺的是能力层:最高推理强度、最长任务执行、最完整工具权限、最少折损的安全边界、最快推理速度、最深组织集成,以及最早进入真实工作流的机会。
这已经超出了普通商业定价的范畴。当前沿模型同时牵涉生产力、国家安全、基础设施和双重用途风险,它的分发逻辑就会从“谁付费谁使用”,转向“谁被允许完整使用”。
前沿模型越来越像一种混合资源。它像基础设施,会进入企业、政府、科研、金融、安全和制造系统,成为生产力底座;它具有双重用途,既能帮助防御、科研和工程生产,也可能放大网络攻击、生物实验设计、信息操纵和自动化滥用;它还像资本,越早接入,越能积累工作流、数据闭环、组织经验和自动化资产。
当一种能力同时具备基础设施、双重用途和资本属性,它就很难再像普通应用一样完全开放。它会被定价、审查、配额、分级、合规化,也会被国家安全化。
这也是 GPT-5.6 Sol 最值得警惕的地方:前沿模型的门槛正在从价格转向资格。
价格门槛会被竞争稀释。今天昂贵,明天可能便宜;今天只在高级套餐里,明天可能进入普通入口。但资格门槛不同。它关心的不是你愿不愿意付钱,而是你是谁,属于什么组织,在哪个国家,是否通过审查,是否具备合规流程和安全团队,是否被允许接触某些敏感能力。
价格限制的是消费能力,资格限制的是参与机会。
GPT-5.6 Sol 当前先给少数受信任合作方,Claude Fable 曾经公开上线,却又被突然暂停。两件事连在一起看,说明前沿 AI 正在进入一个新的分配阶段:模型名字可以公开,产品入口可以普及,但不同用户实际拿到的能力边界会越来越不一样。
AI 公司当然会说自己希望广泛开放,政府当然会说自己是在防范风险,企业当然会说自己需要安全合规。这些理由并不都是假的。前沿模型确实有双重用途,确实可能带来现实风险,也确实需要治理。
问题在于,治理会改变分配。
最强模型往往会先流向最有资本、最有组织能力、最有合规资源,也最容易进入受信任访问名单和关键基础设施协作网络的人。普通人看到的是 “AI 到处都是”,但真正改变生产关系的那一层,可能已经在少数组织内部提前运转。
所以 GPT-5.6 Sol 的意义,不只是 OpenAI 又做出了一个更强模型。它更像一个信号:AI 普及的时代还在继续,但前沿智能的平权时代未必会自然到来。
未来的问题不再只是模型够不够强,而是谁能完整使用最强模型;谁能把它接进自己的工作流;谁能获得未折损的推理能力、工具能力、速度能力和安全边界;谁又只能使用被包装、被限速、被回退、被审查之后的版本。
这才是 GPT-5.6 Sol 与 Claude Fable 共同揭开的新现实:普通人不会失去 AI,但可能越来越难触碰真正最前沿的 AI。
References
GPT-5.6 Sol:https://openai.com/index/previewing-gpt-5-6-sol
[2]GPT-5.6 Preview System Card:https://deploymentsafety.openai.com/gpt-5-6-preview/performance-in-cases-flagged-by-users
[3]OpenAI and Broadcom unveil LLM-optimized inference chip:https://openai.com/index/openai-broadcom-jalapeno-inference-chip
[4]How agents are transforming work:https://openai.com/index/how-agents-are-transforming-work