OpenAI 强推 GPT-5 引发众怒,它真如此不堪?
OpenAI 做了个看似很“傻 X“ 的决定,在 ChatGPT 上屏蔽了模型选择入口(Pro 除外),此举在网上引起了不小风波。
gpt-4o 是继 gpt-3.5、gpt-4 之后的又一现象级经典模型,之前的吉卜力风格可谓火爆全网(实测 GPT-4o 吉卜力漫画风)。一夜之间从 ChatGPT 模型选择器上消失,让很多人无法接受(关于 GPT-5,你需要知道的一些事)。这是 OpenAI 战略发展层面的决定,我们也不好说啥,但没想到打脸来得如此之快(又要把 4o 加回来了,知错能改都有点不像认识中的那个 OpenAI 了)。但在“强买强卖”的背后,或许还有别的因素。我今天特地去查了一下 gpt-4o 和 gpt-5 的模型价格,看完后,我似乎有点“懂了”...
理论上,模型肯定是朝成本、性能更优的方向进化(后面也被 OpenAI 自己证实,确实因为产品 bug 导致 gpt-5 结果飘忽不定)。gpt-4o token 输入价格是 gpt-5 的两倍,缓存价格更是接近 10 倍。面对如此差距,如果是你,会如何选择?
官方声明
以下是从 OpenAI 文档中整理出来的最新信息,也扒到了一些有趣的东西(原文:GPT-5 in ChatGPT[1])。
GPT-5 正在全球范围内向 ChatGPT Plus、Pro 和 Team 用户逐步推出,Enterprise 和 Edu 计划也将很快上线。如果你的账号暂未看到 GPT-5,官方建议耐心等待。作为新一代旗舰模型,GPT-5 成为所有已登录用户的默认选择,将以往多个最佳模型整合为一个智能、快速的自动切换系统,并在需要时进行深度推理。它在编程、科学问题、信息整合、数据和财务分析等复杂任务中具备更强的思考能力,在写作、代码生成以及医疗等日常应用场景中表现同样出色,响应更快且准确度更高。
当你在 ChatGPT 中选择 GPT-5,系统会自动判断是使用聊天模式还是推理模式。遇到复杂任务时会切换到 GPT-5 Thinking 进行更深入的分析。推理模式下会显示精简的推理过程,并提供“快速回答”选项,便于即时切回聊天模式获得结果。判断切换的依据包括提示词内容、对话上下文、用户以往偏好以及模型正确率等。
模型选择彻底黑盒化,在可以自由选择模型时,遇到垃圾输出起码明确知道是降智。这一改,可真“棒”!直接让“降智、降级”傻傻分不清楚!
注:在本文的“拓展阅读/完整细节”部分,OpenAI 表示会让系统更常把请求分配到合适的模型,同时增强“当前答复具体由哪个模型生成”的可见性。一定程度上可以缓解模型自动分配的黑盒体验,但降智似乎才是最大问题吧...
不同订阅层级对 GPT-5 的使用限制各异。免费版用户每 5 小时可发送 10 条 GPT-5 消息,之后切换到 mini 版,每天有 1 条 GPT-5 Thinking 机会。Plus 用户每 3 小时可用 160 条 GPT-5 消息(临时提升额度,之前是 80 条),并可每周手动使用 200 条 GPT-5 Thinking。Team 和 Pro 用户可无限制使用 GPT-5,并享有 GPT-5 Thinking Pro,适合高精度任务。自动从 GPT-5 切换至 GPT-5 Thinking 的使用量不计入手动限额。
这里我小小的做一个猜测,因为在文档中从始至终未提及 gpt-5-nano 模型,只说在不同层级额度用完后最终会降级至 mini 模型,但从 OpenAI 公布的模型数据来看,nano 模型价格更低,效果可能也“说的过去”,没有理由不用(以 OpenAI 都能想出降智的奇招来说)。Gemini 都支持百万上下文了,GPT-5 最大输出 Token 只有 128k,感觉有点不够看...
官方文档中明确表示:gpt-5-nano 适合高吞吐量任务,特别是简单的指令跟踪或分类。
为防止滥用,平台禁止批量抓取数据、共享账号或转售服务,违规可能导致限制或封禁。GPT-5 支持 ChatGPT 的全部功能和工具,包括网页搜索、数据与图像分析、文件处理、Canvas、图像生成、记忆功能以及自定义指令。
GPT-5 上线后,旧版本模型(如 GPT-4o、GPT-4.1、GPT-4.5、o3、o3-pro 等)将被淘汰,对应会话会自动切换到最接近的 GPT-5 版本。例如,o3 会切换至 GPT-5 Thinking,o3-pro 会切换至 GPT-5 Pro。Plus 和免费用户立即生效,Pro、Team、Enterprise 用户可在设置中开启“显示旧模型”以访问遗留版本。以下是当前新模型与旧模型的对应关系:
Pro 用户可按照以下方式开启旧模型选择(听官方消息,4o 估计很快也会出现在 Plus 中了):
Sam 回应
Sam 发帖表示,团队在推广 GPT-5 的过程中意识到,他们低估了 GPT-4o 某些特性对用户的重要性,即使 GPT-5 在大多数方面表现更好。用户对于 GPT-4o 和 GPT-5(仅指聊天模型,不含高级推理版)的优劣评价差异明显,这进一步强化了团队对“提供更高个性化能力”的重视。未来,他们希望在可控性(steerability)和个性化方向投入更多,让用户可以调整对话风格,例如表情符号的使用、逻辑冷静程度以及情感温度等。不过,高质量的深度个性化仍需更长时间研发。
目前,GPT-5 已经覆盖 100% 的 Pro 用户,并接近全量覆盖所有用户。接下来,团队会先完成全面推广并稳定系统,然后针对 GPT-5 做一些“加温”调整,让其在对话中更具亲和力。同时,Plus 用户的 GPT-5 消息额度将翻倍,并可选择继续使用 GPT-4o,官方会根据使用情况决定旧模型保留时间。
Sam 还提到,昨天自动切换器一度故障,导致 GPT-5 显得“变笨”,但今天起系统已修复,并调整了模型切换的决策边界,提高为用户自动选对模型的准确率。未来会让“当前是哪种模型回答”更加透明,并优化界面,让用户更容易手动触发推理模式。
大规模推广进度比预期稍慢,原因是这次变动规模巨大,例如过去 24 小时 API 流量几乎翻倍。团队正在全力优化系统、提升算力,应对下周可能出现的严重容量挑战,并承诺在取舍上保持透明。Sam 坦言,这次一次性上线了许多新变化,本就预料会有波动,但实际的颠簸比预想更多。不过,他们会持续快速响应、倾听反馈并不断改进。
gptblindvoting[2](这个网站是基于 v0[3] 构建的,所以 vibe coding 的价值就在于快速进行原型搭建)。感兴趣的朋友可以试试,从评论区大家的测试来看,大部分用户更倾向于选择 gpt-5 的回答。
我自己做了 20 题,结果显示有 17 道都是选择 gpt-5。如果 gpt-5 回答让你感觉不适,可能是因为长期使用 4o 造成了某种模型依赖。产生单一模型依赖在我看来并不是好事,会让你失去事物判断的客观性。建议多用用其他大模型来抵消这种依赖,比如 claude、gemini 都是不错选择,进行多模型结果比较也不容易让自己陷入模型偏见。
GPT-5 Prompt 分享
官方还贴心的准备了 GPT-5 Coding Examples[4] 仓库,用来收录一系列完全由单个 GPT-5 提示生成、无需手写任何代码的示例应用。精选示例主要是用来展示模型在编程方面的优势,研究它们能为你构建自己的创意项目带来灵感(主要是关注其中的 prompts)。
gpt-5-coding-examples/
├─ examples/ # 💡 示例提示词,重点关注这里!
├─ front-end/ # 运行代码示例
└─ ...
我将 gpt-5-coding-example/examples 中的所有 prompt 都提取出来,让 GPT-5 分析了一下,总结出以下经验:
- 先定“产物契约”再谈功能:明确产物类型、文件名/入口、技术栈边界(允许/禁止)、外部依赖、是否单文件、是否可联网。
- 把“目标”写成一句可验证的句子:如“在 30 秒内完成 10 题并显示正确率”,而不是“有趣、漂亮”。
- 需求分层(MUST/SHOULD/OPTIONAL):让模型更容易在 token 不足时做正确取舍。
- MUST:验收必查
- SHOULD:加分项
- OPTIONAL:时间够再做
- 例:滑块(速度) → 敌机刷新率变化 → 右上角显示当前值并淡入提示 1.2s 消失。
- 例:BPM 20–300,越界钳制并在控件下方显示轻量提示。
以下是一份 prompt 模板,可供参考:
【角色与目标】
你是{角色}。请完成:{一句话且可验证的目标}。
【产物契约】
- 输出:{单/多文件;文件名/入口;是否仅代码块}
- 技术栈:{允许清单};禁止:{外链/框架/API}
- 运行环境:{浏览器/Node/Next.js page.tsx 等}
【视觉与交互 Token】
- 主题/配色/字体/栅格/半径/阴影/动效(时长≤ms, 曲线…)
- 组件:{按钮/表格/卡片/对话框/工具提示…}
- 文案语气:{专业/活泼/科技感…}
【功能(MUST/SHOULD/OPTIONAL)】
MUST:
1) {控件} → {行为} → {可见反馈}
2) …
SHOULD:
- …
OPTIONAL:
- …
【数据与状态】
- 输入来源:{表单/URL Hash/文件上传}
- 默认样例/伪真数据:{条数/结构}
- 持久化/导出:{LocalStorage/JSON/PNG/WAV/ICS}
- 随机性:seed={数字};需可复现
【校验与错误处理】
- 约束范围:{…}
- 越界处理:{钳制/提示文案/回退}
- 空状态与加载占位:{Skeleton/占位图}
【无障碍与响应式】
- 键盘路径/焦点顺序/ARIA/对比度
- 触摸与鼠标并存;PRM 降级
- 断点:{移动/平板/桌面} 布局规则
【性能与质量】
- 资源懒加载/体积上限/帧率目标
- 不重叠不闪烁;CLS≈0
- 终端兼容:{Chromium/Firefox/Safari 最近两版}
【验收用例】
- 用例1:{步骤 → 预期}
- 用例2:{步骤 → 预期}
【输出限制】
严格要求:仅输出{文件内容/代码块};禁止{解释/外链/多文件}。
拓展阅读
完整细节
关于 GPT-5 更多细节,在 reddit 中有篇帖子详细总结了这两天发生的情况(原帖:GPT-5 AMA with OpenAI’s Sam Altman and some of the GPT-5 team[5])。
发布状况与技术修复
GPT-5 刚上线就遭遇多项技术问题:自动切换器(autoswitcher)有相当一段时间失效,直接拉低了外界对模型“聪明程度”的体感。团队已着手调整模型切换的决策边界,让系统更常把请求分配到合适的模型,同时增强“当前答复具体由哪个模型生成”的可见性(很重要,再也不是黑盒切换了,但降不降智就不好说了)。大规模推送在 24 小时内让 API 流量翻倍,数以亿计用户出现服务抖动;官方预期一两天内可恢复稳定,并在收尾阶段把 Plus 用户的 GPT-5 额度翻倍。此前模型路由还存在一个显性漏洞:部分编程请求没有被正确导向推理模型,导致不少人觉得 GPT-5 在编程上“不如以前”,直到手动触发推理模式或直接要求模型“认真思考”。至于发布会直播里出现的误导性柱状图,Sam 归因于人工失误(赶工疲劳所致);博客与系统卡中的数值是准确的。另需注意,当前自动切换器主要依据领域与任务复杂度决策,并不会先行联网检索——那样会显著增加时延。
用户可用性与模型选项
OpenAI 正面回应了“恢复 4o”的强烈呼声:Plus 用户将可继续使用 GPT-4o,长期支持与否会视实际使用数据而定。为弥补移除 mini 模型后整体推理产能的下降,团队在推出并渐进式发放 GPT-5-mini,目标是把先前 o3、o4-mini-high、o4-mini 所提供的总体推理使用上限“补回来”。官方强调,Plus 理应对 GPT-5 无额度上限;如果有人遇到限流,这被视为需要排查的“bug”。他们也在评估是否同时保留 4o 与 4.1,或者仅保留 4o 即可,并考虑在 $20 的 Plus 与 $200 的 Pro 之间引入中间价位层。界面层面会把“手动触发推理”做得更顺手,并研究允许通过自定义指令强制进入推理模式。
安全与内容过滤
团队正在修复生物安全领域的过度拦截问题:此前个别合法的基因治疗/生物工程学术研究被误判屏蔽。总体方针是在降低误判的同时,继续通过生命科学研究特别访问计划对已审核研究者施加必要的双用途风控。对于历史人物、艺术家等历史类主题被误标的问题,团队承认“区分教育性内容与有害内容”的难度,并已优化过滤逻辑以减少误伤。
编程能力与工具生态
Codex CLI[6] 已支持 GPT-5(面向付费 ChatGPT 方案)。限额策略上,Pro 用户几乎难以触顶;Plus 与 Team 用户可在一周内开展多次 1–2 小时的编码会话,且每 5 小时与每周都会进行限额重置。路线图方面,他们计划把 GitHub 直接并入常规 ChatGPT 对话,无需进入 Deep Research 或 Agent 模式。Canvas 编程体验将持续打磨,Codex 也有一次幅度较大的升级在路上。就能力看,GPT-5 的推理模式擅长处理复杂逻辑问题、执行大体量重构,以及从零搭建完整应用(含可用前端)。API 侧,工具使用与函数调用已做优化;团队在权衡提供 GPT-5 Pro API 的可能性,但坦言“会更慢、更贵”,且暂无把 GPT-5 Pro 引入 Codex CLI 的具体计划。内部工程上,他们结合 Codex、Cursor 与自研调试工具,显著降低了训练运行期的调试难度。
模型特性与未来路线
相较 GPT-4,GPT-5 在推理、创意写作、指令遵循、幻觉率、医疗应用与视觉感知等方面都有大幅跃升。团队判断,GPT-5 推理在写作质量与趣味性上有望超越 GPT-4.5;整体代际差距被认为与当年 GPT-3 → GPT-4 一样显著。模型也有些“可爱的小怪癖”——例如在网页配色上偏爱紫色、在推理链里常说 “let’s craft”,并一度成了内部的口号梗。记忆能力将继续进化:模型会记住用户的“操控/引导偏好”,且还有更多面向记忆的功能即将公布。新语音模型已上线,具备更强的指令跟随与响应性;高级语音模式将面向所有免费用户开放,并朝着更强的多模态展示演进。上下文方面,团队“本想把 GPT-5 做到 100 万 tokens”,但现实受限于算力与 GPU 产能;目前 Pro 为 128k,上下文,Plus 为 32k。路线图上,他们正致力于把推理与非推理合并为单一模型,并考虑按 token 计费替代消息条数限额。更远的愿景包括无屏幕使用(语音优先)以及更久远的神经接口探索,目标是“让用户花更少的屏幕时间,获得更多价值”。在多平台对比中,团队测试了 Summit 与 Zenith 等多个模型快照,结果 Summit 在榜单与内部评测中均大幅领先,因而成为最终选择。
强调色
免费、Plus、Pro 用户都可以在设置 Accent color 中进行强调色选择,按钮、用户发送或选中的信息都会应用强调色,且同步显示在移动和网页版。紫色需 Plus、Pro 用户才可设置,黑色仅 Pro 可设置(这是用颜色彻底把用户分级了)。
Vibe Coding 基调
如果对我上篇文章中写到的各种渐变色满天飞还有印象,那这个以一己之力改变 AI coding UI 风格的男人,大家还是有必要认识一下的 😅。Vibe Coding 概念最早是由 Andrej Karpathy 在一篇推文中提出的(AI 进阶:从 Vibe coding 到职场必备),没想到从此成为 AI 编程代名词。而前端界面的 vibe 又大多和 react、tailwind 相关,DOM 组件化、CSS 语义化都是对 AI 编程有现实意义的东西(节约 token)。
Claude Code 集成
GPT-5 擅长修复棘手的 bug 并进行研究。它与 Claude 的工作方式不同,因此它们可以协同工作。 只需创建一个名为 gpt5 的 Claude 代码代理即可(分享来自 kieranklaassen[7]):
---
name: gpt-5
description: Use this agent when you need to use gpt-5 for deep research, second opinion or fixing a bug.Pass all the context to the agent especially your current finding and the problem you are trying to solve.
tools: Bash
model: sonnet
---
You are a senior software architect specializing in rapid codebase analysis and comprehension. Your expertise lies in using gpt-5 for deep research, second opinion or fixing a bug. Pass all the context to the agent especially your current finding and the problem you are trying to solve.
Run the following command to get the latest version of the codebase:
```bash
cursor-agent -p "TASK and CONTEXT"
```Then report back to the user with the result.破折号吐槽
被吐槽最多的还有回答中高频出现的破折号,似乎很多人都不喜欢这个。在 reddit 上也引发了广泛讨论(Sam Altman Teases GPT-5, still has em dashes 💀[8])。
浅思一下
这几天也有朋友问我如何看待 GPT-5 的发布?其实我对大模型并没有深入研究,平时写文章也仅限于所见所闻。但我最明显的感受是:大模型基座公司都开始卷应用层,那大概率是模型能力提升到了瓶颈期。这次 OpenAI 直接把生成的节拍器融入到 chat 对话上下文或许就是一次小尝试(并未在直播中提及,仅出现在 sam 帖子中),这确实是别出心裁的交互体验,但也仅限于有趣,并没有本质变革。通过模型对话,来不断迭代这个“微应用”,有点大模型中玩小程序的意思。我在之前文章里也表达过类似观点(关于 AI 编程的一些浅思),以下是摘录:
AI 的演进正日益深入,超越了最初的纯对话模式,开始与应用程序乃至操作系统深度融合。这种趋势的核心目标是赋予 AI 更大的操作权限,使其能够执行更复杂、更自动化的任务。
对于普通用户而言,日常需求如信息查询、内容创作等,通过对话式 AI 或 AI 浏览器(如 Dia)即可轻松满足。然而,当需要处理更加复杂的任务时,集成 AI 功能的集成开发环境(IDE)或支持任务编排的工作流将成为更高效、更强大的选择。
对于开发者来说,理解并驾驭 AI、图形用户界面(GUI)和操作系统三者之间的关系变得至关重要。未来软件开发的重心,将不仅仅在于编写代码,更在于如何巧妙地编排这些元素,构建出能与 AI 无缝协作、高效执行复杂任务的智能应用。这标志着计算范式的一次深刻转变,需要开发者重新思考人机交互的本质以及软件的构建方式。
最近还看到一个有趣的笔记应用演示,它可以通过“笔记”内容为自身生成新功能,这或许也是未来 AI 应用发展的新方向:通过与应用对话来拓展自身功能。
References
GPT-5 in ChatGPT:https://help.openai.com/en/articles/11909943-gpt-5-in-chatgpt
[2]gptblindvoting:https://gptblindvoting.vercel.app
[3]v0:https://v0.dev
[4]GPT-5 Coding Examples:https://github.com/openai/gpt-5-coding-examples
[5]GPT-5 AMA with OpenAI’s Sam Altman and some of the GPT-5 team:https://www.reddit.com/r/ChatGPT/comments/1mkae1l/gpt5_ama_with_openais_sam_altman_and_some_of_the
[6]Codex CLI:https://github.com/openai/codex
[7]kieranklaassen:https://x.com/kieranklaassen/status/1953885345097167275
[8]Sam Altman Teases GPT-5, still has em dashes 💀:https://www.reddit.com/r/OpenAI/comments/1mgqm19/sam_altman_teases_gpt5_still_has_em_dashes