MacTalk

GPT-5:我更强了,就这?“看不见”的升级

凌晨 OpenAI 发布了 GPT-5,早上爬起来赶紧看……试了试,发现这个 GPT-5 和万众期待的 AGI 并没有什么关系。

没有“秒杀人类”的 AGI demo,没有 ChatGPT 变身超级助理的逆天升级,也没有“10 倍能力提升”的噱头。打开 ChatGPT,OpenAI 给它的介绍简洁到极致:

Image

更快更强更有用。纳尼,说好的 AGI 呢?没说好呗。

回头再看 GPT-5 的发布会、论文、开发者访谈和部分体验用户的反馈,会发现这次 OpenAI 干了一件“看不见的事”:GPT-5 并不是为“震惊世界”而来,而是为“实用主义”而生。

我感觉 OpenAI 的方向似乎和 AGI 越来越远了,开始玩工程和产品了。

GPT-5 是比 GPT 4 更强大,更稳健,更贴近现实场景的需求,这没毛病,毕竟升级了一个大版本,但符合你的预期吗?看有群里用户讨论写作能力还下降了,芜湖,这是你想要的 GPT-5 吗?

一、GPT-5 是怎么来的?

GPT-5 在 2024 年开始训练,模型参数数量未公布(OpenAI 早不玩参数大战了),但有传言说规模在 1.5~2 万亿之间,依然是混合专家(MoE)架构,激活约 2-3% 的子网络。

训练时长大约是几个月的时间,数据量覆盖文本、代码、图像和多模态信息,并在训练完成后又经历了更长时间的“对齐调优”:包括强化学习(RLHF)、人类反馈修正和大量企业内部预发布测试。

说起来 GPT-5 的发布过程也颇具戏剧性。过去一年多,外界对它的期待极高,但研发过程并不顺利,甚至一度因核心研究人员流失而陷入困境。

OpenAI 明确说,GPT-5 的训练目标就是:“让模型更加可靠、更少幻觉(hallucination)、更强的推理能力和更长的工作记忆。”

这句话听起来不性感,却很实用。

二、GPT-5 的几个关键特性

1. 推理更强,但没“炫技”

GPT-5 不再炫耀数学能力或者 IQ 测试成绩,而是专注解决 GPT-4 在实际场景中的“逻辑断裂”。

比如你让 GPT-4 规划一个项目,可能前一段建议你招人,后一段却又说预算不足,甚至给出自相矛盾的时间线。这种“智障级”问题在 GPT-5 里明显少了。

在一些早期企业测试中,GPT-5 可以完成更复杂的推理链条,比如:

分析一段财报后判断潜在财务风险;

阅读用户反馈后归纳产品的主要 Bug;

撰写带结构的长篇技术文档或法律协议。

这说明 GPT-5 不只是“更聪明”,而是更“有条理”。

如果说 GPT-4 是个聪明但经常跳针的实习生,那么 GPT-5 更像一个靠谱、能独立承担责任的中层。

2、编程能力世界最强

Altman 直接在发布会中断言:“这是世界上编码能力最强的模型,是世界上写作能力最强的模型,也是世界上在医疗保健领域最强的模型”。

在 GPT-5 身上,编程能力被明显提升到“能放心上生产线”的层级。

首先,它在代码生成上的幻觉率比 GPT-4 再降三成以上,尤其在函数签名、依赖引用和边界条件处理上几乎不再“瞎编”,写出的代码可以直接拿去跑单元测试。

其次,推理链更长——你可以一次性抛给它一个跨服务的架构需求,它不仅能拆分微服务,还能为每个子服务生成接口文档、Dockerfile 及 CI/CD 配置,并保证相互调用顺畅。

第三,GPT-5 的长期记忆体系为编程场景打开了“上下文持久化”大门:它能记住你团队的代码风格、既有工具链乃至历史 Bug,下一次再问时会自动贴合约定写代码。

更重要的是,OpenAI 在 GPT-5 里深度整合了工具调用与插件生态,模型可以根据需要动态决定是继续写代码、运行单元测试,还是调用静态分析器并把结果合并回回答里。

到底是不是最强,还得看最终用户怎么说,vibe coding 工具会不会转而实用 GPT-5,拭目以待,用户会用脚投票的。

3. 长期记忆系统首次上线

GPT-5 的记忆系统首次实现了真正意义上的“长期记忆”,让模型能持续记住用户信息和历史互动。

GPT-5 的记忆系统是这次升级中最具突破性的特性之一。和以往只靠上下文窗口的“短期记忆”不同,GPT-5 引入了“个性化记忆”机制。它不仅能记住你是谁,还能记住你过去问过什么、喜欢什么风格、你公司的业务和痛点等信息。这样一来,每次和 GPT-5 交流,它都能基于你过往的历史和偏好,给出更贴合、更有连续性的回应。

在 ChatGPT 产品中,这种能力以“个性化记忆”的形式开放,企业 API 也能调用类似的功能。对于用户来说,GPT-5 不再是“每次见面都重启的傻瓜助理”,而是逐渐变成了“与你共成长的智能拍档”。这让用户体验首次出现了“连续性”,也让 AI 助理真正具备了陪伴和成长的可能。

这种记忆系统的上线,意味着 GPT-5 能更好地理解和服务个人用户和企业需求,推动 AI 从工具向伙伴转变。

4. 幻觉率大幅下降,特别是在事实性任务中

虽然在发布会演示现场依然出现了幻觉,但这次 GPT-5 的核心能力之一就是大幅降低幻觉率——显然还有提升空间,😂

GPT-5 针对幻觉问题进行了大量微调,尤其是在代码生成、法律问答、医疗推理等“绝不能瞎编”的严肃场景中。

比如,一家医疗创业公司的测试显示:GPT-5 在医学知识题集上的幻觉率相比 GPT-4 降低了 35%,在 ICD-10 诊断编码匹配任务中的错误率也下降了 40%。

OpenAI 内部甚至专门组建了数据验证团队,聚焦“知识精准度”指标,并配合工具调用系统进行事实校验。

这意味着什么?意味着 GPT-5 更适合成为医生的第二意见、律师的备忘助手、程序员的代码伙伴,而不只是“一个讲笑话的语言模型”。

实用、实用、还是实用——这,才是 GPT-5 的精髓。

5. 工具调用和 Agent 架构更成熟

OpenAI 没明说 GPT-5 是为 Agent 打造的,但从调用接口和插件系统的整合可以看出,它确实为“AI 自动执行任务”做了更深准备。

GPT-5 支持更复杂的工具链组合、长时间对话状态维护、动态规划任务等功能。

比如你让它“整理上周用户反馈,生成周报并同步给 Notion 和 Slack”,GPT-5 可以自己拆解子任务,判断是否需要调用浏览器、文件管理、日历或外部插件,并保持流程一致性。

GPT-4 的问题是“调用能力有了,但脑子不够”,GPT-5 把脑子补上了。

之前墨问里的猫大人,投资人,编程白丁,已经基于 4o 的 Agent 做了一个文章划线的浏览器插件,这次估计可以继续大显身手。

三、为什么说这是一次“看不见”的升级?

发布会上 GPT-5 并没有提供一个“能震撼朋友圈”的 demo,和上次发布 ChatGPT Agent 有点像。发布了?哦对,发布了。

论震撼程度,甚至不如谷歌发布的 Genie 3 世界模型(这个我回头再写)。它只是默默提升了每一个“普通场景下的实用体验”:更稳、更准、更懂你。

还有缺点和瑕疵,比如发布会翻车场面,比如有人说写作能力下降了等等,这需要我们更多使用才能知道。或者说,GPT-5 需要一些时间才会更稳定。

AI 世界正在从 “模型能力炫技”走向“AI 产品打磨体验”的新阶段,GPT-5 是这个转变的标志。

这有点像手机行业从 iPhone 到 iPhone 4 的转变。事实上移动互联网是从 iPhone 4 发布之后开启的,手机开始真正改变我们每天使用科技的方式。

四、是否达到预期?

我是 GPT 的 plus 用户,每月 20 刀,我觉得很值了。之前很期待 GPT-5

各种媒体、自媒体和 AI 业界调门起的比较高,有的人甚至在播客里扯淡,AGI 在一两年只能就能实现,nnd,听多了真的会当真啊。

所以,如果你期待 GPT-5 是“人类智能的拐点”,不好意思,没有。

但如果你期待 GPT-5 成为企业和个人真正能用的生产力工具,是的,它走在了这条路上。

它修正了 GPT-4 的很多实际问题,补齐了 Agent 落地的关键短板,并带来了首次可控的“用户级记忆”。

这背后代表的是 OpenAI 的方向调整:从“做最强大模型”,变成“做最好用模型”。

我甚至感觉 OpenAI 已经放弃了 AGI 的战略方向。不知道这是不是国外几家大模型的共识,还是被人挖墙脚之后的无奈之举?

这次 GPT-5 的发布让我感觉,相比 Claude、Gemini、豆包、智谱、MiniMax 等一众大模型,GPT-5 最大的优势在于,除了大模型,系统级工程能力也是领先的,比如:

精细打磨的 API 体验;

强大的个性化记忆能力;

严格的数据对齐和抑制幻觉机制;

企业级的服务能力;

更加健壮的 Agent 架构底座。

这些“慢变量”优势,决定了 GPT-5 在实际落地和长期可用性上的地位。这种“慢变量”优势,不像参数那么直观,也不像 BenchMark 那么炸裂,但它决定了 AI 工具是否能落地、是否能长期使用。

我相信,中国模型在技术路线和能力指标上已经越来越接近 GPT 系列,甚至在某些领域有所超越,后面需要做的,可能是“从能力到产品”上的比肩。

AI,先用起来再说。