喝点VC|a16z对话OpenAI研究员:GPT-5的官方解析,高质量使用场景将取代基准测试成为AGI真正衡量标准
- 这真的是一种平衡艺术 —— 要搞清楚模型应该具备哪些特性,以及我们希望它给人的 “ 感觉 ” 是什么。 GPT-5 发布时,我们觉得正好是一次重置和重新思考的机会。尤其是, 现在要让一个模型变得很 “ 有互动感 ” 其实很容易,但有时候这种互动可能是不健康的,所以我们想让它成为一个健康、有帮助的助手。
- 大家常说 vibe coding , 非技术背景的人现在手里有了非常强大的工具,只需要一个好想法,就不会再被不会写代码的限制束缚。 比如我们在直播里演示的两个前端编程案例,只花了几分钟就完成了。对我来说,过去要做出完全可交互的成品,可能得花一周。我预计会有很多独立类型的小企业诞生,因为你只需要一个想法,写几行提示词,就能得到完整的应用。
- 未来衡量模型好坏的真正标准可能会是使用情况 —— 有哪些新的用例被解锁了?有多少更多的人在日常生活中用它来完成各种任务?这才是我真正关心的,也是判断我们是否在接近 AGI 的关键指标之一。
- 我们团队其实是 从目标能力反推 的 —— 先明确我们希望模型具备什么能力 。比如,我们想让它擅长做幻灯片,或者高效地编辑电子表格。如果这些能力目前没有对应的评测,我们就自己设计一套能真实反映该能力的评测,并且确保它对用户有实际价值。
- 过去很多智能体演示其实并不好用,但当我们看到强化学习算法在数学、物理和编程问题上表现很好时,通过观察它的推理链,我们意识到:它真的会 思考、推理、回溯 。这种能力是智能体面对现实世界所必须的。于是我们明白,这才是真正能让智能体实用化的关键。
Isa Fulford : 其实很多限制并不在模型本身,而在于我们如何设计工作流程来让它完成任务。比如用现有模型完全可以搭建一个持续监控系统,只是需要设计好 “ 挂钩 ” 的方式。对于 Agent 型任务也是如此 —— 未来如果 Agent 能主动帮你完成事情,我们就能获得反馈并不断改进触发逻辑。 Sarah Wang : “Agent” 可能是 2025 年最被滥用的词,不过你们的 Agent 发布确实让人很兴奋。那在你看来,它的核心能力应该是什么?
Isa Fulford : 我给它的通用定义是:能替我做有用的工作,并且是异步的 —— 我把任务交给它,过一段时间回来,它要么交付结果,要么给我发个问题确认它的进度。
从路线图来说,长期目标是让它能完成像幕僚长或助理那样的所有任务。短期内,我们会专注于刚在 ChatGPT Agent 里上线的核心能力,比如 deep research ,不仅是从互联网整合信息,还包括整合用户自己的各类服务数据和私有数据。另一个重点是提升它在创建和编辑文档、幻灯片、表格方面的能力 —— 毕竟很多有价值的工作就是 “ 查资料 + 做东西 ” 。 我个人也很喜欢面向消费者的用例,比如购物、旅行规划,这些也很有趣。不过这类功能通常涉及执行操作(比如下单、预订、使用日历),而这是个很难的研究课题。等我们把端到端的流程真正做好后,它基本上就能做任何事了。 Sarah Wang : 是的,真是太不可思议了,关于购物的部分。我现在买任何大额商品之前,都会让 ChatGPT 帮我把所有选项按照我关心的维度整理成一张表。真的非常厉害。 不过我想重点聊聊异步( async )这一块,因为我不知道你是否认同,但对我来说,这在年初时真是一个启示 — — 人们其实愿意等待。因为你会想,我们都希望更快,毕竟这个工具的价值主张是能快速给我答案,对吧?这感觉像是 2024 年的思维模式。但显然,这个范式已经变了。 人们愿意为高质量、高价值的答案和工作等待。 那么,你怎么看用户等待时间与实际提供价值之间的权衡?你觉得理想的平衡点在哪里? Isa Fulford : 这很有意思。因为我之前在 ChatGPT 上做过检索功能,还在浏览团队工作过。 Tina 也在浏览团队,我们一直在权衡和优化延迟。我们会思考,如何最好地用你检索到的信息填充上下文,让答案在几秒内就够好。所以针对深度调研,我特别兴奋能把延迟变成非限制因素。我们做的是那些人类很难完成、需要花费好几个小时的任务。如果你让一个分析师做,可能得花 10 小时甚至两天,那用户愿意在产品里等五分钟,好像很合理。 所以我们就做了这个赌注,幸运的是看起来确实如此。但我也觉得,起初大家都觉得 “ 哇,真厉害,它做了那么多工作,这本来我得花很久 ” ,但现在人们又会说, “ 好吧,我想现在就要, 30 秒内给我结果。 ” Sarah Wang : 关于标准在变,我正想问,是否有一个经验法则,比如只要比人做快 10 倍,用户就愿意等?还是说这标准一直在变? Christina Kim : 每次新产品发布,用户的期望都会不断变化。 Isa Fulford : 是的,我确实觉得,我们也有一个具体数字。有趣的是,有时人们会偏向认为答案越长,内容越详尽,做的功夫越多,但我不完全同意。比如深度调研总是给你很长的报告,但有时候我不想读完整篇长报告,实际上我不喜欢那样。 所以 Agent 模式只会在你要求时给你长报告。但有时人们习惯了总能得到很长的报告,就会觉得 “ 等等,我一直在等我的长报告呢? ” 但实际上,要找到某个具体信息其实挺难,也会花人很多时间,因为它可能在结果的第 10 页,而 Agent 能直接找到那个信息。 很有意思的是,产品可以影响用户的期望。比如深度调研模式总是花很长时间思考,我其实不认为这是一个优点,但现在用户已经习惯了等待的时长。 Christina Kim : 我们从 GPT-5 测试中也听到类似反馈,内部测试时有人说, “ 哦,我以为我问了个特别难的问题,结果它思考时间这么短,有点让被冒犯了。 ” 或者有时它根本不想多想就回答了。 Agent 能力受限于上下文与执行链,长任务仍是短板 Erik Torenberg : 这让我想起马克 · 吐温的那句话: “ 我没时间给你写封短信,所以我写了封长信。 ” 对了,你说说瓶颈吧,为什么 agent 不能有可靠的能力?你觉得主要瓶颈在哪里? Isa Fulford : 很大一部分原因是,我们训练的数据往往让模型在这些方面表现很棒,但在训练之外的领域,表现就参差不齐,有时不错,有时不行。所以关键是要在更广泛的领域创造更多数据,让模型在更多我们期望它擅长的事情上表现良好。 关于智能 Agent 这块也挺有意思的,当它代表你做事,并且能够访问你的私人数据和你使用的信息时,会有点吓人。因为它为了实现最终目标,可能会做出各种不同的操作。比如,理论上你让它帮你买东西,并且确保你喜欢它买的那样,它可能会买五样东西,只为了确保你喜欢其中一个,但这未必是你真正想要的。 所以在训练过程中进行监督和监控,这块也是一个很有趣的领域。我们确实需要开发一些新的东西,来推动这些智能 Agent 的进一步发展。另外,每当我们得到一个更聪明的基础模型或类似的东西时,所有建立在它之上的模型也会得到提升。 这也会有帮助,特别是像 Tina 说的,关于多模态能力,比如电脑使用的场景。它基本上就是在看网页的截图,有点有趣,因为人类在看东西时会专注于特定的部分。让模型直接看一张完整的图像,然后能够完全理解这张图像的所有内容,期待值有点高,因为我们人类自己看东西时都会聚焦在某个特定点上。 还有很多方面可以改进。抱歉,这回答比较泛泛。 Sarah Wang : 没关系,实际上我想说的是,你刚才举的例子正好涉及我们一直很好奇的一个问题,也跟训练数据有关。比如,目前智能 Agent 在浏览任务上,哪些具体类别的任务比较有挑战?你有没有什么想法,怎样解决这些问题,让下一代模型表现更好? Christina Kim : 其中一个原因是,预训练依赖于现有的数据,而现在其实还没多少关于人们使用电脑的数据。电脑使用还不是一个有大量数据积累的领域,这也是我们现在必须主动去搜集的,因为这是我们想要的一个能力。所以这可能是提升电脑使用能力的关键瓶颈之一。 Sarah Wang : 你觉得未来会更多依赖人力数据供应商来帮忙收集,还是因为这种数据目前根本不存在,或者说没有以对训练最有帮助的方式被记录,我们该怎么解决?毕竟这可能是模型最实用的应用场景,至少是在知识工作方面。 Isa Fulford : 一个有意思的点是,比如最初做深度调研时,根本没有类似数学数据集那样的浏览数据集,所以我们得自己创造所有这些数据。但一旦你拥有了好的浏览模型或者使用模型,就可以用它们来辅助生成数据,这样就能实现数据的自举( bootstrap )。 Erik Torenberg : Christina ,你能不能解释一下什么是中期训练( mid-training ),它实现了什么,是预训练或后期训练做不到的? Christina Kim : 预训练( pre-training )是大规模训练,你可以把它理解为我们为之搭建庞大集群来完成的那些大型训练过程。中期训练就是介于预训练和后期训练之间的一个阶段。 它相当于是 “ 中间 ” 训练,先在预训练后,但在后期训练前做的。你可以把它看作是提升模型智能的一种方式,不用重新跑一遍完整的预训练。 中期训练主要关注数据和基于预训练模型的优化。它能帮助我们做的事情,比如更新模型的知识截止时间。因为预训练时,你相当于是把模型 “ 定格 ” 在某个状态,之后无法轻易更新它。而且把所有新数据放进后期训练,也不太合适。所以中期训练就是一个较小规模的预训练跑,用来扩展模型的智能和提升知识的时效性。 未来五年将进入 “ 主动智能体时代 ” Erik Torenberg : Christina ,你参与过 Web GPT 的开发吗? Christina Kim : 是的,我参与过。
Erik Torenberg : 那你基本上就是个 AI 历史学家了。
Isa Fulford : 嗯,是的。她也参与过电脑使用相关的项目。 Christina Kim : 我是资深的了。 Erik Torenberg : 能不能帮我们回顾一下,四五年前的情况,预测一下未来五年,会有哪些拐点或最让你惊讶的事情? Christina Kim : 老实说, Web GPT 最让我们兴奋的,是试图让语言模型 “ 接地气 ” ,就是解决模型胡言乱语的问题。因为当时我们没有做中期训练,所以模型更新不够及时,很多事实信息都过时了。于是我们想,怎么让模型保持最新、最准确的信息,于是就想出了给它浏览网页的能力。这思路挺合理的。 然后正如我之前说的,这个项目慢慢演变成了,一个可以持续对话的聊天机器人。那个时候,已经有几家公司推出了聊天机器人。聊天机器人作为 AI 的应用其实很常见,不过当时很不受欢迎。所以我们其实不确定这个东西是不是用户真的想用的,大家会不会感兴趣,这算不算研究创新,我们是在重新发明图灵测试吗?不过后来我意识到,这里面可能真的有点意思。 我们早期给大约 50 个人提供了内测权限,其中大部分是我当时的室友。有两个室友一直用,一天到晚都跟它聊,很长时间的对话,而且问的问题还挺技术的,因为他们也是 AI 研究者。我当时想, “ 哦,这挺有意思的。 ” 那时我们还在想,到底是做成一个专门的会议助手,还是代码辅助工具?但看到我两个室友把它当万能助手用,整个工作日都跟它聊天, “ 这挺有趣 ” 。不过同样有趣的是,给那 50 人里的大部分人权限后,他们并没有频繁使用。我当时想, “ 嗯,肯定有潜力,但可能还没普及到每个人。 ” Erik Torenberg : 你什么时候意识到, “ 我正在这代最重要的公司工作 ” 呢?什么时候觉得, “ 这事我确实相信,所以我来了 ” ,但同时意识到它的规模和意义? Christina Kim : 老实说,我大概在加入 OpenAI 之前就有这种感觉了。 我记得是看了那个 “Scaling Laws” 论文,还有 GPT-3 发布的时候,我突然意识到如果这个指数增长是真的,那我没什么比这更想花一辈子精力做的了。我想成为这个故事的一部分,这会解锁很多有趣的东西,这可能是技术的下一大步。那时候我就觉得, “ 哦,我得开始学深度学习,想办法进入这些实验室。 ” Isa Fulford : 我也是在加入 OpenAI 前。我第一次听说 OpenAI 是在某门 AI 课或者计算机课上,他们说 “ 他们训练模型用的是整个互联网的数据。 ” 我当时想, “ 哇,这家公司太疯狂了! ” 然后我开始用 GPT-3 ,我是 OpenAI Playground 的资深用户。 后来我还拿到了一些早期权限,试用了 OpenAI 的各种功能,比如 embedding (嵌入向量)什么的,慢慢变成了 OpenAI 的超级粉丝。虽然有点尴尬,但没关系,因为它把我带到了这里。最后他们就说, “ 你这么 ‘ 跟踪 ’ 我们,想不想来面试? ” 所以那时我就很明确了。不过,我当时用 GPT-3 的频率,跟现在的根本没法比,完全没法比。但从那时候起我就上瘾了,一直在想办法进来工作。 加入 OpenAI 是进入 AI 前沿的通行证,使命是推动 AGI 落地 Sarah Wang : 或许可以问一个关于公司建设方面的问题。我们都反复读过 Calvin French-Owen 写的那篇文章,他分享了在 OpenAI 工作的感受。你不一定非得评论那篇文章,但我很想听听你对过去四年,或者其实那篇文章只讲了一年变化的情况下,你看到 OpenAI 发生的最大变化的看法。 Christina Kim : 当我刚加入 OpenAI 时,应用团队只有大概 10 个工程师。我们当时几乎没有真正的产品部门,只刚刚推出 API ,一切完全不一样。现在,经过 ChatGPT 之后, AI 进入了大多数人的视野。但在 ChatGPT 之前,大家其实并不太了解 AI ,也没怎么去思考它。现在我工作所在的地方,我爸妈都知道我在做什么,这感觉挺酷的。公司显然也变得大了很多,但这让我们可以承担更多风险。我加入时, OpenAI 明显人员要少得多,大概 200 人左右,现在肯定接近几千了。 Isa Fulford : 当时也是几百人,还是在 ChatGPT 发布前。显然,大家都知道你在做什么,朋友们都听说过你工作的项目,这完全不一样了。但从文化上来说,公司虽然大了,依然保持着创业公司的氛围。一些从创业公司来的同事会惊讶: “ 我现在工作比创办自己的公司时还拼。 ” 好点子还是能从任何人那里冒出来,只要你有主动性,想把事情做成,不论你职位多高,都能实现。我们一直保持着这种文化,这挺特别的。 Christina Kim : 是的,我们绝对会奖励主动性,这一直都是事实。特别是在研究团队,团队都比较小。当 Isa 做深度调研时,团队就两个人,依然是两个人。所以我们研究团队通常都比较小而灵活,这也是原因之一。 Erik Torenberg : 你刚才还说过,在 OpenAI 我们做的一件事是创业公司通常不会做的,就是试图用一个产品吸引所有用户。还有什么事情是你觉得 OpenAI 做得跟同行或其他创业公司不一样,或者是我们外部不太理解的地方吗? Isa Fulford : 这个其实不同团队情况不一样,但我所在的团队跟应用工程团队、产品团队和设计团队合作非常紧密。研究团队有时候会跟公司其他部门比较分离,但我们是非常一体化的,我们大家都坐在一起。有时候研究人员会帮忙做一些实现工作,虽然工程师可能不总是乐意,但我们会尝试。比如他们会帮忙写前端代码,反过来他们也会帮我们做模型训练时的一些工作。所以,有些产品团队跟研究团队整合得挺好的,特别是在后期训练( post-training )阶段。这种模式让我们能快速推进项目。 Sarah Wang : OpenAI 很独特的一点是,既是一个消费者导向的公司(按收入和产品来看),同时又是一个企业服务公司。内部怎么看待这个定位?你们觉得自己更偏哪一边,或者说这个划分根本就不对? Isa Fulford : 如果从使命角度看,这两个角色是统一的。我们的目标是做出最强大的产品,同时让它对尽可能多的人有用,尽可能多的人能用得上。所以从这个角度看,这种定位挺合理的。 Sarah Wang : 品味这个概念现在也被广泛提及。在 OpenAI 里,好品味是什么?你怎么知道自己看到了好品味?在如今制作成本越来越低的时代,好品味是唯一不可被商品化的东西吗?还是这个标准也在变化?这是否会影响训练数据? Christina Kim : 品味很重要。尤其现在我们的模型越来越聪明,更容易当作工具来用。所以, 有正确的方向感很关键,有正确的直觉,知道该问什么问题也非常重要。品味现在比以前更重要了。 Isa Fulford : 让我惊讶的是,经常最简单、最容易解释的东西效果最好。有时候看似非常显而易见,但实际上把细节做好并不容易。 好的研究者的品味,就是能够把问题简化到最简单、最 “ 傻瓜 ” 的那个方案。 Christina Kim : 是的,每次我们发布研究成果,人们一看都觉得 “ 哦,这么简单,当然行 ” ,但关键是你得想到去试那个在当时看来可能不明显、但事后一看很显然的方案。然后再把所有细节调好,像超参数调整、推理细节这些,当然非常难,但核心思路通常很直接。 Isa Fulford : 没错,品味就是奥卡姆剃刀, 如无必要,勿增实体 。 Erik Torenberg : 好,作为结束,今天是历史性的一天,你能结合使命谈谈这意味着什么吗?从过去到现在,再到未来的发展方向? Christina Kim : GPT 里一直萦绕我脑海的词就是 “ 可用性 ” 。我们最兴奋的是把这个技术推广给每个人。我们很高兴现在能把最强的推理模型免费提供给用户。能把我们目前最聪明的模型带给所有人,我很期待看到大家会用它做些什么。 Erik Torenberg : 这真是一个很好的总结。 Tina ,非常感谢你今天来录播客。 Christina Kim : 谢谢,谢谢你们邀请我们。 原视频: GPT-5 and Agents Breakdown – w/ OpenAI Researchers Isa Fulford & Christina Kim https://www.youtube.com/watch?v=k6DM-sgYu8M 编译: Alyssa Pang 请注意,本文编译自文末载明的原始链接,不代表 Z Potentials 立场。如果您对本文有任何想法或见解,欢迎在评论区留言互动探讨。 Z Potentials 将继续提供更多关于人工智能、机器人、全球化等领域的优质内容。我们诚邀对未来充满憧憬的您加入我们的社群,与我们共同分享、学习、成长。 -----------END-----------