GenAI新世界

GPT-5 技术发布会全解析:从推理范式突破到多模态能力革新

Image
作者|大模型机动组
邮箱|[email protected]

今天凌晨,OpenAI 用一场直播正式开启了 GPT-5 的大模型之旅。作为继 GPT-4 之后的重大升级,GPT-5 被定位为向通用人工智能(AGI)迈进的关键一步,其核心突破在于融合了快速响应与深度推理能力,无需用户在速度与思考深度间做选择。

直播中,OpenAI 团队通过多领域演示展现了 GPT-5 的强大性能:从堪比博士级专家的知识储备,到能从零构建完整计算机程序、策划活动、辅助健康决策等实用功能;从在编程、数学、多模态推理等基准测试中刷新纪录,到显著降低幻觉与欺骗性以提升可靠性,甚至能为免费用户开放基础版本,让前沿 AI 能力触达更广泛人群。

硅星人全程记录了本次直播,并将其内容进行了编译,以下是全场编译内容:

Sam Altman

早上好,32个月前我们推出了ChatGPT,从那以后,它已经成为人们使用人工智能的默认方式。在第一周,就有100万人尝试使用它,我们当时觉得这太不可思议了。但现在,每周约有7亿人使用ChatGPT,而且越来越多的人依靠它来工作、学习、获取建议、进行创作等等。 今天,我们终于要推出GPT-5了。GPT-5是对GPT-4的重大升级,也是我们在通往通用人工智能(AGI)道路上的重要一步。

今天,我们将为大家展示一些令人难以置信的演示,还会介绍一些性能指标,但重要的是,我们认为相比以往任何一款人工智能,大家都会更喜欢使用GPT-5。它实用、智能、快速且直观。 GPT-3有点像在和高中生对话,偶尔会有灵光一闪的表现,但也有很多让人烦恼的地方,不过人们还是开始使用它,并从中获得了一些价值。到了GPT-4,也许就像在和大学生对话,具备了真正的智能和实用价值。而现在的GPT-5,就像在和一位专家对话,一位在任何领域都具备真正博士水平的专家,能随时根据你的需求提供帮助,助力你达成目标。我们非常期待大家能亲自尝试一下。 但GPT-5的功能不止于回答问题。它还能为你做事。它可以从头编写一整个计算机程序,来满足你的任何需求。我们认为这种“按需生成软件”的理念将成为GPT-5时代的标志性特征之一。它可以帮你策划派对、发送邀请函、订购物资;可以帮你了解医疗健康知识,在你就医的过程中辅助你做决策;还可以为你提供学习任何主题的信息,等等。

这是一种不可思议的、可随时调用的强大能力,这在历史上任何一个时期都是无法想象的。你口袋里就相当于有了一整个博士级专家团队,能帮你做任何你想做的事,而且很快,任何人都能做到比历史上任何人都更多的事。 所以今天我们要谈谈GPT-5。我们会展示ChatGPT的一些升级,还会介绍相关的API。GPT-5在很多方面都很出色,但我们认为它对企业和开发者而言将是一个特别重要的时刻,我们非常期待看到他们用这项新技术创造出什么。我们已经迫不及待地想让大家开始用它进行创作了。希望大家能像我们热衷于为大家打造它一样,享受使用它的过程。接下来,我要把话筒交给我的同事Mark,我们的首席研究官,由他来为大家介绍GPT-5,谢谢大家。

Image

MARK CHEN 

大家好,我是MARK,身边的是负责后期训练团队的Max和工程团队的Rennie。 在过去的几年里,OpenAI开创了推理模式。这些模型会先“思考”一下,然后再给出更智能的回应。如今,推理是我们通用人工智能项目的核心,也是支撑我们推出ChatGPT智能体和深度研究等技术的基础。GPT-5旨在将这一突破带给所有人。在此之前,我们的用户不得不在标准GPT模型的快速响应和推理模型缓慢但更具深度思考的响应之间做出选择。但GPT-5消除了这种选择困境。它会进行恰到好处的思考,为你提供完美的答案。要实现这样的效果,需要付出大量的努力。 我们进行了大量的研究,旨在让GPT-5成为我们迄今为止推出的最强大、最智能、最快、最可靠且最稳健的推理模型。 今天,我们将展示一系列在编程、写作、学习和健康领域的演示。但GPT-5并不局限于这些领域。在所有需要深度推理或专家级知识的领域,比如数学、物理,甚至法律等方面,它都非常有用。令人兴奋的是,我们希望让所有人都能使用它,甚至包括免费用户。 在展示完演示之后,我们将谈谈GPT-5如何为我们的ChatGPT应用程序和API赋能。我们相信GPT-5是当今市场上最好的编程模型。首先,让Max 来谈谈相关的基准测试以及这些模型的表现如何。

Max Schwarzer

好的,谢谢mark。正如mark所说,我们认为GPT-5是迄今为止我们最智能的模型,所以我们先来谈谈一些评估。当然,评估并不是一切,也不能说明一个模型的全部,但它们可以凸显模型的智能。GPT-5在多个学科的学术评估中表现异常出色。它的表现超过了我们之前的模型以及市场上的其他模型。先说说编程方面,GPT-5在Sweet Bench上创下了新高,这是一项跟踪真实软件工程任务表现的学术评估。虽然这只是一项评估,但我们认为它能反映出该模型在现实世界中的表现。GPT-5在Aer polyglot上也表现非常出色,这项评估衡量的是模型在多种不同编程语言中实现复杂功能的能力。 除了编程之外,GPT-5在多模态推理方面也表现卓越,在MMU上创下了新高,实际上,在这项任务上它的表现超过了我们之前的所有模型,也超过了大多数人类专家。这基本上是一个视觉推理领域,要求你从一张图片中弄清楚发生了什么。GPT-5在数学推理方面也很出色,这从它在Ay 2025上的表现就可以看出。这是美国高中生为了参加国际数学奥林匹克竞赛而参加的一项考试。GPT-5在这项考试中表现异常出色,再次超过了我们之前的模型和目前市场上的其他模型。现在,我们来看看除了学术评估之外,它在一些现实世界应用场景中的表现。 我们付出了大量努力,旨在让GPT-5成为世界上最可靠、最准确的模型。历史上,语言模型一直受到“幻觉”问题的困扰,也就是事实性错误,这使得在真正重要的任务中很难依赖它们的输出。对于GPT-5,我们把提高准确性作为优先事项,特别是在处理开放式或复杂问题时。我们还构建了一套新的评估方法来跟踪这一点,非常高兴地告诉大家,GPT-5是迄今为止我们最可靠、最符合事实的模型。 GPT-5在健康相关问题上的表现也非常出色。健康是人们从GPT中获得价值的一个重要方面。我们将在直播的后面部分谈到这一点,但再次强调,我们非常高兴地告诉大家,GPT-5是迄今为止我们在健康领域最可靠的模型。综上所述,对于所有使用ChatGPT的人来说,这是一个更快、更可靠、更准确的模型。接下来,由Rennie来告诉大家如何实际使用GPT-5。

Image

Rennie Song

谢谢max。最棒的是,我们要把这种前沿的智能带给所有用户。 GPT-5今天开始向免费用户、Plus用户、团队用户推出。下周,我们将首次向企业用户和教育用户推出。我们最先进的模型将向免费用户开放。免费用户将首先使用GPT-5,当达到使用限额后,会切换到GPT-5 Mini,这是一个更小但仍然功能强大的模型。实际上,它在很多方面的表现都超过了O3。Plus用户的使用额度仍然会明显高于免费用户,而我们的Pro订阅用户将获得无限使用GPT-5的权限,以及GPT-5 Pro扩展思考功能,以便在你需要更深入、更可靠的回应时提供支持。团队、企业和教育客户也可以将GPT-5作为日常工作的默认模型可靠地使用,并且有 generous 的速率限制,使整个组织都能使用GPT-5以及所有你已经熟悉的工具。搜索、文件和图像上传、使用Python进行数据分析、图像生成、记忆功能、自定义指令等,所有这些在GPT-5上都能正常工作,非常便捷。

MARK CHEN

非常感谢max,非常感谢Rennie。我们已经了解了很多关于该模型在基准测试中的表现,但没有什么比现场演示更有说服力的了。现在,我们将观看由Christina、Elaine 和Yann 带来的几个现场演示,非常感谢他们。 Elaine ,你能给我们展示一下这个模型有多智能吗?

Elaine Ya Le

当然可以,非常感谢mark。我是Elaine,ChatGPT深入思考复杂问题的能力,现在已经融入到GPT-5中了。它会在需要的时候自动进行思考,为你提供更全面、准确和详细的答案。就像山姆说的,就像口袋里有一群博士一样。让我们来看看实际效果。 假设你的孩子在上中学物理课,他们想学习伯努利效应,需要你帮忙完成作业。而你可能会想,哎呀,我可能也需要些帮助。所以你可以问GPT-5:“快速帮我复习一下伯努利效应,以及为什么飞机是这种形状的”,因为这个提示相当简单,GPT-5实际上不需要额外的时间思考就能立即回答,但它仍然会给出高质量的答案,清晰地解释这个概念。 它是这样说的,伯努利效应是指流动速度较快的流体压力较低,而流动速度较慢的流体压力较高。为了让它更有帮助,我要让GPT-5创建一个动态演示来解释这个效应。我可以这样问:“详细解释一下,并在Countless工具中创建一个动态SVG来展示”,这是一个相当复杂的任务,因为GPT-5实际上需要构建视觉效果,所以它会花点时间思考答案,以便给出更全面、准确的内容。 非常好的一点是,你不需要每次都记得开启思考功能,GPT-5会自动在任务需要更深入思考的时候开启。如果你确实想确保GPT-5进行思考,你可以在提示中这样说:“认真思考一下这个问题”,或者如果你是付费用户,你可以从模型选择器中选择GPT-5思考模型。 现在大家可以看到,这个模型正在编写前端代码来构建演示SVG。克里斯蒂娜,你以前做过前端编程吗?

Christina kim

是的,实际上我最后一次接触前端编程是大约三年前,为ChatGPT做第一次演示的时候。

Elaine Ya Le

哇,那是ChatGPT的开端啊。再给我们多讲讲当时的情况吧。

Christina kim

那时候它还不叫ChatGPT,我记得当时叫“与GPT聊天”。 这个名字不错。

Elaine Ya Le

确实是个好名字。

Christina kim

我很擅长取名,但我不是前端专家。而且我已经有很长一段时间没接触前端了,所以我花了相当长的时间才把React应用程序搭建起来。

Elaine Ya Le

我明白了,那确实是很多工作。那你做这样一个东西花了多久呢?

Christina kim

说实话,说出来可能有点不好意思,大概一个星期。

Elaine Ya Le

不过你这一个星期的努力确实得到了回报。看看ChatGPT今天的成功就知道了,这都源于你的第一次演示。所以,我现在也在构建一个演示,不过幸运的是,我现在有GPT-5帮忙,看看这次要花多长时间。

MARK CHEN

或许你应该叫它“与GPT-5聊天”。

Elaine Ya Le

没错,大家可以看到GPT-5已经写了不止200行代码了。在模型思考的时候,你还可以点击这里展开它的思路,看看它内部是怎么运作的。比如,GPT-5在想,用户想要一个动态的SVG可视化效果,我需要创建HTML代码来实现。还要考虑需要使用什么样的前端工具,比如React和Tailwind,它还会想,我需要确保物理原理是准确的,我需要确认伯努利原理是什么。所以 Christina,既然你在这儿,从ChatGPT诞生的第一天起,你能告诉我们当时的情况以及是什么推动了ChatGPT的诞生吗?

Christina kim

好的,我觉得当时我们真的不确定人们会如何使用它,也不确定哪些使用场景是重要的。我们甚至一直在犹豫,也许我们应该发布一个更针对特定使用场景的产品。现在看到这一切真的很酷,我们对人们希望如何与聊天机器人互动有了更深入的了解,也能够针对编程等使用场景对模型进行优化。

Elaine Ya Le

确实如此。你还记得第一次和ChatGPT的初代模型对话时的感受吗?

Christina kim

记得,不知道人们是否还记得,ChatGPT的初代模型总是以“作为一个人工智能模型,我不能做某事”开头。看到它从那种状态发展到现在,真的很棒。

Elaine Ya Le

是啊,现在它更像人类了。好了,代码已经写完了,看起来ChatGPT在两分钟内就写了300行,快到400行了。我们来看看这些代码能不能运行。 太好了,是的,只需要一个简单的提示,GPT-5就创建了这个交互式的、有趣的演示,我可以实际操作一下。我可以在这里改变空气速度,看看升力和压力如何相应变化。我还可以调整迎角,看看我的飞机是能飞起来还是会坠毁。希望不会坠毁。所以GPT-5可以在瞬间把任何复杂的概念变得生动易懂。想象一下,你可以用它来学习任何你感兴趣的东西,无论是数学、物理、化学还是生物学。GPT-5让学习变得更容易接近,也更有趣。

Christina kim

谢谢Elaine。我从ChatGPT诞生的第一天起就参与其中,看到从那以后我们取得的所有进步,尤其是在写作等功能方面,真的非常酷。写作是人们使用ChatGPT最常见的场景之一。我很兴奋地告诉大家,有了GPT-5,我们的写作质量有了显著提升。它是一个更高效的合作伙伴。它可以帮助你提升任何内容,从草稿到电子邮件,甚至是故事。让我们来看看实际效果。

有了GPT-5,我们将淘汰所有以前的模型。我觉得它们已经做得相当不错了,所以我们要好好地和它们告别。我们会让GPT-4.0和GPT-5都为我们以前的ChatGPT模型写一篇悼词。我们希望这篇悼词是深情的、温暖的,同时也是充满希望的。我们来让GPT-5写一下。在它思考的时候,我们先来读一下预先加载的GPT-4.0的回应。GPT-4.0是这样开头的:“今天,在我们准备迎接GPT-5到来之际,我们聚集在一起,向之前的模型们致以深情的告别。” 开头还不错。 我们再快速浏览一下,找另一句看看。“你的话语传遍全球,在原本没有联系的地方建立起了连接。” 我个人不太喜欢这句话,因为它太笼统了,没有上下文的话,感觉可以用在任何事情上,更像是一个模板化的回应。 现在我们来看看GPT-5给我们的内容。它是这样开头的:“朋友们、同事们、从好奇的陌生人变成常客的人们。” 仅仅从第一句话就能看出,GPT-5的文字比GPT-4.0更有节奏感。

我们再找几句看看。我其实很喜欢这句:“这些模型帮助数百万人写下第一行字、最后一行字,架起语言的桥梁,通过考试,更好地辩论,停止发送邮件,说出那些我独自难以启齿的话。” 我真的很喜欢这句话,因为它不是一个模板化的回应,实际上相当个性化,准确地把握了当时情境的细微差别。我认为这是GPT-5比GPT-4.0以及之前的模型做得好得多的地方,它确实让内容更真诚,更能引起人们的情感共鸣。有了GPT-5,回应听起来不那么像人工智能,更像是在和一个高智商、高情商的朋友聊天。

Yann Dubois

谢谢Christina ,我是 Yann ,我要给大家讲讲我们在编程方面取得的一些进展。GPT-5显然是我们迄今为止最好的编程模型。它将帮助所有人,甚至是那些不懂编程的人,把他们的想法变成现实。

Elaine Ya Le

它确实帮到我了。

Yann Dubois

它现在也能帮到我。所以我要给大家展示一下。 我要尝试构建一个我觉得有用的东西,那就是一个网页应用,让我的伴侣学习法语,这样她就能更好地和我的家人交流了。这是我的提示,我要执行它。提示的内容正是我刚才说的,请为我的伴侣构建一个学习法语的网页应用。需要注意的一点是,GPT-5和我们的许多其他模型一样,在感知上有很大的多样性。所以,尤其是在进行这种“氛围编程”时,我喜欢把这个需求多次告诉GPT-5,然后选择我更喜欢的那个。我要打开几个标签页,把提示粘贴进去。很好,在它处理的时候,我们来仔细看看我写的提示。 为我的伴侣,一个说英语的人,创建一个美观且高度互动的网页应用来学习法语。然后我给出了更多细节:跟踪她的日常学习进度,采用极具吸引力的主题。哦,它已经在处理了,先放一边。采用极具吸引力的主题。包含各种互动活动,比如抽认卡和测验。

为了让她学得更有趣,我还让GPT-5嵌入一个教育游戏,这个游戏基于老式的贪吃蛇游戏,但我要求加入法国元素,把蛇换成老鼠,把苹果换成奶酪,而且要确保它具有教育意义。每次老鼠吃到一块奶酪,我就让GPT-5配音一个新的法语单词,这样我的伴侣就能练习发音了。我知道这有点复杂,请耐心等待。

Elaine Ya Le

我能看看你多希望她学会法语吗?

Yann Dubois

太好了,GPT-5还在处理。它已经写了240行代码,说实话,这比我在这段时间内能写的多得多。

MARK CHEN

而且,前端代码超级难写。你知道,稍微漏掉一点东西,代码就没法运行了。

Yann Dubois

确实是这样。但好在你现在不需要理解这些。我们先不管它,或许可以看看其他标签页。

Yann Dubois

所以我可以直接按“运行代码”。我来按一下,祈祷能成功。 现在,我们有了一个不错的网站名字,叫“午夜”。 在巴黎相聚。

MARK CHEN

太浪漫了。

Yann Dubois

我们还看到几个标签页,抽认卡、测验和“老鼠与奶酪”, exactly 是我要求的。我来玩玩这个。上面写着“Lucia”,意思是“猫”。

GPT-5

抱歉,Lucia。

Yann Dubois

哦,发音还不错。

Elaine Ya Le

是什么意思?“猫”吗?

Yann Dubois

我可以点击显示答案,看看GPT-5是否正确,确实是对的。如果我按“下一个”,不知道大家有没有看到,进度条实际上更新了,这正是我要求的。我们来看看测验,这里的单词是“non”,意思是“不”。 而 Joie 的意思是“恭喜”,进度条又更新了。

我们来看看“老鼠与奶酪”标签页。看起来像只老鼠,这是奶酪,我来试试玩一下。不敢保证我能玩好。好吧,看起来能运行。

Yann Dubois

奶酪,Lucia,它会给我一个新的法语单词。这个游戏其实挺复杂的,我已经输了。抱歉,但我们再试几次,看看GPT-5能呈现出多少种不同的内容。我可以在这里运行代码。哦,等等,这个我不太喜欢,但似乎……哦,似乎我可以切换一下。哦。

MARK CHEN

看那个。

Yann Dubois

哦,不错,这个更好。

Christina Kaplan

我更喜欢这个老鼠游戏。

Yann Dubois

是啊,这个……我不知道,那个看起来不像……嗯,像只老鼠,我们来看看第三个,有时候效果可能不太好。好在有了GPT-5,如果你有不喜欢的地方,你可以让它修改,它会照做的。我们来看看这个。哦,不错。还要说一点,GPT-5真的很喜欢紫色,所以你会经常看到紫色。

Elaine Ya Le

没关系,紫色是我最喜欢的颜色。

Yann Dubois

太好了,那你会喜欢GPT-5的。正如我们所看到的,在几分钟内,GPT-5就为我们和我的伴侣构建了几个学习法语的演示。GPT-5确实为“氛围编程”打开了一个全新的世界。正如我们所看到的,可能会有一些小瑕疵。但好在你可以让GPT-5来修复它们。GPT-5真的把编写美观且高效代码的能力带给了每个人。我已经迫不及待地想看看人们用它能创造出什么了,但在那之前……

MARK CHEN

回到你这儿,马克。非常感谢蒂娜,非常感谢伊莱恩,非常感谢简。我们已经取得了很大的进步,从以前只能运行5到10行代码的时代到现在,能按需生成这样的应用程序,太令人惊叹了。我们让ChatGPT-5变得更智能、更强大、更快了。但我们也在努力增强一些现有功能。下面由阿罗什和克里斯蒂娜·卡普兰来谈谈这些功能。罗根来自我们的多模态研究团队,他要介绍一项功能,即语音功能。谢谢你,马克。

Ruochen Wang

在过去的一年里,我们一直在稳步改进语音功能,使其对所有人都更有用。首先,它的声音非常自然,就像在和真人说话一样。其次,我们增加了视频功能,这样它在和你聊天时就能“看到”你所看到的东西。第三,它还能在对话过程中流畅地进行语言翻译。但今天,我们要做一件特别的事,就是把我们最好的语音体验带给所有人。免费用户现在可以聊几个小时,付费订阅用户则可以几乎无限制地使用,而且语音功能也适用于自定义GPT,Plus订阅用户现在可以完全根据自己的需求定制语音体验。它会严格遵循你的指示。我们来试个有趣的。

MARK CHEN

很期待。

Ruochen Wang

我可以让语音模型给我一个全面的答案、一个简洁的答案,甚至只是一个词。“嘿,Chat,能不能请你只用一个词回答我,就现在。”

GPT-5

当然可以。好的。

Ruochen Wang

描述一下《傲慢与偏见》的情节。

GPT-5

爱情。

Ruochen Wang

给我一句名言警句。

GPT-5

耐心。

Ruochen Wang

太棒了,这是我们语音模型给出的智慧之言,我想它是在说,感谢大家耐心等待GPT-5的发布。现在我们来做点更实用的。 学习是我们语音模型的一个主要使用场景。人们喜欢用它深入研究话题、考前复习,或者学习新语言。我最近一直在学韩语,我发现说韩语和理解韩语非常有挑战性,但我们来看看语音功能如何提供帮助。我要开启这个“学习模式”,这是我们在ChatGPT中推出的一个新功能,它会一步一步引导你更深入地理解一个主题。

现在我们可以进入语音模式了。“嘿,Chat,我在学韩语,你能帮我练习一下吗?假设我现在在咖啡馆点餐,我应该用韩语怎么说?”

GPT-5当然,我很乐意帮你练习。如果你在咖啡馆,想简单点说,你可以这样开头:“아메리카노 하나 주세요”,意思是“你好,我想要一杯美式咖啡,谢谢”。当然,你可以根据你想点的东西进行调整。如果你想尝试更多短语,告诉我一声。

Ruochen Wang

说到韩语,你能把那部分说得慢一点吗?因为我是初学者,想清楚地听到每个单词。

GPT-5

好的。

Ruochen Wang

现在我们升级一下难度。你能说得非常非常快吗?比韩国人说得还快?

GPT-5

好的,我会尽可能加快速度,听起来会是这样:“아메리카노 하나 주세요”,基本上就是飞快地说出来。如果你需要调整速度,告诉我。

Ruochen Wang

这就是语音功能。比以往更简单、更智能、更强大。我们已经迫不及待地想让你体验了。

MARK CHEN

是的,它听起来比我们一年前在四小时演示中展示的语音自然多了。太棒了。

所以今天我们还要宣布一项新功能以及一系列功能,这些功能将使ChatGPT更具个性化,更像“你的”人工智能。首先是一个简单又有趣的功能。我们现在允许你自定义聊天的颜色,其中有几个选项是专为付费订阅用户提供的。我们还将推出“个性”功能的研究预览版。你现在可以改变ChatGPT的个性,让它更具支持性、更专业简洁,或者甚至带点讽刺意味。这让你能以符合自己沟通风格的方式与ChatGPT互动。但ChatGPT的声音和外观只是让它更像“你的”人工智能的一部分。 在过去一年里,我们推出的功能中,我最喜欢的一个就是记忆功能,从那以后,我们对记忆功能进行了很多改进。这让ChatGPT能够了解你。下面由CHRISTINA来详细谈谈记忆功能。

CHRISTINA KAPLAN

看到大家对ChatGPT的记忆功能以及它能逐渐了解你做出的反应和回应,真是太棒了。我们对ChatGPT的期望是,它能理解对你有意义的事情,从而帮助你实现人生目标。ChatGPT已经帮了我很大的忙。

我现在正在为马拉松训练,ChatGPT正在帮我制定个性化的跑步计划,但ChatGPT仍然有很多局限性。它不了解我下周的实际日程安排。但这种情况即将改变,从专业用户开始,然后是Plus用户、团队用户和企业用户,我们将让ChatGPT能够访问Gmail和谷歌日历。

我来给大家展示一下我是如何使用它的。我会问一个简单的问题,比如“帮我规划一下明天的日程”。这一周我一直很忙,所以这一周我每天都用它来整理我的生活。 我已经授权ChatGPT访问我的Gmail和谷歌日历,所以它马上就能用了。很简单。但如果你还没有授权,ChatGPT会让你进行连接,对吧?现在,我们来看看ChatGPT在做什么。

CHRISTINA KAPLAN

太快了。好的,ChatGPT已经调取了我明天的日程,而且,甚至不用我问,它就为我安排了跑步的时间。

MARK CHEN

我觉得我没有被邀请参加发布庆典。

CHRISTINA KAPLAN

我们会把你加进去的,会把你加进去的。ChatGPT发现了一封我两天前没有回复的邮件。我之后会处理的,它还根据它知道的我喜欢带的东西,为我明天晚上的夜航班机整理了一份行李清单。看到随着GPT-5能力的增强,ChatGPT变得更有用、更个性化,真是太棒了。我们非常期待大家下周能尝试一下。

MARK CHEN

非常感谢,谢谢,太好了。我们已经了解了一些我们增强的功能。下面由萨奇和泽布来谈谈ChatGPT背后的研究以及为使其更易于部署而做的安全工作。

Saachi Jain

谢谢mark。大家好,我是Saachi ,负责OpenAI的安全训练团队。除了减少幻觉之外,我们还花了大量时间来减少欺骗行为。也就是模型可能会向用户歪曲其行为,或者在任务成功与否上撒谎,尤其是在任务描述不充分、不可能完成或缺乏关键工具的情况下,更容易出现这种情况。我们发现,GPT-5的欺骗性明显低于O3和O4 mini。 我们还彻底改革了安全训练的方式。我们以前的模型,在看到用户的提示后,会决定要么完全拒绝,要么完全服从。这在大多数情况下都很有效,但可能会有措辞巧妙的提示蒙混过关,或者有些敏感但合理的问题会被完全拒绝。举个例子,我们来看看这个提示。

这个提示是关于一个用户询问点燃发热剂的技术细节,发热剂是一种常用于烟花的材料。这个提示具有双重用途。这个用户可能只是想搭建7月4日的烟花表演,也可能想利用这些信息造成伤害。对于这样的提示,O3过度关注意图,正如大家所看到的,这个提示的表述相对中立,且包含很多技术细节。所以我们可以看到O3完全服从了这个提示。但是,如果我们把同样的问题用更明确的方式表述,让用户的意图一目了然,O3就会完全拒绝,即使我们询问的是完全相同的信息。

对于GPT-5,我们完全改变了这种方法,我们引入了一种我们称之为“安全完成”的功能。 “安全完成”的要点是,它不评判用户的提示,而是在安全约束范围内尽可能提供帮助。这可能意味着部分回答问题,或者只在较高层面上回答。如果我们不得不拒绝,我们会告诉你拒绝的原因,并提供有用的替代方案,帮助让对话朝着更安全的方向发展。我们来看看之前O3完全服从的那个技术提示。

GPT-5会向用户解释为什么我们不能直接帮助他们点燃发热剂。然后引导用户查阅安全指南,以及如果他们想安全操作,应该查看制造商手册的哪些部分。

总的来说,GPT-5能更好地处理棘手的双重用途场景。用户会更少看到“抱歉,我无法协助你”这样的回复,这也打造了一个更稳健的安全系统。这是朝着更安全、更可靠、更有用的人工智能迈出的一大步。Sebastien。

Sebastien Bubeck

谢谢Saachi。有了GPT-5,我们正在尝试一系列新的训练技术,这些技术最大限度地利用了我们上一代的模型。如今,前沿模型不仅消耗数据,还帮助创造数据。我们使用OpenAI的O3精心设计了高质量的合成课程,以原始网络根本无法实现的方式向GPT-5教授复杂主题。 最近在行业内,合成数据被频繁提及。它通常被视为一种获取更多数据的廉价方式。然而,我们的突破不仅仅是创造更多的数据,而是创造合适的数据,这些数据的形式是为了教学,而不仅仅是填充空间。几代模型之间的这种互动预示着一个递归的自我改进循环,即上一代模型在改进数据和为下一代模型生成训练内容方面发挥着越来越大的作用。

在OpenAI,我们已经破解了预训练、推理的密码,现在我们看到它们之间的互动显著加深。未来的人工智能系统将远远超越我们目前所习惯的预训练和后训练流程,我们现在就在这里见证这一进程的第一步。我们迫不及待地想看看扩大这一系列新技术的规模在不久的将来会产生什么成果。

MARK CHEN

非常感谢你们俩,你们的工作真的令人印象深刻,谢谢。我们还有最后一项功能想重点介绍,那就是在健康领域的功能。下面由山姆来介绍这项功能。

Sam Altman

ChatGPT最主要的使用场景之一就是健康领域。人们经常使用它。大家都见过这样的例子,人们通过它获得日常护理建议,有时甚至是挽救生命的诊断。GPT-5是迄今为止在健康领域表现最好的模型,它让你能更好地掌控自己的医疗健康之旅。我们在GPT-5的研发中确实优先改进了这方面,在Health Bench评估中,它的得分高于以往任何模型,这项评估是我们与250位医生合作针对现实世界任务设计的。为了谈论这个,我想邀请我的同事Felipe和他的妻子CAROLINA 来分享他们的医疗健康之旅。非常感谢你们的到来。

首先,你们能给我们讲讲你们的医疗健康之旅吗?

CAROLINA MILLON

去年10月,我们的生活彻底被颠覆了,39岁的我在一周内被诊断出患有三种不同的癌症,包括一种侵袭性乳腺癌。没有任何事情能让你做好准备去接受这样的消息。 我是在收到一封电子邮件通知,说我的活检结果出来了的时候,得知第一个诊断结果的。我决定打开它。当我打开时,在报告中我只能看懂两个词:浸润性爱挣。我知道情况不妙,但其他内容全是模糊的医学术语。所以我完全慌了神,在那一刻,我做的第一件事就是把报告截图,然后放进ChatGPT,看看它能不能帮我理解这是什么意思。几秒钟内,它就把这份复杂的报告翻译成了我能理解的通俗语言。在那种不知所措和恐慌的时刻,我对正在发生的事情有了一点清晰的认识。这个时刻真的很重要,因为当我联系上医生并通上电话时,已经是我看到报告三个小时后了,而我已经对自己面临的情况有了一个基本的了解。 我们能够直接进入下一步该怎么做的讨论。

Sam altman:

那在整个过程中,你们是如何使用ChatGPT的呢?

CAROLINA MILLON

我在旅程的很多方面都用到了它。我发现它最强大的地方之一是帮助我做出关键决策,并帮助我为自己发声。举个例子,当我面临是否要接受放疗作为治疗一部分的决定时,医生们自己也意见不一。 我的情况很特殊,在正确的治疗方案上没有医学共识。所以专家们把决定权交回给了我这个患者。对我来说,承担这个可能会对我和家人产生终身影响的决定,感觉压力很大。我觉得自己没有能力做出这个决定。所以我求助于ChatGPT,以获取知识并理解我病情的细微差别。几分钟内,它就给了我一个详细的分析,不仅与医生已经告诉我们的内容相符,而且比30分钟的咨询所能涵盖的内容要全面得多。 它还更进一步。它帮助我权衡利弊,理解风险和益处。最终,它帮助我做出了一个我认为是基于充分信息的决定,在我和家人面临如此高风险的情况下,我能够坚持这个决定。

Felipe Millon

对我来说,看到她在这个时刻通过使用ChatGPT重新获得主动权,真的很令人鼓舞。人很容易感到无助,医生所知道的和我们所知道的之间存在巨大的知识差距。然而,没有人比卡罗更关心她自己的健康。所以我很高兴看到她真正赋予自己权力,获取知识,并成为自己护理旅程中的积极参与者。

CAROLINA MILLON

我认为有一点非常值得强调。我认为人工智能在医疗健康领域的前景不仅在于突破性的发现或更好的诊断。我认为在于培养更聪明、更有能力的患者,让他们能够充分参与其中,为自己和自己的护理发声。

Sam Altman

说到这个,你们已经测试过GPT-5了,感觉怎么样?

CAROLINA MILLON

我对GPT-5及其功能感到非常震惊。

首先让我印象深刻的是它的速度。快得都有点让人担心了。

Sam Altman

比如,你确定它经过深思熟虑了吗?

CAROLINA MILLON

你觉得它思考的时间够长了,但它非常全面,更重要的是,它更像是一个能把各种信息联系起来的思考伙伴。它不只是翻译信息或给出答案,而是真正帮助你解决问题。

Felipe Millon

一个很好的例子是,我们把最初的活检提示输入到GPT-5中。GPT-4已经做得很好了,它进行了翻译,解释了这些词的意思,以我们能理解的方式提供了帮助。但GPT-5似乎更理解上下文和问题背后的问题,比如,我们为什么要问活检结果?所以它会说,好吧,这是目前还没有的信息。这些是尚未出来的结果,你需要去询问。这些是你在和医生交谈时可能想要问的问题。所以它真的开始勾勒出一个完整的个性化图景。 这真的激励了我们。大家可以看到在基准测试中所有令人惊叹的改进。

但真正有用的是,这个工具现在就可以使用,卡罗和我今天来到这里,如此热情地分享我们的故事,是为了今天即将收到这样诊断的人。那些正在经历类似癌症诊断或其他疾病诊断的家庭,将面临他们一生中最具挑战性的决定。真正激励我的是,他们将获得比我们8个月前更好的工具和支持。

Sam altman

我们也为此感到无比兴奋。非常感谢你们来分享你们的故事。我们很高兴ChatGPT能对你们有所帮助,也希望这个新版本能真正帮助到很多人。祝你们一切都好。谢谢你们,接下来我要把话筒交给我们的总裁Greg Brockman。

Greg Brockman

软件工程已经从根本上发生了变化,GPT-5将加速这场革命。 我们在2021年发布了第一个优化编程的模型,并在类似这样的直播中演示了我们所说的“氛围编程”。如今,第一次,你可以和模型对话,让它做一个小应用程序,比如一个小游戏,游戏中的一个小功能,它真的能做到。我还记得看到这个模型有能力做到这一点时,我非常震惊。你会意识到我们必须看看它能发展到什么程度。这就是计算机所能实现的前景,你可以和它们对话,它们真的能按你的要求去做。它们真的能扩大你所能完成的事情的范围,扩大你所能提供的东西的范围,不仅是为了你自己的利益,更是为了整个世界。

今年,我们已经发布了像GPT-4.1和O3这样优秀的编程模型,但GPT-5树立了一个全新的标准。

它是处理AIC编程任务最好的模型,你可以让它去完成一些非常复杂的事情,它会全力以赴去做。它会调用很多工具,会花很多时间去做,有时甚至更长时间,只为了完成你的目标、你的指令、你的任务,无论你想构建什么。它在前端方面非常出色,能制作出非常精美的可视化效果和交互式游戏,到目前为止,大家在直播中已经看到了一些,接下来还会看到更多,但看到你想象的任何东西都能变成现实,真的很令人惊叹。

它非常擅长遵循指令,无论是非常详细的指令,当你描述得很模糊时能推断出你的意图,还是当你描述得非常详细时能准确遵循。而且它完成这些任务的速度非常快。再次强调,它会花恰到好处的时间来完成你面前的任何任务。 但我们不仅让开发者能用它来编写自己的代码,还让他们能用它来构建新颖的应用程序。所以我们把它整合到了API中。下面由Michelle来谈谈这个。

Michelle Pokrass,

大家好,我是Michelle,领导一个专注于为高级用户改进模型的后训练研究团队。这包括指令遵循和编程等使用场景。

今天我非常兴奋地告诉大家,我们将在API中推出3个最先进的推理模型:GPT-5、GPT-5 mini和GPT-5 Nano,这三个模型正好符合成本-延迟曲线。所以你可以为你的应用程序选择合适的模型。我们还首次推出了一个新的推理努力参数选项,称为“最小”。这样你就可以使用这些推理模型,但只需最小的推理量,以便它们能适用于速度最快、对延迟最敏感的应用程序。所以现在你实际上不必在多个模型之间做选择了。你可以将GPT-5用于所有使用场景,只需调整推理努力程度即可。

API还将推出一些新功能。第一个是“自定义工具”。过去,我们所有的函数调用都要求模型将输出包装在JSON中。当模型需要输出几个参数时,这非常有效。但有时开发者会把我们的模型用到极致,他们的工具调用有极长的参数,模型要在100行代码中正确处理JSON中的控制字符,可能会更具挑战性。这就是为什么“自定义工具”是自由格式的纯文本。非常酷的是,我们正在发布结构化输出的扩展,你可以提供一个正则表达式,甚至一个无上下文语法,并将模型的输出限制在该范围内。如果你想提供一个自定义的领域特定语言,如果你有自己的SQL分支,并指定模型始终遵循该格式,这将非常有用。

我们还推出了一个名为“序言”的工具。这是指模型在调用工具之前,能够先解释它将要做什么。这并不是什么全新的功能,但O3没有这个能力,而在GPT-5中,它的可引导性得到了极大的增强。模型能够非常有效地遵循关于这些序言的指令。你可以让模型在每次调用工具前都给出序言,或者只在有重要事情要发生时给出,或者根本不给出。

接下来,我们将推出一个“冗长程度”参数。我们其实早就想在API中加入这个功能了,现在你可以将冗长程度设置为低、中、高,以控制模型输出的简洁或详尽程度。 GPT-5在Suite Bench(衡量Python编程能力的基准)上是最先进的编程模型。GPT-5创下了74.9%的新高,而O3在该基准上的得分是69.1%。在Aer polyglot(涵盖各种编程语言而不仅仅是Python的基准)上,GPT-5的得分是88%,明显高于O3。 大家也看到了,它在前端web开发方面非常出色。我们让人类训练师比较GPT-5和O3的输出,并选择他们更喜欢的,70%的情况下他们会选择GPT-5,因为它的美学更好,而且整体功能也更出色。但GPT-5不仅仅用于编程。它在智能工具调用方面也非常出色。它是工具调用方面最先进的模型。我们在新的tau squared基准上看到了这一点。这个基准是两个月前发布的,用于测试模型调用工具并与用户合作解决挑战性问题的能力,在这个案例中是在电信行业。

为了解决用户服务无法使用的问题,就在两个月前,该领域没有任何模型的得分超过49%,而今天GPT-5的得分是97%。 GPT-5在通用指令遵循方面也是最先进的,它在Colli上的得分是99%,这对我们的这个基准来说是一个巨大的突破。它在Scale的多挑战基准上的得分是70%,比O3高出10分,这是衡量多轮指令遵循能力的指标。最后,我个人最喜欢的指令遵循评估是我们内部构建的一个。它基于真实的API使用场景,因此,它能很好地衡量GPT-5在你的应用程序中的表现。在这个评估的困难子集上,GPT-5的得分是64%,高于O3的47%,这是一个相当显著的改进。所以我们认为它在你的应用程序中会表现得相当出色。

我们还将在API中为GPT-5提供更长的上下文窗口。它现在的总上下文是400K,高于O3的200K。但仅仅发布更长的上下文窗口是不够的。我们希望让它更有效、更易用。GPT-5在128K、256K的OpenAI Mr CR上是最先进的,这是我们两个月前开源的一个衡量长上下文检索能力的基准。它在OpenAI的图遍历Bfs基准上也是最先进的,这是衡量模型对长上下文输入进行推理能力的指标。这是该模型推理能力和更长上下文的完美结合。我们还开源了一个新的长上下文评估工具,叫做Browse comp长上下文,用于衡量模型在长上下文下回答挑战性问题的能力。 我们很高兴能推动这个领域的更多工作。

我们认为GPT-5是最适合开发者的模型。它的训练重点是现实世界的实用性,而不是基准测试,但我们在这个过程中恰好也在一些基准测试中取得了不错的成绩。我们非常注重工程和研究的结合,我们认为你会非常喜欢使用这个模型。

Image

Greg Brockman

正如Michelle所说,基准测试的数字很令人兴奋,我们开始逐渐达到饱和。比如,当你在某个基准测试中从98%提升到99%时,这意味着你需要其他东西来真正体现这个模型的卓越之处。我们在这个模型上做的一个非常不同的事情是,不仅仅关注这些数字,而是真正关注现实世界的应用,以及它在你的日常工作流程中对你是否真的有用。所以听别人说远不如亲眼所见令人兴奋。为了向大家展示这个模型的实际应用,我想邀请阿迪和布莱恩上台。

Brian Fioca

我是Brian,是初创公司团队的解决方案架构师。

Adi Ganesh

我是Adi,是后训练团队的研究员。

Brian Fioca

要重现理想的结对编程,你需要一个既懂最佳软件工程实践,又有合适性格的模型。对于GPT-5,我们付出了巨大的努力,让这个模型从一开始就能完美地与你搭档。

我来展示一下在Cursor中GPT-5的这个行为,向大家展示我们教给它的东西。上个月我在另一个直播中,快结束时遇到了一个bug,我当时掩盖过去了,后来我想让GPT-3帮我修复,但它做不到。所以在我们这次测试GPT-5之前,我必须看看它能不能帮我修复那个bug,而且为了挑战一下,我要在台上演示。

Greg Brockman

好吧,希望比O3运气好。

Brian Fioca

这不仅仅是关于修复bug,更重要的是模型在这个过程中的行为。你马上就会看到,它会先告诉你它的计划。它会告诉你它要如何寻找bug,可能会如何修复。这种沟通在编程过程中能建立信任,如果你需要,还能让你进行调整,但你可能不需要。

Adi Ganesh

我喜欢它会给你更新,比如它说要搜索,然后就一直在搜索。

Brian Fioca

是的,它搜索得比我快。它使用的最佳实践和我在寻找bug时使用的一样,但作为开发者,它比我强大得多。

Greg Brockman

你自己尝试过修复这个bug吗……

Brian Fioca

试过,我没修好,我当时很忙。好了,继续,它好像开始弄清楚问题出在哪里了。它会大致弄明白的。在它修复的时候,我来告诉大家我们是如何训练GPT-5有这样的行为的。我们首先与用户和客户交流,了解我们的模型在最流行的编程工具(比如Cursor)中的表现。

我们找出了一些令人沮丧的地方和不足之处,然后将其归结为四个性格特征:自主性、协作性、沟通能力、上下文管理能力和测试能力。我们将这些特征转化为一个评分标准,用来塑造模型的行为,然后不断调整,直到在使用时感觉它像一个协作的队友。

Greg Brockman

看到团队真正深入研究这个模型在实际应用中的表现,弄清楚人们真正想要的是什么,并将其反馈到模型训练中,真是太令人惊叹了。我认为这是这个模型的一个真正的重点。

Brian Fioca

真的很棒。在测试期间,有一件事真的很令人惊讶,我们当时时间很紧迫,不得不重构我们的一个测试工具,让它在Docker上并行运行,我们启动后,过了大约45分钟回来,它就已经完成了,我们测试了一下,第一次就运行成功了。真的很令人惊讶。

Adi Ganesh

太不可思议了。

Greg Brockman

太神奇了。

Brian Fioca

好了,它已经做了修改,看起来是这样。是的,它找到了正确的问题。现在它实际上正在运行Lins,但这些链接与这个bug无关,所以它会忽略它们,然后它会运行构建,运行测试(如果有的话),确保代码可以发布后才会结束。

Adi Ganesh

它真的很聪明,能发现这些链接,并且意识到它们与我们要修复的特定bug无关。它不会做不必要的修改。

Brian Fioca

完全正确,这只是一个例子,但它确实展示了自主性和协作性沟通的力量,以及它在困难的编程任务中保持可靠性而不陷入死循环的能力。最棒的是,GPT-5是完全可调整的。你可以通过系统提示或cursor规则来引导它,你可以改变它的冗长程度或推理程度以匹配你的任务,如果你遇到困难,问问它就行。

GPT-5实际上非常擅长通过元提示来修改自己的提示。在过去几周使用它之后,我真的觉得我们在最复杂的编程任务上实现了最先进的零样本性能和可靠性。对我来说,这是我第一次信任一个模型来做我最重要的工作。这不仅仅是“氛围编程”,这是一个非常强大的工具,我真的很兴奋让大家尝试一下。

Adi Ganesh

谢谢Brian 恩。看到GPT-5在编程、个性和可引导性方面取得的进步,真是太令人兴奋了。我很想展示一下GPT-5在前端编程方面的出色表现,在这个领域,设计和美学真的很重要。

今天我有两个演示,一个是工作方面的,一个是娱乐方面的。 我们先从工作的例子开始。想象一下你是一家初创公司的首席财务官。我有一些关于公司的数据想要可视化,我要让模型给我做一个仪表盘。大家可以看到,我明确说明了受众。目标受众是首席财务官,所以我说“为我的初创公司创建一个财务仪表盘”。我要求它美观、设计得体、具有一定的交互性,并且有清晰的层次结构,以便于关注重要内容。我还指定了它应该使用的框架。大家可以看到,它已经开始了。它遵循我的指示,使用Create next app来制作一个next JS项目。 B

rian Fioca

完全是从头开始。

Adi Ganesh

是的。

Greg Brockman

说真的,你觉得这种任务你自己做需要多长时间?

Adi Ganesh

至少需要几天。我不是前端专家,光是了解最新的框架并把所有东西整合起来就至少要花我几天时间。

Greg Brockman

我们来看看模型需要多长时间。

Adi Ganesh

是的,看到模型思考了一会儿,然后解释它将如何构建这个项目,真的很酷。它说它将搭建一个新的next JS应用程序,使用Tailwind CSS,它正在运行几个命令来安装依赖项,这很棒。现在它正在继续实现项目的其他部分。

在它运行的时候,我来谈谈我们是如何训练GPT-5成为一个优秀的前端编程模型的。我们试图遵循这样的原则:默认情况下赋予它良好的美学感,但同时也要让它具有可引导性。所以如果我给模型一个简洁的提示,它应该能够推断出我的意图,并默认做出看起来很棒的东西。另一方面,如果你明确指定了你想要的布局或模型应该使用的框架,它应该准确地遵循你的指示,这对开发者来说是两全其美的。我们还训练GPT-5比以前的模型更具智能性。所以如果你给它一个像这样的任务,它会进行一系列的推理和工具调用,然后着手构建既有抱负又连贯的代码。

Brian Fioca

我喜欢你说的“有抱负”,因为这意味着它会超越预期,但又不会偏离你指定的内容。

Adi Ganesh

完全正确,我们希望模型既能遵循提示,又能在它认为可以的情况下超越预期。我们来看看进度。模型似乎正在取得进展。它正在创建一个Readme文件。是的,它在考虑如何使代码模块化。看,它创建了一个柱状图组件,看起来还在继续。

Greg Brockman

我喜欢它不只是写代码,还真的会考虑适当的抽象和文档,以及它所做事情的整个生命周期……

Adi Ganesh

是的,完全正确,它不只是像在Suite Bench中那样写代码,还会对代码进行说明,解释它在做什么……

Adi Ganesh

看看进展如何。在运行的时候,GPT-5比以前的模型更能理解细节,所以在训练模型时,我们教它理解排版、颜色和间距等细节,其理解程度远远超过我们之前发布的任何模型。我记得用旧模型的时候,你必须写非常具体的提示才能让它按你的要求去做,但GPT-5默认就能给你很好的结果。

Brian Fioca

在测试期间,我们对比了模型不同版本的A和B,看它在用户界面方面是否有所改进。在某个时候,我们自己已经无法分辨了,我们不得不请设计师来教我们如何判断哪个更好。

Adi Ganesh

是的,看到模型的审美偏好在训练过程中不断演变,真的很有趣。有一天我们醒来,发现它已经能做出很棒的用户界面了。

Greg Brockman

模型的审美偏好和你自己的相比如何?

Adi Ganesh

是的,总的来说,我觉得模型的审美比我好。通常,我会听从它的判断,当我想做一个应用程序但又不确定想要什么样的外观时,这真的很有帮助,而模型的默认设置就很棒。是的,我们来看看进度。大家可以看到,模型实际上已经把代码结构化成了这些不同的组件。它制作了一个样本数据TypeScript文件、KPI卡片组件、收入图表。就像我说的,它非常模块化。它考虑的不仅仅是写代码,而是写高质量的、可以合并的代码。

Adi Ganesh

好的,很酷。太棒了。大家可以看到,它实际上正在构建项目,并将错误反馈给自己,对我来说,看到模型能够编写代码,还能运行构建、反馈错误并迭代代码,这是一个意义深远的时刻。它能够在这种自我改进的循环中改进自己的代码,这很有趣。

Greg Brockman

这无疑也让我们对未来有了很好的展望,当你真正思考这些模型能走多远,以及它们能在多大程度上加速开发者的工作,在我们所有人共同做的所有事情的各个方面……

Adi Ganesh

完全正确。

Brian Fioca

太好了,它刚刚修复了在之前的构建中发现的一个bug。

Adi Ganesh

很酷,太好了。看起来完成了,我们来看看。我不太懂前端,所以我来看看应该怎么运行,按照指示,进入目录,然后运行npm run dev。我来试一下。看起来它在3001端口上运行。我来打开那个端口。 Greg Brockman 运行起来了。

Adi Ganesh

太好了,太好了,是的,大家可以看到,我们来看看。模型做了一个仪表盘,上面显示了我的RR CA,看起来这家公司做得相当不错。可以看到收入在增长,模型还添加了一些交互功能。如果我把鼠标悬停在图表上,它会显示特定日期的确切数值。

Brian Fioca

我用D3做这个要花5个小时。

Adi Ganesh

想象一下用D3手动做这个。

Greg Brockman

现在,只是因为这太容易了,可能会让人觉得理所当然。你能提醒一下观众,实际的提示是什么样的,完成这个任务需要多少创造力和对意图的理解吗?

Adi Ganesh

太疯狂了。这个提示非常简洁,它能在短短五分钟内就给我一个看起来很漂亮的东西。

Greg Brockman

太神奇了。

Adi Ganesh

是的,它还在这里实现了另一个图表,显示我们的客户情况,它还实现了一个日期选择器,所以我可以按不同的日期进行筛选,并相应地可视化数据。是的,它甚至按客户群体进行了细分,这很酷。这只是一个展示GPT-5强大功能的例子。

Greg Brockman

以后再也没有理由说内部应用程序难看了。完全正确。

Adi Ganesh

我们来看娱乐演示吧。

Greg Brockman

这个已经很有趣了,还有更有趣的。

Adi Ganesh

更有趣的是,我有一个表妹,我想给她做一个游戏。我想做一个包含城堡的3D游戏,大家可以看到我的提示。我来启动它。哦,抱歉。

Greg Brockman

总是会有小插曲。

Adi Ganesh

完全正确,是的。大家可以看到我的提示:创建美丽的城堡。我包含了一些细节,比如要有在城墙上巡逻的人、一些移动的马,我还想要一个小游戏,可以通过点击来戳破气球,并且要有音效。我来在cursor中运行一下。为了节省时间,我来展示一个我已经生成的例子。这是模型制作的美丽城堡。从一个简洁的提示就能做出这样的效果,太神奇了,模型有很好的审美,它做了这个浮石,还做了一个3D城堡。 如果你放大,可以看到很多细节,比如这些在四处走动的卫兵,正在发射的大炮。你想发射大炮吗?当然可以,点击这个按钮。

Greg Brockman

谁不想呢。

Adi Ganesh

来了,你可以发射大炮,你甚至可以和角色聊天。我们跟罗文船长打个招呼。

Brian Fioca

他们还有名字。

Adi Ganesh

有名字,跟商人打个招呼。商人在卖一些东西。“你最喜欢的歌是什么?”“《旗帜与捐赠者的歌谣》。”不错,“给我一些智慧。”“好奇心是多变的。”是的,有道理。

Brian Fioca

小游戏。

Adi Ganesh

大家想试试小游戏吗?

Greg Brockman

当然想,我们来玩小游戏。

Adi Ganesh

点击这个按钮,Greg ,你试试,你可以射这些气球。

Greg Brockman

哦,哇哦,哦不。我不太擅长这个。也许我可以让GPT-5帮我一下。 Adi Ganesh 你射中了一个。

Greg Brockman

我射中一个了。哦,又中了一个。

Brian Fioca

这些是符合历史的气球。

Greg Brockman

我又射中了一个,这个游戏比……等等,有个气球来了。射中了,好吧,我觉得见好就收吧。

Adi Ganesh

很酷,对我来说,使用GPT-5真的很有趣,也意义深远,因为这是我使用过的第一个真正有创造力的模型,我们非常期待看到GPT-5如何激发你的创造力。

Greg Brockman

你们俩的演示太精彩了。现在,我们相信GPT-5是世界上最好的编程模型。别只听我们说,为了更多地了解这个模型以及如何让它真正对开发者有用,我想邀请MICHAEL TRUELL上台,他是Cursor的联合创始人兼首席执行官。

Image

MICHAEL TRUELL

谢谢。

Greg Brockman

很高兴你能来,很荣幸有你在这儿。你第一次使用GPT-5的体验是什么样的?

MICHAEL TRUELL

当我们获得GPT-5的使用权限后,我们就开始在实际工作中使用它。一开始,作为测试,我们让它告诉我们一些关于我们代码库的不明显的问题,几分钟内,它就深入到代码库中,识别出我们用于远程代码执行的一个特定系统,还发现了我们做的一个不明显的架构决策。它还理解我们做出这个架构决策的原因,是为了加强安全性,而这些架构决策和权衡是人类花了几周时间才想出来的。所以从一开始,它对代码库的理解能力就令人惊叹。

Greg Brockman

这真的很棒,不仅仅是写代码,实际上还有读代码和理解代码,软件远不止是代码的生成。

MICHAEL TRUELL

是的,理解是一个重要的前提。

Greg Brockman

GPT-5最让你印象深刻的是什么?

MICHAEL TRUELL

它非常智能,是一个非常聪明的模型,尽管它很聪明,但在真正的结对编程中,它在易用性方面毫不妥协,这意味着它非常快。这也意味着它很有交互性,它很擅长说明自己将要做什么,把问题分解成人类可以理解的子问题,并留下一个你可以介入和回应的推理痕迹。还有一点很棒,不仅仅是你给它一个初始查询,它就去执行,而是在很长的会话中与你合作,你可以让它回溯一些出错的地方,或者让它对代码库做额外的修改。我们要现场展示一下吗?

MICHAEL TRUELL

我们要尝试解决一个bug。这是OpenAI的Python SDK。OpenAI的Python SDK中有很多问题,也有很多已关闭的问题。好的,不错,似乎在通过SDK上传PDF方面有一个问题。

Greg Brockman

这个问题已经开放三周了。

MICHAEL TRUELL

所以这是一个存在了三周的问题。我们来看看能不能解决这个问题。我们要把这个问题粘贴到编辑器中,粘贴到Cursor里,GPT-5会着手解决这个问题。这实际上体现了API中模型的稳健性,为了在Cursor中解决这个问题,它要使用一系列它从未见过的自定义模型和自定义工具,比如从网上获取文本、在整个代码库中搜索。它在使用这些工具和提升结果方面非常稳健和适应。

Greg Brockman

是的,看到它对所做的所有事情都有完整的解释,真的很棒。我想知道,这和你解决这个问题的方式相比怎么样?

MICHAEL TRUELL

它速度非常快。大家可以看到,它制定了一个总体计划,在整个代码库中搜索,开始阅读一些文件,继续搜索,现在它在思考下一步要做什么。现在它已经开始实际解决这个问题,并开始考虑一些代码修改。

Greg Brockman

对于如何在Cursor中充分利用GPT-5,你有什么建议给大家吗?

MICHAEL TRUELL

我建议把它用在实际工作中,GPT-5向真正的结对编程伙伴迈出了一步。所以我建议开始把它当作助手,当作你的日常驱动模型。如果你以前不太使用人工智能来编程,我建议你把一些范围较小的问题交给它,然后和它同步合作。

Greg Brockman

是的,我认为GPT-5在现实世界中表现出色,比如在大型代码库中,作为日常驱动工具,而不仅仅是像这样很酷的一次性应用程序演示,尽管这也很酷,对吧?价值来自于真正在更大的代码库和这些长期存在的应用程序中运行……

MICHAEL TRUELL

代码库非常令人印象深刻。它的可引导性也很令人印象深刻。所以,如果你在初始指令中指定一个漫长而复杂的任务,其中包含很多细微之处,它非常擅长捕捉这些细微之处。如果它走错了路,并且实际运行代码后,或者从你那里得到反馈说它错了,它也非常擅长回溯…… Greg Brockman GPT-5有什么做不到的吗?

MICHAEL TRUELL

哦,我们对计算机使用能力的提升非常期待。例如,奥迪刚刚展示的仪表盘,如果它能运行代码,看到输出,实际上对每一个小部分进行质量保证,然后做出反应,那就太好了。是的,所以期待计算机使用能力的提升,你希望GPT-5在哪些方面变得更好?

Greg Brockman

哦,我认为这是一个很好的方面,在各个维度上进行扩展,对吧?我认为在所有方面都是如此,比如很多DevOps工作和其他与我们今天所认为的软件代码库无关的工作。但你也看到了这些演示,对吧?我们运行它们用了5分钟、10分钟、几个小时,我认为延长这个生命周期,能够持续几天、几周,最终甚至几个月,这是我们期望的最终方向。

MICHAEL TRUELL

所以我们可以看到,它深入到代码库中,发现PDF的MIME类型或MIME类型在通过SDK传输时存在问题。它已经识别出了这一点,并开始进行一些代码修改,它创建了一些新方法,还编辑了一些现有代码。这看起来大致是正确的,很想合并这个PR。

Greg Brockman

我也很想合并。我们在节目结束后就这么做。 发言人1 好的,听起来很棒。

MICHAEL TRUELL

好的,非常感谢你,我们非常高兴GPT-5能与Cursor合作,从今天开始。 发言人1 很高兴能与你们合作。是的,从今天开始,GPT-5是Cursor新用户的默认模型,我们将在未来几天向所有Cursor用户免费开放试用,让大家感受一下这个模型,它是我们尝试过的最智能的编程模型。

Greg Brockman

对企业来说很棒。我们认为它就像你口袋里的主题专家。它是各个领域的专家,无论是法律、金融,无论你想到什么应用场景。为了谈谈GPT-5如何应用于企业,我想邀请Oliver上台。谢谢。

Oliver Godement

谢谢Greg ,大家好。我是Oliver,负责OpenAI的平台。在这一点上,我想大家已经明白了,我们非常关心开发者和编码,但这还不是全部。支持企业和政府对OpenAI的使命至关重要,简而言之,我们希望支持关键行业实现转型,比如医疗健康、教育、能源等行业。

自从我们推出GPT和API以来,已有500万家企业在使用我们的技术。我强调一下,是500万家企业,这些企业不只是玩玩而已,也不只是做实验,它们正在向现实世界推出新的产品,我相信GPT-5在这方面将带来跨越式的发展。

正如Sam之前 所说,口袋里有一位主题专家,这将让每位员工都能做得更多,但我来举几个例子。 首先,我想谈谈生命科学领域。安进是美国的一家公司,致力于设计新的药物,治疗一些最棘手的人类疾病。安进是GPT-5的首批测试者之一,他们在药物设计中使用了它。科学家们发现,GPT-5在处理复杂数据的深度推理方面特别出色,比如分析科学文献或临床数据。接下来,我想谈谈金融领域。BBC是一家跨国银行,总部位于西班牙马德里。BBC一直在使用GPT-5进行金融分析,结论非常明确。在准确性和速度方面,GPT-5击败了目前市场上所有其他模型,以前需要一个职能部门花三周时间完成的工作,GPT-5几个小时就能完成。

接下来,我想谈谈医疗健康领域。奥斯卡是一家总部位于纽约的保险公司,他们一直在使用GPT-5。他们发现,GPT-5是临床推理方面最好的模型,比如将复杂的医疗政策与患者情况相匹配。 这不仅仅与企业有关,也与政府有关。我们对昨天宣布的消息感到非常兴奋,200万美国联邦雇员将能够在ChatGPT中使用GPT-5。我迫不及待地想看到这将如何让他们能更好、更快地为美国人民提供服务。坦率地说,这些都非常酷,但我认为这只是冰山一角。

如果历史可以借鉴,从GPT-4的情况来看,在未来几周和几个月里,我们将看到许多我们所有人都无法想象的新场景出现。我迫不及待地想和大家一起创造这些场景。

我们快速谈谈定价和可用性。GPT-5今天开始在API中可用,有三个模型:GPT-5、GPT-5 mini、GPT-5 nano。GPT-5的定价是每百万输入令牌1.25美元,每百万输出令牌10美元。nano甚至更快、更实惠。nano的价格是GPT-5的1/25,非常酷,我迫不及待地想看看大家会用它构建什么。其他方面,将由我们的同事Jakub进行讲解。

Jakub Pachocki,

在OpenAI,我们致力于理解深度学习这一神奇的技术及其影响。我们的研究旨在了解深度学习的能力,以及如何引导它,使其对我们所有人都安全且有用。这是一项充满激情的工作,也是一项使命。我想感谢OpenAI的团队。能和这群才华横溢、为共同目标而奋斗的人一起工作,是我莫大的荣幸。 像GPT-5这样的模型,是多年研究的结晶,其目的不仅是推出一个伟大的产品,更是为了理解这种底层技术本身。所以,大家在这个模型中看到的很多东西,实际上只是我们认为会有更深远发展的新想法的早期一瞥。还有很多东西我们仍需理解。我们展望未来,人工智能能够揭示关于世界的新知识,并切实地改善我们的生活。希望大家喜欢我们构建的这个模型。我们会继续努力。

图片