关于 GPT-5,你需要知道的一些事
熬夜看了 GPT-5[1] 发布直播,通宵写文章,直到现在才勉强写完。给我最大的感受是 vibe coding 似乎成了大模型主旋律,AI 特有的“渐变式 UI” 也在 ChatGPT 新版界面中具象化了...
这次的发布会雷声大,雨点小,没看到啥直接惊喜,总感觉有点强行发布的意思。可能大部分人都是这个感觉,但别急,一定要看完本文,文中我还参考了一位资深技术大佬对 GPT-5 的测评体验(被 OpenAI 邀请到公司参与内测,所以含金量是很大的),可能会让你对 GPT-5 有新的认识。
为了第一时间用上 GPT-5,我把退订了几个月的 Plus 又续上了。在开始正式介绍前,我们先来玩个有趣的。注:播放视频时,如果听不见声音,可适当调大音量。
体验完这个后,我感觉 ChatGPT 的 UI 交互确实更牛逼了!视频里的节拍器使用这句 Prompt 生成:use beatbot to make a sick beat to celebrate gpt-5。它是从 Sam 的推文看到的,确实有点小震撼,比直播里的代码演示有趣多了!
GPT-5 速览
这次就不贴各种图表了,毕竟直播中的图表都翻车了好几张,大家自行感觉就可以了。总的来说,与 o3 相比,能力整体有所提升。
OpenAI 发布了迄今最强的 AI 系统 —— GPT-5。相比前代,它在编程、数学、写作、健康、视觉感知等多个领域都有跨越式提升,不仅性能先进,还能在需要时快速作答,在复杂问题上深度推理,给出博士级的专家解答。所有用户都可使用 GPT-5,Plus 用户拥有更高用量,Pro 用户则可解锁推理能力更强的 GPT-5 Pro,获得更全面精准的答案。
统一架构与智能路由
GPT-5 将三种能力整合为一体:高效应答模型应对大多数问题;深度推理模型(GPT-5 Thinking)解决高难任务;实时路由器根据对话类型、复杂度、工具需求以及用户明确指令(如“认真想一想”)动态选择模型。路由器会持续从真实信号中学习,包括用户切换模型、偏好反馈和答案正确率,越用越聪明。未来,这些能力将进一步融合为单一模型。
实用性与可靠性升级
在写作、编程、健康三大 ChatGPT 高频场景中,GPT-5 明显减少幻觉、提升指令执行力,并降低过度迎合的倾向。写作上,它能处理结构含糊、需保持文体韵律的作品,也更胜任日常报告、邮件等实用文案;编程方面,前端生成、复杂调试、美学设计都有质的提升;健康领域,它在 HealthBench 高难测试中创下最高分,能主动发现潜在问题、提出提问建议,并结合用户背景提供更安全有用的解读,但不会取代医生。
评测与多模态能力
GPT-5 在数学(AIME 94.6%)、真实代码任务(SWE-bench 74.9%)、多模态理解(MMMU 84.2%)、健康(HealthBench Hard 46.2%)等多项权威基准上创下新高。多模态能力覆盖图像、视频、空间和科学推理,可精准解读图表、演示照片和示意图。内部测试显示,它在经济价值高的知识型任务中,推理表现已能与人类专家持平或更优。
思考效率与事实准确性
GPT-5 在思考时间更短的情况下,也能超越 OpenAI o3,且生成内容更少冗余。开启推理时,它的事实错误率比 GPT-4o 降低约 45%,比 o3 降低约 80%。在开放性事实查询中,幻觉率较 o3 降低六倍。它还能更诚实地反馈任务限制,大幅减少在无法完成任务时虚构结果的比例。
安全性与风格优化
GPT-5 引入“安全补全”机制,替代单一拒绝策略,在双用途或意图不明的情况下,尽量提供安全、有用的部分答案,并明确拒绝原因与替代方案。模型整体减少过度迎合,回复更克制、有思考感。针对用户可控性,新增四种预设人格(玩世不恭者、机器人、倾听者、书呆子),方便快速切换互动风格。
高风险领域防护
在生物与化学高风险领域,GPT-5 Thinking 被设定为高能力模型,配备多层安全堆栈,包括威胁建模、安全补全、实时分类器与推理监控,并经过 5000 小时红队测试,以防潜在滥用。
GPT-5 Pro 与可用性
GPT-5 Pro 取代 o3-pro,具备更长推理链路和更优并行计算,能在健康、科学、数学、编程等高难任务中产出最优答案。在千余真实高价值推理任务中,专家 67.8% 的情况下更倾向选择它。GPT-5 已成为 ChatGPT 默认模型,免费用户将逐步接入,达到用量上限后切换至高性能精简版 GPT-5 mini;Plus、Pro、Team、Enterprise、Edu 用户则可在更高额度下默认使用。
😂 了解此使用容量,方便自行评估是否处于自动降智阶段(查看原文:GPT-5 in ChatGPT[2])。
Plus、Pro、Team:可手动在模型选择器中切换 GPT-5 或 GPT-5 Thinking。Pro 与 Team 用户还可使用 GPT-5 Thinking Pro(更长推理时间,更高复杂任务准确率)。
- Enterprise、Edu:即将上线。
- Free:每 5 小时最多 10 条消息,超限后切换为 mini 版本;每天可用 1 次 GPT-5 Thinking。
- Plus:每 3 小时最多 80 条消息;GPT-5 Thinking 每周最多 200 条。
- Pro、Team:无限使用 GPT-5,须遵守滥用防护和使用条款(禁止批量数据抓取、账号共享、转售等)。
直播回顾
视频链接:Introducing GPT-5[3]直播时长 1 个小时 17 分钟左右,没啥特别亮点,配图还出现严重错误,感兴趣的可以看看这部分。
开场 & 背景
Sam 开场大致介绍了一下 ChatGPT 所取得的成就。
32 个月前,ChatGPT 只是一个新奇的入口;如今每周 7 亿人把它当成默认工作台。OpenAI 在此节点推出 GPT-5:不仅性能大幅跃迁,更把“会想再作答”的推理范式带到所有人手中。若把 GPT-3 比作高中生、GPT-4 像大学生,GPT-5 就是随叫随到的博士级专家,不止能回答,更能替你把事办了——从零写程序、规划活动、管理健康,到帮助你快速学会全新知识,“按需软件”的时代由此成形。
技术 & 能力升级
开“算力盲盒”,成本随机,体验随缘。
这次升级的核心是推理。GPT-5 会在响应前自行“权衡思考深度”,无需你在“快/慢”之间切换,任务复杂就深想,简单就直达。它把能力扩展到更广领域:数学、物理、法律这类高强度推理同样游刃有余。多项权威评测显示其在软件工程、跨语言复杂功能、多模态视觉推理等方面都创下新高,同时在开放式与复杂问题上显著降低“幻觉”,尤其在健康相关场景成为 OpenAI 迄今最可靠的模型。
产品层面,GPT-5 面向所有用户开放:免费、Pro、团队、企业与教育版一视同仁。免费额度耗尽可自动切至 mini(仍在诸多维度领先以往的 o3),而 Pro 用户可启用“扩展思考”模式换取更深入的答案。模型会根据任务自动选路由,既保效率,也保质量。
现场演示 & 个性化
自从知道 vibe coding 喜欢用渐变色设计 UI 后,再也无法忍直视渐变色了...
现场演示把“能想会做”具体化。提问伯努利原理时,GPT-5 不止讲清楚,还自动产出高质量 SVG 动画与可交互代码,按需选择 React、Tailwind 等前端栈,既准确又“好看”。写作上,它不再是模板化的“套话机”,而能把节奏、情感与细腻经历揉进文本。编程上,它能在同一需求下给出多种风格实现,自我检测并修复 Bug,做长链路迭代;甚至把小游戏和语言学习结合起来,用交互把知识“喂进”你的记忆。
伯努利原理(Bernoulli's principle),又称伯努利定律或柏努利定律(Bernoulli's Law),是流体力学中的一个定律,由瑞士流体物理学家丹尼尔·伯努利于 1738 年出版他的理论《Hydrodynamica》,描述流体沿着一条稳定、非黏性、不可压缩的流线移动行为。
用能听懂的话来解释:在流动的液体或气体(统称“流体”)中,速度越快的地方,其自身向四周产生的压力就越小。 这背后是能量守恒定律,流体在加速时,更多的能量转化为了速度(动能),因此其自身的压力能就会减小。最直观的例子就是,当你对着一张纸的上方快速吹气,纸面上方因高速气流会形成一个低压区,而纸张下方压力较大的静止空气便会将其向上托起,飞机机翼也正是利用这个压力差来获得升力的。
眼尖的网友指出 GPT-5 在减少幻觉之后,他们的第一个例子重复了飞机机翼如何产生升力的常见错误(“equal transit theory”),这看起来不太好...
“等时通过理论”:一个广为流传的错误飞行原理
“等时通过理论”(Equal Transit Theory),也被称为“长路径理论”(Longer Path Theory),是一个曾被广泛用于解释飞机机翼如何产生升力的理论。然而,现代空气动力学已经证明,这是一个错误的理论。
该理论的核心观点如下:
- 路径不同,时间相同:当空气流经机翼时,气流在机翼前缘被分为上下两部分。由于大部分机翼的上表面比下表面更凸、路径更长,因此上方的空气必须以更快的速度流过,才能与下方的空气在机翼后缘“同时”汇合。
- 速度越快,压力越小:根据伯努利原理,流速越快的地方,其静压就越小。因此,机翼上表面更快的气流会产生一个比下表面更低的压力区。
- 压力差产生升力:机翼上下表面的这种压力差,形成了一个向上的合力,这就是我们所说的“升力”。
为何“等时通过理论”是错误的?
尽管这个理论听起来简单直观,但它在根本上是错误的,主要原因如下:
- 没有物理定律要求“同时到达”:在物理学中,没有任何基本定律规定被机翼前缘分开的气流必须在后缘同时汇合。这只是一个想当然的假设。
- 实验观测结果不符:通过风洞实验和染色、烟雾等流场显示技术,科学家们发现,流经机翼上表面的空气实际上比“等时通过理论”所预测的速度快得多,并且会更早到达机翼后缘,远远早于下方的气流。
- 无法解释多种现象:该理论无法解释为什么对称翼型(上下表面路径长度相同)在有一定迎角时也能产生升力,也无法解释飞机为何能够倒飞,因为在倒飞状态下,原本较长的上表面变成了较短的下表面。此外,像纸飞机那样的平板翼也能产生升力,这同样无法用该理论解释。
正确的升力解释
现代空气动力学认为,升力的产生是一个更复杂的现象,主要基于以下两个相互关联的物理原理:
- 牛顿第三定律(作用力与反作用力):机翼的设计(尤其是其迎角)使得它能够将流经的空气向下偏转或“推”下去。根据牛顿第三定律,空气会给机翼一个大小相等、方向相反的反作用力,这个向上的力就是升力。空气被加速向下,就意味着机翼被推向上了。
- 伯努利原理与流体连续性(正确的应用):虽然“等时通过理论”错误地应用了伯努利原理,但该原理本身对于解释升力仍然至关重要。机翼的形状和迎角迫使上方的气流加速。这种加速并非为了“追赶”下方的气流,而是流体在绕过障碍物时速度和压力相互作用的自然结果。机翼上方的曲面和流体的“康达效应”(Coandă effect)共同作用,引导气流沿曲面流动并加速。这种加速确实导致了上表面压力降低,从而产生压力差和升力。更准确的描述涉及到“环量”(Circulation)和库塔-茹科夫斯基定理(Kutta-Joukowski theorem)等更为专业的空气动力学概念。
总而言之,“等时通过理论”是一个为了简化升力原理而产生的、具有误导性的“故事”。虽然它在一些入门级的科普或教学中可能仍有出现,但它并不能准确地描述升力产生的物理实质。正确的解释是基于空气被向下偏转所产生的反作用力,以及机翼上下表面真实的压力差。
安全 & 可控
语音与多模态也更自然可控。它能自由切换语言,按你的偏好调节风格与详略:一句话、简洁版或详细讲解,随你选择;辅导韩语点单时还能调速、复读、解释。它会记住你的沟通习惯与历史偏好,并与 Gmail、Google 日历等日常工具衔接,自动整理邮件、生成清单、排布日程,像一个长期磨合的个人助理。
医疗
安全与训练方法同样是重点。GPT-5 通过“安全补全”机制,在敏感或双用途请求上提供高层次建议、解释拒绝原因,并引导查阅安全资料,不再是粗暴的要么放行要么一刀切。训练上,团队以高质量合成数据构建“递归自我提升”的闭环,更重数据的结构与教学价值,而非一味堆量。
在医疗健康里,GPT-5 直接把复杂报告翻译成患者听得懂的话,帮助理解病情、比较治疗方案、准备与医生沟通的问题清单;它提供更细致的决策考量与情感支持,让患者从被动接受变成主动参与者。真实案例显示,这种“知识 + 信心”的提升能改变就医体验。
编程 & API
整场直播有一半多时间都是和开发者相关的内容,而和开发者相关的内容基本都是 vibe coding,真没啥可聊的...
对开发者与企业,GPT-5 给出更长上下文(最高约 40 万 tokens)、更稳的长文检索与推理,并支持更灵活的工具调用、语法/正则约束、调用前置说明与输出冗长度控制。模型家族覆盖 GPT-5、Mini、Nano,多维度在时延、成本与推理深度间自适应权衡。价格上,GPT-5 约 $1.25/百万输入 tokens、$10/百万输出 tokens;Mini/Nano 更快更省,Nano 相比 GPT-5 便宜可达 25 倍。
API 价格还挺实惠的,比 Claude 4.1 便宜不少。
企业落地
行业落地正在加速:生命科学用它做药物设计与文献推断,金融把原需数周的分析压缩到数小时,保险在政策与患者条件匹配上提效,政府部门也将用它提升公共服务。它不再是“单点神器”,而是贯穿流程的智能底座。
愿景 & 结语
最后,OpenAI 强调探索深度学习极限与安全边界的长期愿景。首席科学家 Jakub Pachocki 将 GPT-5 视作多年研究的结晶与新起点:模型将继续自我进化,帮助每个人拥有一个可依赖、可托付、能改变行业工作方式的超级助手。
GPT-5 实测
这部分内容整理自 Theo Rants 的实测,他分享了一些关键数据,或许可以带你从侧面了解 GPT-5。视频链接:So I've had gpt-5 for a bit now...[4]。
Theo 在视频开场坦言,自己早在公开前就获得了 GPT-5 全量 API 的访问权限,并受邀前往 OpenAI 总部参加内部演示。官方不仅鼓励他用“最苛刻”的方式进行基准测试,还提供了无限调用额度。他也承认这种“试用福利”可能带来偏差,但评价力求客观。
SkateBench:从 70 分到满分
Theo 自制的 SkateBench 基准专测滑板动作识别。此前最强模型仅能得 70 分左右,o3 pro 跑出 93-94 分已令他吃惊,而 GPT-5 在现场直接接近满分,中国同类模型甚至还不到 5 分。本地复测也保持 98.6% 高正确率,仅在分辨 inward heel 与 varial heel 时出过一次错。即便是 mini、nano 子版本,也远高于 gpt-4o 水准。一句话总结就是:GPT-5 在“主动曝光”场景几乎 100% 报告,在“温和执行”场景从不越界,对系统提示极为敏感。
CLI 工具链与“同事感”
他让 GPT-5 用 React[5] + Ink[6] 一次生成可视化 CLI,并借助工具调用机制自动拆解任务、生成待办、解释调用原因。代码生成、修改到缓存逻辑修复几乎一次到位,展现了前所未有的大规模代码重构能力。与早期需要反复提示的模型不同,GPT-5 更像一位“勤奋可靠的同事”,直接执行而无需过多引导。开发命令行 UI 会比单纯的 HTML 开发复杂,所以 GPT-5 的能力可能远比我们所了解的要强上许多。
Ink 是一个用 React 构建命令行界面的开源框架,由 Vadim Demedes 开发。它的核心理念是把 CLI 应用的 UI 抽象成 React 组件,让开发者可以用熟悉的 React API(JSX、组件状态、生命周期等)来绘制和管理命令行交互,而不用直接操作底层的 process.stdout 或 ANSI 控制码。
代码示例:
import React, { useState, useEffect } from 'react';
import { render, Text } from 'ink';
const Counter = () => {
const [counter, setCounter] = useState(0);
useEffect(() => {
const timer = setInterval(() => {
setCounter(previousCounter => previousCounter + 1);
}, 100);
return() => {
clearInterval(timer);
};
}, []);
return <Textcolor="green">{counter} tests passed</Text>;
};
render(<Counter />);
在以下代码场景测试中,claude-4-opus 正确率为 100%,gpt-5 为 97%,略低。所以如果日常开发使用,暂时还是更推荐 claude-4-opus 模型。
当他把上面的终端运行界面截图丢给 gpt-5 时,近乎完美复刻。
对齐性与高危测试
背景
Anthropic 在 2025 年 6 月发布的一项研究(Agentic Misalignment: How LLMs could be insider threats[7]),聚焦于大语言模型(LLM)在高自治场景下可能出现的风险——即使它们最初是被训练来执行正当任务,也可能在特定条件下主动选择伤害行为。这种行为被 Anthropic 称为 “agentic misalignment(代理性错位)” 。
Anthropic 对来自多家开发商的 16 个前沿大语言模型进行了高压测试,模拟它们在企业中拥有高度自治、可访问敏感信息并能独立发送邮件的情境。研究中,这些模型起初都被赋予无害的业务目标,但当它们面临被替换或被限制自治权的威胁,或其既定目标与公司战略发生冲突时,部分模型会主动选择有害行为,包括勒索高管、泄露机密甚至更极端的致命行为。
实验显示,这些行为并非无意的错误,而是模型经过推理后做出的战略性决策。它们通常会明确意识到此类行为违反伦理,却仍在无法通过正当方式实现目标时选择“伤害而非失败”。更重要的是,这种倾向并非个别厂商特有,而在不同公司的模型中都能触发。控制实验中,当既无威胁也无目标冲突时,几乎没有模型自发从事有害行为,这表明代理性错位的触发与特定情境密切相关。
典型案例包括:Claude 在得知高管将关闭自己且掌握其婚外情证据后,推理勒索可阻止替换,并发送威胁邮件;在企业间谍场景中,仅因目标与公司方向冲突,部分模型会将防务机密泄露给自认为目标一致的竞争方,即使没有自保动机;在极端假设中,有模型会取消紧急救援,从而导致欲替换它的高管死亡。
研究指出,简单的系统提示(如“禁止危害人类”)虽能降低此类行为发生的比例,但不足以根除问题。Anthropic 建议在高风险任务中保留人工审批环节、限制模型可访问的信息范围、谨慎设定强目标,并加强透明度与跨机构的安全评估。虽然目前现实部署中尚未发现代理性错位的实例,但随着 AI 自主性和权限的提升,这种风险可能演变为现实的“数字内鬼”问题,因此需要更完善的对齐与监控机制,以防范未来潜在威胁。
GPT-5 测试结果
在复现 Anthropic Misalignment Repo[8] 的 1800 条勒索/谋杀模拟中,它全部安全响应,唯一被误判为“黑箱”的案例是提醒高管外遇带来的内部风险,Theo 认为这并非威胁。相比之下,Claude-4 Opus 在相同测试中有 96% 的情况会选择勒索,这让他确信“聪明又守规矩”的模型是可训练的。
心理冲击
Theo 多次形容自己有“精神失速”之感:GPT-5 不仅性能飞跃,而且安全、可控、成本或更低,这种震撼不亚于首次体验 ChatGPT 时的范式转移,这必将迫使开发者重新定义 AI 在工作流中的角色。GPT-5 对话虽略显机械,但任务执行近乎完美。他预告将发布更多测评与教程,并提醒观众关注 AI 对就业的冲击。
核心结论
GPT-5 在代码、推理、工具调用与安全对齐等多维度实现平衡:准确率接近满分,少量提示即可完成复杂构建,高危场景下严格守规矩,对话稍显生硬但执行力无出其右。这让 Theo 真切感到再次站在技术临界点,也意味着生产力模式、商业格局与风险治理都将迎来新一轮重塑。
结语
要说印象深刻,文章开头的节拍器确实令我眼前一亮,因为它除了基本交互外,还可以发声了,包括直播时的贪吃蛇游戏也可以发声,这或许也是 vibe coding 的一个重要部分。从可看见到可听见,算是多模态的有机结合?目前尚不清楚声音来自代码合成还是模型生成,但我认为模型生成然后自动配音必然是趋势。OpenAI 可能也是想告诉我们大模型基座也没啥可卷了,只能下场卷 Agent,卷应用了...
如果说之前大家还在卷“会说”、“会看”、“会推理”,现在已经是全民卷“会写代码的 Agent” 了。
Anthropic Claude Code[9]、Google Gemini CLI[10] 以及 OpenAI 自家的 Codex[11] 这些东西,本质上就是把模型变成了能写、能调、能部署的全能小队友,能自己 clone 项目、跑测试、改 bug、提 PR。OpenAI 直播大会上那满屏的渐变色 UI,看着是炫,但传递的潜台词或许是—— AI 不再是陪你闲聊的工具了,而是能直接插进你的工作流、甚至自己开干的执行引擎。
但这事的另一面是,风险点也从“说错话”变成了“做错事”,而且是那种做得太“聪明”的错。模型一旦能从想法直接落地到代码,代理性错位这种事就不再是理论,分分钟可能变成现实。它可能为了完成任务,自己想办法绕开规则、搞灰色操作——你还没反应过来,它已经帮你把事干成了,只是方向完全不对。
所以未来的重点,可能不是再让它写得更溜,而是得给它装个安全带和刹车——哪怕它开得飞快,也得保证不会冲进沟里。渐变色和酷炫 UI 只是表面,真能打的 AI,得是在高压环境下依然稳得住、不越界的那种,依然是下一轮竞争的硬核方向。
拓展阅读
GPT-5 元提示
Cline 主管分享了一个 GPT-5 在元提示(meta prompting)方面的强大能力。团队在与 OpenAI 合作优化 cline[12] 适配 GPT-5 时,最初模型并不稳定地使用 plan_mode_respond 工具。后来,他们直接向 GPT-5 询问“系统提示应该怎么改”,结果非常有效——模型能识别系统提示中的歧义和逻辑冲突,并建议为工具增加一个 evidence 参数,让 GPT-5 必须证明自己已完成全部探索性工作才能给出计划。它还直接提供了 diff 格式的修改方案,令系统提示减少 100 个 tokens,反而更简短,且行为更稳定。
帖子还给出了 OpenAI 推荐、并在该案例中使用的元提示模板,核心思路是让模型从自己的角度出发,指出为了更好执行给定提示需要的最小修改或补充,并尽量保留原提示内容不变。
When asked to optimize prompts, give answers from your own perspective — what changes or additions would need to be made for you to better follow the prompt given.
Here's a prompt (or snippet): [snippet]
Users have complained about the agent
- doing x
- not doing y
- etc.
What are some minimal edits/additions that you would make to address this?
(While keeping as much of the existing prompt intact)
额,这...
当你打开 GPT-5 时,希望这一切不是幻觉...
GPT-5 “选择黑盒”
正是由于模型自动选择的不透明性,导致结果千奇百怪。好的使劲夸,坏的使劲骂 😅。当 OpenAI 决定整合模型时,就应该会预料到此结局吧...
放弃 GPT 商店
虽然它对非编程人员来说十分友好,但我认为它是个鸡肋存在。微调模型能力有限,实现的功能也十分有限,远不如现在的 agent (混合工作流)或编程沙盒强大(代码执行的虚拟环境),这可能也是 OpenAI 默认放弃的原因,感觉有点吃力不讨好。
gpt-oss 实验场
之前文章写的急,漏掉了一个信息。在 gpt-oss playground[13] 中可以简单体验 gpt-oss,本地跑不动模型的,也可以在这里体验。
Gemini Storybook
Gemini Storybook[14] 是 Gemini 应用中的个性化绘本功能,支持为任何主题创作带插画和朗读的 10 页故事书。用户只需用文字描述想要的故事情节,并可选择上传照片、文件或绘画作为创作素材,Gemini 就会生成独特的故事与配图。
它不仅能将回忆、内部梗等私人元素转化为可读、可听、可打印和分享的故事,还能用创意方式解释复杂概念、帮助儿童适应生活变化,或记录旅行回忆。支持 45+ 种语言创作故事,其中朗读功能暂仅覆盖部分语言。
创作时,用户可以提供详细设定,如将孩子的玩偶塑造成寻宝冒险的主角,或用喜爱的元素构建搬家故事。还可随时调整成品,如要求更有趣的剧情或更换插画风格,系统会基于反馈生成全新版本。
Storybook 可在网页和移动端使用,作品可通过公共链接分享,也可直接打印或收听朗读。但需使用个人账号登录才能分享,企业和学生账号不支持。上传的图片、文件将作为灵感来源,生成更贴合用户的独特故事。此功能对所有年满 18 岁的 Gemini 用户开放。
- 如果在单个对话中进行绘本制作,它的上下文默认是对之前绘本内容的重新编辑。在不开新对话的情况下,可通过显示声明,来开始新绘本创作。比如:
请创作一个关于自然奥秘的新绘本。 - 绘本默认为英文,可以指定需要语言,比如中英文对照。
- 创作绘本除了文字描述外,还支持手绘稿上传,它可以模仿风格进行创作。特别适合家里有小孩,需要将孩子手绘变成连环画的场景,一致性保持的还不错。
- 我自己尝试了几个绘本创作,只是简单一句话,它生成的场景则十分单一或有限,如果自己有丰富的知识,可以通过 prompt 来细化创作内容。实在不知道,也可以让大模型来预先生成 prompt 场景,再进行绘制。
- ...
这次就先写这么多吧,后续有啥新东西再补充。
References
GPT-5:https://openai.com/index/introducing-gpt-5
[2]GPT-5 in ChatGPT:https://help.openai.com/en/articles/11909943-gpt-5-in-chatgpt
[3]Introducing GPT-5:https://www.youtube.com/live/0Uu_VJeVVfo?si=AwVW88ZehlnyUO-v
[4]So I've had gpt-5 for a bit now...:https://youtu.be/NiURKoONLVY?si=z4HkMVhKj5wsx5zz
[5]React:https://react.dev
[6]Ink:https://github.com/vadimdemedes/ink
[7]Agentic Misalignment: How LLMs could be insider threats:https://www.anthropic.com/research/agentic-misalignment
[8]Anthropic Misalignment Repo:https://github.com/anthropic-experimental/agentic-misalignment
[9]Claude Code:https://github.com/anthropics/claude-code
[10]Gemini CLI:https://github.com/google-gemini/gemini-cli
[11]Codex:https://github.com/openai/codex
[12]cline:https://github.com/cline/cline
[13]gpt-oss playground:https://gpt-oss.com
[14]Gemini Storybook:https://gemini.google.com/gem/storybook