两天实战,我发现 GPT-5 潜力远被低估!
通过两天的代码实战,我总结出了一些有趣的结论。本文虽以代码为例,但结论适用于任意场景。注:文末附有 Prompt 通用模板和一些实用技巧,以及 GPT-5 交流群,方便大家进一步交流探索。
最近两天,我和 GPT-5 Thinking 聊了很多,它的表现远超预期,甚至让我想要写篇文章来表达这种兴奋。这是新版 Noi 开发中遇到的一个真实代码需求,此部分代码最早是通过 Gemini-2.5-Pro + Claude Sonnet 4(未充值,无法体验到 opus 4.1)混合编写的,自己也做了部分手动调整。但经过 GPT-5 Thinking 全面重写后,我让 Gemini-2.5-Pro、Claude Sonnet 4 重新对新老代码进行 review,它们几乎得出了相同的结论:GPT-5 给出的新版代码质量远高于老版本。再说一个数字,老代码有 500 多行,gpt-5 重新实现的代码有 800 多行(单次输出),从侧面证明 gpt-5 绝对拥有架构超长代码的能力。
我正在开发的一个全新交互设计的 AI 浏览器。支持多账户登录(cookie 隔离),UserAgent 设置、多 Tab(主侧栏都支持新建 Tab)、匿名模式,画中画、AI 类 Chat 的万能输入框(几乎可以涵盖任意带输入框发送按钮的网页)等,不需要开各种窗口或安装插件。
AI 快速发展的今天,优秀的大模型选择有很多,大家针对不同平台的 Prompt 管理可能也割裂且复杂的,这款浏览器也内置了 Prompt 管理、Prompt 版本管理(记录所有发送过的 Prompt,方便持续微调)、以及多 AI 批量发送 Prompt(模型回答参差不齐,往往需要货比三家)等等。
目前,如果只有一个 Prompt 管理在我看来不足以成为 AI 浏览器。而我想做浏览器的初衷是:要做 MCP、Agent 就需要对浏览器有绝对的控制权,所以我目前的开发工作还主要集中在浏览器基础功能实现。在我看来更像是一个容器入口,可以放置任何内容,所以未来会迭代 MCP、Agent 之类的功能(目前精力有限,还未开始,那时候可能才算是 AI 浏览器)。
老版本已经发布一年多了,新版本近期也会发布,如果有对浏览器感兴趣欢迎交流。老版本下载链接(新版也会发布到这里):https://github.com/lencx/Noi
可在视频号查看更多 Noi 功能演示:
Gemini-2.5-Pro 评价
以下是 2.5-pro 给出的代码评价,其中代码 1 为 gpt-5 重写版本,代码 2 为老版本。
Claude Sonnet 4 评价
我还不死心,又让 sonnet 4 再次比对两份代码,几乎给出相同的评价。
小结
从以上截图可以看出,GPT-5 完全有能力生成工业生产级代码。
代码 1 构建了一个教科书级的、完全解耦的数据访问层 (DAL),其设计具备极高的可测试性、可维护性与可扩展性。它通过物化计数器(触发器)和精细的索引策略,确保了长期的高性能,同时利用判别联合类型构建了金融级别的健壮性,是面向未来、可持续演进的专业架构。相比之下,代码 2 采用了紧耦合的单例反模式,牺牲了模块的独立与可测试性,其核心的视图(VIEW)查询设计更是一个严重的性能陷阱,构成了典型的技术债务,会在数据增长后导致系统瓶颈,是短期看似可行但长期风险极高的设计。
注:这个结论也不是我随意写的,它出自 gemini-2.5-pro,又经过了 claude-sonnet-4 的复核。因为代码 1 是由 gpt-5 生成的,我就没有让它来评价,怕模型自我偏见,猛夸自己写的好。
背景
上面说了那么多,我再补充一些背景就正是进入今天的主题。
我是一个半路出家的前端开发(也就是网上常说的切图仔,熟练掌握 Web 开发三件套 HTML+CSS+JS),本身缺少后端、数据库等方面的知识积累,再加上目前对后端也没啥特别兴趣,就没有刻意去学习它们。
但在开发新版 Noi 时,我遇到了这样一个真实需求:Prompt 管理一直是 Noi 的核心功能,在老版本实现中,是通过 JSON 格式文件存储在系统本地,随着数据量的增长,在管理、检索、性能等方面都会遇到问题,所以我决定用 SQLite 来进行性能优化。因为不懂数据库,于是就出现了文章开头的那一幕,需要通过 AI 来协助我进行相关代码开发。
虽然最后得出“代码 1 质量远高于代码 2”,但此过程并非一帆风顺。如果你非专业程序员,又正在使用 AI 进行项目搭建,这篇文章或许会给你带来启发(这些经验也同样适用于有代码经验的,甚至可以迁移至其他提问领域)。
案例展示
为了确保通用 Prompt 模版确实有效,我测试了一个非编码场景。大家可自行感受输出结果,除了在 GPT-5 中测试,我还使用 Gemini-2.5-Pro 进行测试,也得到不错的回答(这意味着提示词具有一定迁移性)。
Gemini-2.5-Pro 测试
到底好在哪里很难用一句话来说清,为了有更直观对比,我把模型的回答全部截图出来。
✅ 使用 Prompt 模板
🚫 未使用 Prompt 模板
GPT-5 测试
未使用 Prompt 模板的回答我就不在这里截图了,感兴趣的朋友可以自己使用原始问题 Prompt 测试: 面向大学生的线下品牌活动(300 人,预算 20 万,上海,4 周内落地)。以下是使用 Prompt 模板之后的回答:
Prompt 技巧
以上内容有点啰嗦,到这里才进入付费部分。我不能说这接下来内容到底有多大价值,但它 100% 是我这两天实战总结出来的经验,是一个有趣的探索起点。先别急着看结论,这次和大模型之间的反复对话更有价值,它或许就是我们用来探索新领域的重要手段。
先说一个老生常谈的结论:你要把大模型当朋友,反复 PUA。这是我用 GPT-5 Thinking 得出的最有用也最朴实的结论,甚至毫无技巧可言。