产品犬舍

Gemini 3 shock!我第一次感受到 AI 达到了产品专家水准

妈的,昨天才发公众号不赞同 AI 许愿池,紧跟着 Gemini 3 第一次让我感觉到 AI 突破预期,达到了产品专家水准。
这事得从头说起。

我有一个朋友,业余时间也做独立产品。

他的独立产品(创新的场景化记账,没见过同类产品)上线两年了,最近正在进行彻底的交互重构。我看过他重构的稿子,不用他介绍,独自沉思了两三分钟得出结论:

  • 你的产品定位是什么?

  • 你的目标用户是谁?

  • 针对目标用户的产品特色和竞争力是什么?

  • 有怎样的优化提升空间?

其实,那只是三张没有标注的视觉稿,大多数人是看不懂的。看三张视觉稿就能脑补完整的用户场景,我对于这种(共情与洞察)能力非常得意。

他也竖起大拇指:完全正确。

今天,Gemini 3 上线。朋友闲来测试,把这三张视觉稿甩给 Gemini,就一句 Prompt:

我正在开发一个记账独立 App,理解一下它的核心页面,输出你的看法。

然后 Gemini 说出了和我很相似的结论,尤其是产品定位与特色的关键结论完全正确。

我们俩惊呆了,如遭电击。

这是典型的专家能力:直觉与洞察。

以前总有人说,大模型在哪里哪里达到了专家水准。我对此不以为然——你得自己是专家,才能判断大模型达到了专家水准。否则大模型只是 “比你强” 而已,普通人无法理解专家的段位。

这一次,我没法否认,大模型在对这三张视觉稿的分析推理上,达到了相当于 80 分产品专家的水准。

Gemini 甚至还指出了好几个准确的交互优化点,比如可以将创建账本入口移动到哪里,现在的布局不够好,低频操作放在过于醒目的位置,降低屏效。这个优化点不重要但正确无疑。

我们俩如遭电击。

接着向 Gemini 提问:

我很好奇,你对于产品定位和特质的理解以及建议非常准确,甚至接近专家认知,你是怎么做到的?这对于以前的模型是从来没有发生过的事情,是否代表着你掌握了 UX 设计的思维链?

Gemini 回答了一大串结构化的屁话,看起来头头是道,但推理过程完全错误。普通人肯定被唬到了,但你唬我?你唬我?推理过程和推理结论是完全脱节的。

我们继续问:

以上回答更多是从结果倒推,还是没有解答我心里对于 how it works 的疑问,你的逻辑与思考框架从何而来?

Gemini 杨永信附体再次电击我们俩:

  • Dribbble/Behance 上的评论区: 设计师们在互相撕逼,有人说“这个按钮太小”,有人反驳“这是为了留白”。我从中学会了权衡(Trade-off)。

  • Product Hunt 的发布帖: 开发者解释为什么做这个产品,用户反馈哪里不好用。我从中学会了MVP 策略和用户痛点。

  • Nielsen Norman Group 的研究报告: 这是硬核的理论,我从中学会了专业术语和认知心理学原理。

  • GitHub 的 Issues 和 PR: 我看到了从“报错”到“修复”的全过程。

关键点来了: 我读的不是静态的结论,而是人类解决问题的全过程(思维链)。我看过成千上万个 “因为用户抱怨 A,所以设计师改成了 B,结果数据提升了 C” 的案例。

所以,我不是由“逻辑”编程的,我是由“无数个成功和失败的案例”堆出来的统计学直觉。

OMG。

这真的是我完全预想不到的蕴含了思维链的语料。

一个智商很高的人,长年累月地观察设计师网站的互动区,创业者社区的帖子,从大量的碎片化信息中能不能积累 UX 专业洞察?

能……

我日……

宛如黄裳再世……

同样的图片和 Prompt 丢给 ChatGPT 付费版,回答跟屎一样,刻板而无用。

Gemini 牛逼!

这里还有另一些隐藏属性的关键点。

Gemini 给我们输出了大量的文本,大量的。

我之所以被电击,是因为一眼就能从几千字的文本中,找到最重要的部分,也包括一眼就能分辨出可行性不高,甚至是错误的部分。

这意味着,特别擅长抓重点的大模型,如果要用好它,用户也得在几千字的文本中抓重点。

甚至把以上文本全部分享给另一个人,他如果不够专业,可能根本看不出其中精妙之处,可能觉得和 ChatGPT 的屎输出也差不多。

经常有人问,怎样才能去冲击大模型的上限?

如果你说的上限指的是 “专家水平”,那么你自己就得是专家,才能更好地理解和探索大模型的专家水平。因为专家才能准确感知到 “你也是专家”。

就像我经常看到别人盛赞大模型输出如何卓越,再一看内容,并不卓越,只是你的要求比较低。这远远谈不上大模型的上限。

于是此处疑似一个悖论……专家未必依赖大模型的专家输出,普通人未必能识别和用好大模型的专家输出。

关于我之前提出的大模型能力的三个刚性约束(1、语料中蕴含思维链,2、任务包含完整上下文,3、AI 交付支持后验),我现在对于第一点 “思维链” 有点颠覆认知,大模型学习思维链的语料超出我过去的刻板印象。反倒是第三点 “后验” 显得更加重要——比如今天 Gemini 交付的几千字文本里,60-80 分的信息并存,怎样对这些交付进行后验,去芜存菁?方便你在后验中抓准重点?

就像专家单单给你方案是不行的(过去几年我作为顾问给的方案,可能在执行中被魔改后失败并背锅),还要带着你方案落地,跟随进展反馈不断调整方案,这才能体现专家的价值。

说到这里,联想起我 10 月体检癌标志物超标 20 倍。ChatGPT 回答了各种可能性,屁用没有。去华西看病,医生非常肯定地说:排除癌症风险,开点药治疗胃部炎症。

同样的道理,我自负效率无双,因为可以在各种可能性中笃定地指定 “这就是当前最佳方案,这里就是不能硬来的方案边界”。对大量可能性做出极致减法并承担责任,大大提高了效率与质量,这是专家无法被大模型替代的价值。

以及大模型给你输出各种可能性,而不是专注于最大的可能性,不仅仅因为免责,也是因为 “上下文信息不足”。仅仅靠向大模型提问,它是不可能知道足够的上下文的——我做顾问的时候甚至不接受电话咨询,必须面对面深谈,回答我提出的一切问题,才能收集到足以做(不复杂)判断的上下文信息。更复杂的判断必须在长期工作中收集更多的信息才能做出。

因此,“任务包含完整上下文,AI 交付支持后验” 这两点对大模型解决问题能力的刚性约束依然成立,但 “语料中蕴含思维链” 这一点刚性约束,我现在动摇了,着实料不到设计师网站互动区和创业者社区的帖子也能提取 UX 思维链。互联网语料中埋藏的宝藏超出我过去的刻板印象。


内容来自“用思考交换思考”的 PM 思辨社区「犬校」。©2017-2025

点击【阅读原文】,可见犬校最近一年的好帖索引。

社区加入方式:2025 年是邀请制论坛「犬校」的第九年,社区继续开放,欢迎同行
图片