产品犬舍

AI 赋能的边界:为什么 AI 对我做产品没有帮助

坦率讲,AI 可以帮我做旅行攻略,帮我 review 公众号,在我的生活里替代和大大加强了搜索引擎,但它还帮不了我 “做产品”。除了我对于 Vibe Coding 目前无需求之外,AI 在我个人的产品工作流里只能发挥很少的价值。对此,我一直被质疑拥抱 AI 不够用力,信仰不足。

本文是我对这类质疑的完整回应,同时表达我对 AI 赋能边界的观点,也许也能回答一些朋友对 “AI 时灵时不灵” 的疑问。

首先从最近的一条新闻说起,Google 首席工程师 Jaana Dogan (@rakyll) 在 X 上分享经历:

我没开玩笑,这事一点都不好笑。我们(Google)团队从去年开始一直在尝试构建分布式 Agent 编排系统,期间有过各种方案,大家意见并不统一。我把问题的描述发给 Claude Code,它在一个小时内生成了我们去年一年做出的东西。

很显然,这个话题炸了,然后 Jaana Dogan 作了更多解释,我从中的理解是——

关键约束一:丰富的上下文

这一年里,Google 团队进行了大量的讨论,输出各种方案和权衡,在各种架构方案、折衷和团队共识之间博弈,最终浓缩成一条精简的 Prompt,Claude Code 才能在一小时内生成结构完整的 “Toy Version”。

Jaana Dogan 强调:

这是在没有任何历史包袱、不需要与任何人开会争论方案的情况下,从零开始生成的代码。

那么,“大量讨论,各种权衡,艰难折衷,达成共识” 就是这个项目里的上下文。AI 可以在过程中收集上下文,但无法提前预知上下文。

如果没有上下文,不可能计算得出最后那条精简的 Prompt,也就没有最后魔法般的 1 小时。

现实中,个人可以将 AI 融入自己的工作流,花力气输入几万字几十万字的背景信息。融入工作流越深,AI 对上下文的理解越深。但一旦涉及团队协作,你没有办法让团队里的所有人都用同一种方式接入 AI,“别人的上下文” 往往会成为缺失的关键信息,这件事目前还没有可行的解决思路。

关键约束二:交付结果可验证

AI Coding 是 AI 应用发展最快的领域,因为代码是可以快速运行验证的。

即便在 coding 领域,Jaana Dogan 在这个项目里深耕了一年,对所有可能的坑和方案都了如指掌,才有能力看一眼代码就判断出 Claude 生成的东西是 “靠谱的”。外行无法分辨 AI 生成的是精妙的架构还是一堆垃圾,而她能快速确认其价值,前提是拥有那 “一年” 积累的专业判断力。

一旦 AI 的交付无法通过快速运行来验证,或者无法通过专家洞察来验证,确定性就被大大削弱了。

一旦交付本身是错的,那么交付过程的高效率又有什么意义呢?

因此,目前的行业共识是,「上下文和可验证」是 AI 的关键约束。上下文越丰富,背景信息越完整,验证速度越快,验证准确率越高(或者该场景下的容错率越高),那么 AI 发力就越是澎湃。近一年符合这两项约束的 AI Coding 发展飞快,其他领域远远掉队在后面。

比如有人反驳我说,华裔数学家陶哲轩高度评价 AI 对他数学研究工作的帮助。你看,顶尖数学家都能从 AI 得到帮助。

这里有一种可能性是,数学和代码一样跑在 AI 的长板上:语义精准,交付可验证。就像陶哲轩高度评价 AI 在数学研究中,自动生成并筛选掉成千上万种无效的证明路径,高效率的筛选显然离不开 “交付可验证” 的关键约束;而数学的上下文输入精准无歧义,大多数领域亦不可复制。

综上,人类负责消除歧义,AI 负责在较少歧义的环境下执行。复用到 Google 首席工程师 Jaana Dogan 这个案例,Google 团队负责用一年的时间构建多个版本测试并达成共识,AI 负责执行这个共识,才能 “一个小时内就生成了我们去年一年做出的东西”。最后由 Jaana Dogan 作为人类专家盖章验收。

关键约束三:思维链的开放与收敛

前两点都是行业常识,本文真正想探讨的是 “思维链的收敛” 这个话题。

在 AI 定义中,思维链是输出答案之前的推理步骤。

最近和女朋友聊 AI,聊到一个观点是,AI 能很好地回答 what,往往也能很好地回答 why,但在回答 how 的时候方差极大。这是为什么?

众所周知,大模型基于概率运算。一旦问题可以收敛到 “最大公约数” 的语境下,那么大概率得出的答案往往是最好的答案。

在这个背景下,what 在推理上是有最大公约数的。对于大量的通用命题,why 的推理也是有最大公约数的。what(定义/事实)和 why(原理/逻辑)通常属于收敛性命题,答案具有唯一性,而 AI 的推理越收敛越无敌,相当于大概率命中的百科全书 + 逻辑解释器。

与之相比,how 大部分是开放性命题,不存在最大公约数的推理,或者说最大公约数往往是正确的废话。面对开放性命题, AI 这个概率机器无法收敛到最大公约数交付,从 “大概率” 转为 “个性化”,结果也不是一定不好,但就是……抽卡,交付的随机性极强。

  • 在足够的语料基础上,AI 很擅长模仿

  • 在收敛性命题下,AI 很擅长推理

    • 以上两类场景,AI 往往能做到 80-90% 区间的交付质量

  • 在缺乏模仿对象的开放性命题下,AI 抽卡的交付质量可能在 5-50% 区间随机分布

举例来说,如果 how 指的是 “如何煮饺子” 这样的收敛任务,落到大概率区间的 AI 运算结果无敌。

如果 how 指的是 “如何写一篇拿到更多流量的,描述 AI 赋能边界的公众号”,推理这个命题可就太开放了,即便加上诸多 Prompt 进行收敛,命题依然太开放了,抽卡抽到一张好卡的概率低到不可思议。

我在用 AI 辅助做旅行攻略的时候,对此体会颇深。如果提问 “法国 10 日深度游,从南法到巴黎”,其实 AI 的交付还好,因为南法和巴黎的经典行程是有最大公约数的,可模仿的语料也很多。但是,一旦我加入了诸多个人风格的行程约束,比如南法想怎么玩,巴黎想怎么玩之后,AI 交付的行程就成了抽卡,怎么抽都不满意。

对此的应对方法是,将我的个性化旅行风格转化为一系列高度收敛的的问题,比如南法有几个出名的海边小镇?每个小镇有什么我感兴趣的景点和玩法(在 gem 里预设我的旅行偏好)?我自己设计好每日动线之后,最后交给 gem 老师 review 路线合理性与酒店安全。相当于用 Gemini 高效率获取 what 和 why,再用我的个人旅行偏好组装为 how。怎样用 Gemini 重新组装我做旅行攻略的工作流

简单来说,我与 AI 的协作方式是,尽量让 AI 来做收敛任务,我自己做缺乏模仿对象的开放性命题。

或者换个角度表达:我从原有的工作流里拆出来一系列收敛任务交给 AI,组装为新的工作流。

这个方法对我做旅行攻略可以说是神乎其技,却对我的产品工作无效。因为我个人的产品工作流里很少有收敛任务,几乎全是缺乏模仿对象的开放性命题。

一旦涉及开放性命题,又没有模仿对象,再加上我在产品工作中的上下文信息量大到无法输入,这对 AI 来说就超纲了,降智并且抽卡。

举个例子,我做产品咨询的时候,如果你上来就问:老师,以某某赛道举例,什么是基于演化的产品思考方式?然后我能给你从理论讲到案例,头头是道。

如果你上来就问:老师,我昨天的一个产品方案被老板骂了,你帮我看看怎么改合适。这时候我就想给你一个大逼兜。因为你的业务环境,你的落地能力,你公司的情况,你老板的情况,你团队的情况,我啥都不知道,我他妈改你大爷……

这就是收敛和开放命题的区别。收敛任务往往有概率上的最优解,跑在 AI 长板上;而开放性命题如果没有模仿对象,只能随机抽卡。

怎样将缺乏模仿对象的开放性命题拆解为一系列收敛任务,决定了 AI 赋能的高低。

在我个人的产品工作流里,我还没有找到这个拆解方法。但对于我做旅行攻略和写产品公众号来说,Search 和 Reivew 的收敛任务用到飞起,有种离了 Gemini 就活不下去的感觉。

SO,我一直以来的观点是:

  • AI 赋能没有作业可以抄,每个人都需要为自己定制打开 AI 的方式。

  • 在自己的需求里,能拆解出来多少 AI 赋能的收敛任务,你就能获得多大的收益。

  • 开放性命题的抽卡随机性太强,尽量收敛一些之后,有时候半开放的抽卡也能带来一些灵感,但最大的收益还是来自于收敛任务,比如 Search/Review/Repeat 或者有足够多模仿对象的 Generate。

至于很多人惊呼的 “一句话生成 xx”,觉得这么复杂的开放性命题都能实现真的太厉害了,其实没啥意义。这时生成 xx 本质上只是模仿经典。前面说过,在足够的语料基础上 AI 很擅长模仿,你给的约束越少,模仿越相似。当你加入诸多个性化的修改需求后,AI 在开放性命题下的真实能力(抽卡)才会露出水面。


🕺对了,我的产品专栏已更新 150 篇文章,2 月 1 日永久涨价至 120 元,在涨价前最后一次打折促销,限时 84 元,2.1 恢复正价。
纯银的产品专栏更满 150 篇,在涨价前最后一次限时促销
图片