上周,我参加了一次提示词 PK 赛
比赛项目:从公开评论中提取字数较多的用户反馈,看看能挖出来什么有价值的信息。 我:代表传统分析师,和 AI 多轮对话,耗时 1 小时。 我拍档:代表新潮流分析师,用各种提示词工程技巧,以及高手封装好的提示词工具,在少数轮次的对话中让 AI 快速交付,耗时 10 分钟。
I won.
这是一个内部活动,虽然内容已经脱敏了,没什么不恰当的地方,但发公众号总觉得怪怪的,所以比赛过程,尤其是我这 1 小时跟 Gemini 对话的方法技巧,只发在我的小报童专栏。
我这 1 小时完整的对话是 3.5 万字。
在对话过程中,我会手动把有价值的少数文本复制到另一篇调研总结里。我一个字都不写,只是设计章节结构,然后把内容裁剪到章节下——3.5 万字的原文,手动压缩成了 2400 字。在这个过程中手动过滤了大量的废话和错误的观点,只保留对我有触动的 2400 字。一方面手动裁剪加深了我对重要内容的印象,另一方面这让我有可能反复阅读精华部分,而不是像清水一样在脑子里流过就消失了。
1、刚才这一系列的信息梳理过程,我们经历了多轮对话,你可以把多轮对话中我的需求转化为一段完整的提示词吗?让一轮或者很少几轮对话就能得到这些答案。
Gemini:给了我一段 800 字的提示词。
2、强制忽略以上所有对话,按以下提示词,对一开始输入的 PDF 进行分析并输出答案。
然后复制了 Gemini 给我的 800 字提示词。
Gemini:交付了结构化的 2800 字答卷,质量比我整理的 2400 字差非常多,干燥而刻板。
3、请看我对这次对话中有价值部分的手工整理,并评价我在信息分析过程中做得好和不好的部分。
然后复制了我手动整理的 2400 字。
Gemini:吹了一通彩虹屁,对于改进建议则是一坨废话。
最后我们聊到为什么 800 字提示词的效果完全不行,因为我在对话过程中大概提了十几个问题,对于内容整理和理解进行了 step by step 的收敛,根据每次 Gemini 的交付来进行下一轮收敛。这种不断收敛的过程,相当于把开放性任务拆分为多个(越来越精确的)收敛任务,从概率计算的角度,越收敛就越准确。
此外,3.5 万字的原文执行压缩这个动作时:
我比 Gemini 更能抓重点。
在抓重点的过程中,手动过滤掉了大量的废话和错误的观点。
最重要的是,我会对压缩后的内容进行当面讲解,相当于解压缩,而我在压缩时已经考虑到了自己解压缩的方式。因此我压缩到 2400 字以后可以做到高解码率还原。
Gemini 与之相比,压缩到 2800 字以后成了一坨结构化马赛克。
AI 的压缩能力可以达到 70 分以上,还无法和聪明的人类相比。
AI 无法识别(在我看来)正确的废话和错误的观点,在 2800 字里浪费了大量的 token,毛估有 2000 字,不仅浪费甚多,还导致人类验收时付出许多注意力成本去筛选有效信息。
AI 没法像人类一样,通过当面讲解来解压缩。
因此,如果不跟我的 1 小时相比,AI 的快速交付 “有点价值”, 10 分钟写提示词,5 分钟速读并挑出来有一些些启发的部分。但和我相比则完败,我交付了更多值得反复阅读与讨论的内容,在当面讲解时展开这些信息引导讨论。
这就是我从来都不在乎提示词工程的原因……全面而准确的描述是最好的提示词工程,敏锐的追问是最好的提示词技巧,这是一项能力,而非方法。
换个角度来看,像我这样深入提问并且花工夫总结的人是极少的,这都不是 10 分钟 VS 60 分钟的事儿,我这 60 分钟做到的效果是大多数人做不到的。对大多数人来说,“花少量时间” 从 AI 总结里 “获得少量价值” 才是常态,付出很少,收获不大,若有所思,主打一个快速获得感。大多数时候如同我刻薄的表达:像清水一样在脑子里流过就消失了。