王路在隐身

用豆包看病的医生,以及AI写作

(除了得到的稿子,我很少手动写文章了。今天手动一把。)

前一阵看到个新闻,有医生在看门诊的时候,桌子下面偷偷放个手机,把豆包的回复转述给病人。被病人发现了,录下来传到网上,很多人挺失望。我倒是觉得这医生还不错,至少不是太糟糕。

为什么呢?很多医生水平其实不如豆包。你不问豆包,病人也不知道你菜。医生想生存下去,水平不需要多强,比病人强就够了。很多江湖游医狗屁不懂照样敢给人开药,有些甚至是自己瞎配的中药。那么,一个医生水平不如豆包,去请教豆包,不是坏事。第一,他有自知之明,比不知道自己几斤几两的医生强太多了;第二,他把看病当成首要目标,还是存心把病搞清楚的。

那,病人和网友为什么气愤呢?第一,很多人并不了解大多数医生的实际水平。这一点其实和医生这个行业没关系。更确切地说,很多人并不了解很多行业从业者的实际水平。但凡了解,耿同学曝出的那些事情你一点都不会诧异。很多人信任一样东西,恰恰不是因为懂,而是因为不懂。由于不懂,没法根据事情本身去判断,只能根据头衔、身份、社会影响这些去判断。

第二,很多人也不了解AI的水平。说“AI的水平”其实是个很不准确的表述,和说“医生的水平”一样;有顶尖的医生,也有庸医。AI的水平怎么样,取决于你用的是什么AI(豆包确实比GPT差一大截)。拿今天(2026年6月)来说,像GPT 5.5,Claude Opus 4.8 这样的模型,开到最高档,超过99.9%的医生——这是我的判断,很多人不同意(包括AI本身大概率也不会同意),如果同意,我也没必要说我的判断了。这不意味着AI不会犯错误,最强大的AI也会犯低级错误(人不是也会吗)。很多人使用AI有风险,主要就是无法判断什么时候AI是在犯错误。——这种风险不小。“识别AI的错误”,在未来可能会产生不小的就业空间吧。

另外,再说几句AI写作的事情。

1、今天最强的AI(截至目前是Mythos和Fable 5),毫无疑问可以比人类写得好。——这句话往细了展开,有很多值得解释的地方。“写作”并不是一件事,它把很多不同的事打包都叫“写作”,但是写公文、写小说、写议论文、写科普,是截然不同的事情。我说“AI比人类写得好”,是因为我个人比较看重思考的深度,在这一点上,Fable 5超越了所有(100%的)人类,就像围棋AI那样。不过,“思考深度”远不是所有类型的写作中都重要的维度。在“生活经验”上,人类有极多经验是AI覆盖不到的,那些地方AI没有人类中的佼佼者写得好。

2、在看得见的未来,AI还无法写出人类的多样性(除非将来有一万种不同的AI,而且不搞什么“对齐”)。拿自动驾驶来打比方,拿人类司机中很少出事故(事故率和AI相当)的那些人,考察他们的驾驶风格,会发现每个人开车风格都不一样。有人凌厉,有人稳重。不同人之间的方差,和每个人内部的方差,都很大。而自动驾驶的AI的方差比人类小。因为它的目标不是开得千奇百怪,而是安全有效率地抵达。写作类似。你让AI骂人,它绝对骂不过人类。谁能说骂人不是最重要的表达之一呢,不是写作的重要分支之一呢。在这种细分领域上,不要说超过人类,越强大的AI越不配给人类提鞋。同样,武断、粗暴的表达,把话说满,这些都不是AI能做的事。因为AI优化的是相反的事。所以,你放心,AI绝对可以写得比任何人类都好(已经是了),但同时,AI永远无法真正像任何一个人类。

这么说吧,你可以被超越,而且已经被超越了;但无法被替代,而且永远不可能被替代——这里说的替代,不是局部替代,是完完全全像你。因为超越一个人是有效率的,是值得追求的;而像一个人并不是值得追求的目标,非常没有效率,也做不到——一个人自己都无法做到像自己,他是流动的。

当AI比你强的时候,只需要问AI一个问题:你能不能像我一样弱?AI只能回答:不能。

我自己写一篇不怎么样的文章(比如这篇),也比AI写的很好的文章(比如前面那些篇)阅读量高。所以,如果拿阅读量而不是别的指标来评价文章的好坏,那么,越强的AI可能会被认为写得越差——很多人赞美Opus 4.6的写作而批评4.7,就是这个原因,4.7和4.8的写作超出了他们能够欣赏的阈限。

两个水平一样、而且都不如豆包的医生看门诊,如果一个公然拿出豆包给病人看,一个完全自己看,你放心,来看后面那个医生的病人绝对比看前面那个的多。来看病的人虽然都以为自己的需求是看病,但一个具体的人的具体行为中包含的真正需求,远比他能看见的需求多得多。

最后说一句,我怀念Fable 5,用过3天Fable 5之后,再用其他模型真的不过瘾。