程序员老鬼

Anthropic 这次,终于开始认真治 Skill Creator 最烦的那个病了。

Anthropic 这次,终于开始认真治 Skill Creator 最烦的那个病了。

不是“技能怎么写”,也不是“提示词怎么调”。

而是更前面那个问题:你做出来的 skill,到底会不会在该出现的时候出现。

这个事以前一直挺别扭的。

你写完一个 skill,description 也填了,触发条件也想了,自己看一遍,感觉还挺像那么回事。然后就开始手动测。输几个 prompt,看它触不触发;换几个说法,再试一遍;运气好,大概能摸到边;运气差,线上一跑就开始犯病。

该出来的时候不出来,不该出来的时候又特别积极。

Image

这种感觉很像什么呢。 很像你招了个实习生,简历写得不错,面试也没毛病,结果真上班以后,叫他的时候他没反应,不叫他的时候他总想插两句。

烦,而且是那种很难系统解决的烦。

所以我看 Anthropic 这次更新,真正有意思的地方,不是“哦,它又多了几个功能”。而是它终于不再把 skill 当成一个写完就完事的说明文件,而是开始把它当成一个要持续验证的东西来看。这个味道差别很大。

以前做 skill,有点像手工作坊。

你凭经验写,凭手感改,凭耐心测。能用就先用着。至于到底稳不稳、什么时候会退化、改完到底有没有更好,很多时候说不太清,只能靠感觉。

现在它明显想把这套事往工程化那边拽。

你先定义测试提示词,再给一个通过标准,后面系统去跑。这个动作本身其实不花哨,但很关键。因为 skill 最怕的,不是你第一天做得不够好;最怕的是它本来还能用,过一阵模型变了、底层逻辑改了,触发 suddenly 就开始漂,你自己还没意识到。Anthropic 官方其实早就在文档里强调过,skill 应该先建评估、看基线、再迭代,不然你写的往往不是解决真实问题,而是在写想象中的文档。

这次它等于把那个思路往前推得更实了一点。

我自己觉得,里面最实用的不是“评测”这两个字,而是它把很多人平时最玄学的那段过程,稍微拉回到可观察、可比较的范围里了。

比如并行跑测试这件事,看起来只是提速,实际上不只是提速。以前一条条顺着跑,多少有点脏,上下文互相沾,结果也容易掺水。现在拆开了,各跑各的,反而更接近真实使用场景。现实里用户本来就不是排着队、带着同一段上下文来问你问题的。

还有 A/B 这种东西,我觉得是专门拿来治“我觉得新版更好了”。

做过 prompt 或者 skill 描述优化的人都知道,人特别容易被自己感动。你改了两句话,语气更顺了,结构更清楚了,就会下意识觉得:嗯,这版肯定更准。但很多时候,那个“更清楚”只是对你自己更清楚,对模型未必。现在直接拉比较器下场,把两个版本放一起盲测,至少不用每次都靠拍脑袋。

还有一个我很看重的点,是它不只是帮你测结果,还开始碰 description 本身了。

因为 skill 触发这件事,说到底,description 写得对不对,影响特别大。写泛了,它乱触发;写窄了,它又进不来。这个问题以前大家都知道,但很少有人认真系统地修。最近一些对新 skill-creator 的解读里提到,它已经会结合测试提示词去分析误触发和漏触发,再给修改建议。这个就不再只是“帮你搭一个 skill”,而是开始管它的可用性了。

这里面我最有感的一点是:它终于开始承认,skill 不是写出来就算完成,而是会老、会漂、会退化的。

这其实很像产品,不像文档。

你得测,得比,得看它是不是变差了。Anthropic 自己今年也一直在讲 eval 对 agent 很重要,因为很多问题不是当场炸,而是上线之后慢慢飘;没有 eval,团队就只能等用户踩坑以后再回头补。

所以这次更新,表面上是在补 Skill Creator,实际上更像是在补一整套“怎么维护 AI 技能”的方法论。

而且这事不只是给工程师的。

对普通创作者来说,skill 最大的门槛很多时候根本不是不会写,而是写完以后你不知道它到底行不行。那种不确定感很消耗人。你总觉得差一点,但又不知道差在哪。现在它至少开始把“测试、比较、优化”这几个环节放到更顺手的位置上了。

这一步看起来不炸,但我觉得挺要命。

因为 Skill Creator 真正成熟,不是它能帮你更快写出 skill,而是它开始帮你判断:这个 skill 到底是不是一个靠谱的 skill。

这两个问题,完全不是一个难度。

以前它更像“创建器”。

现在它总算有点往“验证器”那边去了。

我觉得后者反而更重要。