最近 SkillOpt 论文特别火
分享一篇最近很火的论文 SkillOpt
一句话:本文提出 SkillOpt——把"agent 的技能文档"当成"可训练参数",用第二个更强的模型去"梯度化地"改写它,从而不修改模型权重就能把 agent 在任务上的准确率大幅提升。
🎓 学术价值:第一次把"prompt 学习"提升到真正的训练范式——给文本空间优化装上 deep learning 该有的全部"工程零件":rollout batch(样本采集)、minibatch reflection(梯度等价物)、edit budget(学习率)、validation gate(验证集门控)、rejected-edit buffer(负反馈缓冲)、slow/meta update(动量/元学习)。在 6 个 benchmark × 7 个模型 × 3 种执行环境的 52 个 (模型, 任务, 框架) 格子 上全部最优或并列最优,是该范式的"奠基性工作"。
🏭 工业价值:对于所有部署了闭源/不可微调模型的 agent 厂商来说,这是一个立即可用的方案——训练阶段可以调用更贵的 GPT-5.5 去"教"一个公开的小模型(如 Qwen4B)技能,部署时零额外推理开销,而且训练出来的 skill 文件是纯 Markdown、几百到两千 token、可审计可手工改。
💡 直觉类比:如果模型权重是"厨师大脑的突触",那 SkillOpt 就像在给厨师发一张便条——"做鱼香肉丝时一定要先炒郫县豆瓣出红油"。这张便条不是训练大脑,而是给大脑一个操作提示;SkillOpt 的革命性在于——这张便条可以被另一台电脑反复"批改" ,批改的依据是厨师实做的菜被评分的结果,连续批改几次后,便条就变成了一份精炼的 SOP(标准作业程序)。
与市面上一些开源skill优化项目的核心哲学差异
达尔文.skill 与 SkillOpt 是一对"全自动 vs 人在回路"的镜像
SkillOpt 是 "set and forget" — 训练完后 best_skill.md 是个静态文件,部署零成本、零人工。 达尔文.skill 把"人"作为闭环的一部分:v2.0 引入了三层 HIL 守关,作者明确说这是"达尔文区别于 SkillOpt 全自动设计的核心"。如果你更信任人的判断、不想完全押注 LLM 教练,达尔文更适合日常。 巧合的是,达尔文 v2.0 的评分维度(9 维、failure mode encoding、可执行具体性、高风险黑名单)和验证门控逻辑,是显式对齐 SkillOpt 的实证研究做的 — 作者在 SKILL.md 的"学术依据 & Credits"里直接补了 SkillOpt 仓库链接。
Trace2Skill 与 SkillOpt 解决的是不同子问题
Trace2Skill 的杀手锏是 "skill 规模敏感性":同一份专家写的 skill,在 122B 模型上效果拔群,换到 35B 上反而拖后腿。Trace2Skill 的方案是从大量轨迹并行归纳,自动蒸馏出一组可迁移的 skill ,并能"挖 LLM 的弱草稿"补强人工版本。 SkillOpt 的假设是:模型不动,我专心训一份 skill。所以没有 skill 库、没有多 skill 协作,训练出来的是个单一文件 — 强在"专一任务的可控优化",弱在异构任务的复用。 Trace2Skill 本质上没有验证门控、没有学习率、没有动量 — 它是 SkillOpt 论文里那个"自由改写 2000 token、会回退"的典型反例。
EvoSkill 是 SkillOpt 论文的"上一个台阶"基线
EvoSkill 已经引入了验证-选择闭环和失败分析,比 Trace2Skill 严谨,但没有把"文本空间优化"当作真正的训练问题。 SkillOpt 把 EvoSkill 当基线打过,在 52/52 格子里全胜(包括 EvoSkill 自己的强项 ALFWorld)。
一句话总结
达尔文.skill = 工程师的"实验循环 + 人在回路"(人+AI 协作,强在工程落地);
Trace2Skill = 蒸馏器的"轨迹归纳 + 库管理"(强在多 skill 复用和规模敏感);
EvoSkill = 闭环验证的 skill 库演化(中间过渡形态);
SkillOpt = 把"训练神经网络"的整套工程纪律(LR/validation/momentum/negative-gradient)原样搬到文本空间(强在数学意义上的可控优化)。