“人体蜈蚣”可行,Meta最新研究:吃屎也能进步!
关注公众号,回复666,获取资料
今天继续来论文阅读,这次论文来源于腾讯推的一篇文章《别卷刷榜了!AI Agent的下一个战场是“中训练”|Meta最新论文解读》,文章本身有些观点跟我理解不一致,所以特地去看看论文是不是自己错了:
Agent Learning via Early Experience(通过“早期经验”的智能体学习、2025-10-09)
https://arxiv.org/abs/2510.08558
摘要:早期经验
Agent的一个长期目标是:能够通过自身经验进行学习和改进,并最终在复杂、真实世界任务中超越人类。
然而,在许多环境中,用强化学习从经验数据进行训练仍然很困难:要么缺少可验证的回报(例如:网站),要么需要低效的长时程回合(例如:多轮工具使用)。
因此,大多数现有智能体依赖于基于专家数据的监督微调,这种方式难以扩展,且泛化能力较差。这一局限来自专家示范的特性:它们只涵盖狭窄的情景范围,让智能体接触到的环境多样性有限。
为了解决这个问题,我们提出了一个新的范式:早期经验,由Agent自身的行动所生成的交互数据,在没有回报信号的情况下,将由这些行动导致的未来状态作为监督信号。
在这一范式下,我们研究了利用此类数据的两种策略:
隐式世界建模(implicit world modeling),利用收集到的状态来使策略扎根于环境动力学; 自我反思(self-reflection),让智能体从自身的次优行动中学习,从而改进推理与决策;
这里的大概结论是:这个猜想得到了初步验证,好了接下来是我的一些看法:
我的看法:吃自己的屎
这里有个问题,我们现在主流理解的Agent,比如Manus他其实更多被归类到了应用赛道,所以他的目标其实不关注模型进步;
比如我做个Agent甚至会用不同的模型,我关注的是自身应用进步,所以我关注的是自身数据工程和配合的工程技术架构
但从论文的内容来说,他好像关注的是模型本身进步,所以进步方式就只能是训练了,所以从摘要来说这篇论文应该就有问题,但他毕竟是meta大佬写的,我又不能这样说...
其实想模型自己进化的人多了,比如这篇论文:《Self-Adapting Language Models》
自己成长
SEAL 让大模型“自己教自己怎么微调”:模型先生成自我编辑(self-edit),包含合成微调数据和训练指令/超参的自然语言描述,再按这些指令进行一次轻量梯度更新;
再用可验证的下游表现当奖励,循环训练出更会“写自我编辑”的策略。在无上下文知识注入和少样本抽象推理两类场景里,SEAL显著优于常规基线,且无需额外的适配器网络或外部“教练”模型。
方案很性感,评价也很中肯,其中最经典的是:这不就是(让自己用一个幻觉去解释另一个幻觉),然后自己的幻觉越来越重?
很疯的策略,我这边认为可行性很低:
几个问题
首先,论文里靠“可验证指标”筛选有效 self-edit。
但真实业务里,什么算可验证?若用离线准确率/一致性等代理指标,很容易被“技巧性优化”所蒙蔽;
其次,让模型自己编教材,短期不知道能不能有帮助,但一定会固化放大幻觉,长期造成与真实分布偏离,这在医疗问答中几乎是不可认可的!
最后,就是各种工程技术层面的困难了,毕竟微调这个东西还没成熟到自动化的地步。
从这个角度,我们再次回归第一篇论文,为什么会有这类技术出现,他在解决什么问题?
早期经验在解决什么问题
答案是两点:不可验证性与专家稀缺问题。
奖励稀缺/不可验证:很多真实环境(网页 GUI、企业信息系统)难以为每一步提供可靠的奖励,或者要走很长回合才知道成败,要做RL会很低效;
专家难扩展:SFT 仰赖领域专家数据,而很容易场景覆盖不足,一换页面/一换表结构就几乎要全部重来。
早期经验的做法就很清晰了,大概是“让用户去死”让模型先“踩坑”,采集由自身行动引起的状态演化,把这些“未来状态”当监督信号,从而学到环境动力学与后果,再在此基础上做 SFT 或 RL。
PS,数据系统的数据飞轮策略是由AI每天对所有的AI调用进行检查,然后由真人专家进行校验和数据补充,早期经验这里就屌了,全靠模型判断
所以,这里重点就是论文的两条策略,如何围绕用状态演化替代奖励监督:
一、隐式世界建模,用大量交互收集到的状态来“锚定”策略,使其理解环境是怎么变化的,不再只背答案模板;
二、自我反思,让代理对自己的次优行为进行对照学习(行动→结果→反思),在无外部点评的前提下改进推理链与决策边界;
总之一句话:先让孩子自己试、摔跤、修正步伐(状态演化即反馈),再请教练微调动作;如果以后能量化打分(reward),再进入专业化训练(RL)精修,至于孩子死不死摔死了,可以先不关注,反正孩子多,至少我读下来貌似是这么回事...
结语
早期经验希望通过上述策略帮我们在无奖励、长链路、专家稀缺的现实里,重新理解反馈的本质以便建议自成长的框架。
只不过他这个方法论更多是作用于模型而不是应用的,这里就有点超出我能力范畴了,所以今天我们权当学习即可,就不实践落地了...
最后,让我们跳出单篇论文的技术细节,当前模型发展整体确实正在遭遇瓶颈,Meta提出的“早期经验”范式是一次针对数据枯竭难题的探索。
当高质量公开语料耗尽、专家数据成本高昂时,这一范式试图为模型开辟一条通过自身交互获取训练数据的新路径,很有点类似于人体蜈蚣...
然而,这项突围也凸显了根本矛盾。首先,“早期经验”需要智能体通过大量试错积累经验,这与训练GPT-4需数千万美元电费的算力经济现实形成尖锐冲突。
更重要的是,该方法与模型安全对齐问题产生深刻摩擦:在缺乏可靠外部反馈下的“自我反思”,可能让模型优化“看似正确”却蕴含风险的行为模式,如同修复代码却引入更隐蔽的安全漏洞。
总之,最近我读过所有的内容都几乎在同时表达AI发展的深层困境:AI发展遇到特别是数据上的瓶颈了,而单一的技术突破难以突破系统性约束。
“早期经验”指明了通过环境交互获取数据的方向价值,但实现它需要在数据工程、算力成本和安全对齐间取得艰难平衡。
这也解释了为何像OpenAI这样的领军者会转向应用生态:通过真实应用场景以更可控方式收集高质量数据,或许是当前阶段更务实的破局之道。
点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信: