从组件到系统,Agent 的 Evaluation 怎么做?
机器之心PRO · 会员通讯 Week 41
--- 本周为您解读 ②个值得细品的 AI & Robotics 业内要事 ---
为什么 Agent 需要新的评估基准?Agent 与 LLM 的定位有何本质差别?Agent 评估范式在如何演进?GAIA 系列如何跨越 Agent Evaluation 的边界?MCP-universe、MCPMark 和 MCP-AgentBench 的反映了什么样的设计哲学?...
2. CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 只是「语言的表层叙事」,而非真正的推理?CoF 如何把「语言的思维链」转译为「视频的帧链」?CoF 为何被认为可能成为视频生成模型的「新范式」,它相较传统帧间一致性优化方法的优势如何?从 CoF-Data 到 VChain,研究者如何把「推理链」嵌进每一帧画面?在 CoF 出现之前,视频模型靠什么维系「帧间一致性」?...
要事解读① 从组件到系统,Agent 的 Evaluation 怎么做?
评估 Agent 和评估 LLM 有何本质区别?
1、Agentic AI 代表了人工智能快速发展的前沿领域,随着 LLM-based Agent 从研究原型转向实际应用,如何严格评估这种 AI 系统的问题变得紧迫又复杂。
2、相比评估 LLM,Agent Evaluation 的难点在于,其目标旨在衡量一个完整的自主系统在动态环境中实现特定目标的端到端成功率、可靠性和效率。[1-1]
① 在 Agent 系统中,LLM 通常扮演「大脑」或推理引擎的角色,其核心功能是通过预测下一个词来生成文本,这种特性使其天然适用于通过静态基准进行评估。
② 在此之上,Agent 的最终表现是其架构、作为「大脑」的 LLM、所用工具以及与环境交互后涌现出的综合属性,如同评估一辆汽车在各种真实路况下的综合表现。
③ 相比之下,传统的 LLM 评估更关注模型输出的内在品质,如文本的流畅性、事实准确性或在静态文本上的推理能力,这类似于在测试台上评估一台引擎的性能,而非整车的驾驶体验。
3、当 Agent Evaluation 的评估焦点从模型本身转移到了模型与其所处环境交互后产生的实际效果,传统面向 LLM 的评估方法无法直接沿用。[1-1]
① 由于 Agent 通常被定义为一个能够感知环境、自主决策并采取行动以实现目标的系统,其复合特性决定了对 Agent 的评估必须考察其完整的行为过程而不仅仅是单一文本输出的质量 。
4、在此趋势下,业界愈发关注好的 Agent Evaluation 方法,并涌现了如 GAIA 系列,MCP-universe、MCPMark、 MCP-AgentBench 等工作。
从静态环境到动态世界,Agent Evaluation 范式在如何演进?
1、从 LLM 到实验室阶段的 Agent,后到真实进入生产环境的 Agent 产品,AI 系统复杂性和应用范围不断增长,每一代的评估基准都是为了解决上一代的盲点而设计。
表:各代 Agent 评估范式差异对比[1-1]-[1-4]
2、在 Agent 兴起之前,面向 LLM 的评估基准主要集中于衡量 LLM 作为语言理解和生成模型的核心能力,这一代的评估范式通常设计在受控的、静态的环境中衡量抽象的智能、知识和对齐水平,
① 经典的 GLUE 和 SuperGLUE 等基准测试了模型在通用语言理解任务上的表现;MMLU 则评估了其在多任务上的广博知识;此外,还有针对安全性(如 ToxiGen, HHH)或真实性(如 TruthfulQA)的专项评测。
② 归因于数据泄露(污染)和模型能力的快速提升,LLM 基准的另一项问题在于,这些基准正以越来越快的速度被 LLMs 解决到接近人类水平,甚至无法继续用于验证 LLM 的能力。
3、一个 Agent 的核心价值体现于它能「做什么」 ,Agent 定义也是以自主性(autonomy)、规划(planning)和与环境互动以实现目标的能力展开,因而面向 Agent 的评估范式必须能够衡量这些以行动为导向的核心能力。[1-1]
4、当 Agent 应用开始萌芽,诸如 GAIA 等基准开始从纯粹的知识储备转向通过工具应用知识的行动能力。早期评估基准的核心是测试 Agent 在静态或可复现的环境中,通过多步规划和工具使用来完成任务的能力。[1-2]