Agent评测漫谈 —— 由浅入深讲解Agent评测
·
本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。 本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。 一、Agent评测是什么 1.1 评测的核心目的 评测的核心目的是为了回答 Agent 的好不好?以及到底哪里好,哪里不好? 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。 这也是为什么 Agent 评测不能只停留在离线打榜,更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。 而Agent评测的基石是观测,因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代 1.2 Agent评测与传统模型评测的不同 评测方法会随着 AI 形态变化而变化,大致经历了三个阶段: 传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是: 当模型被放进一个真实系统里,和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后,它能不能稳定交付好的结果。 这意味着 Agent 的评测对象已经不再是单一模型,而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。 1.3 为什么Agent评测不是只看结果,还要看行为和过程 在真实场景中,两个 Agent 可能最终都“做对了”,但工程价值完全不同: 一个路径清晰、工具调用稳定、耗时可控、可重复复现 一个反复试错、路径混乱、靠偶然命中结果、不可复现 如果只看最终答案,这两者会被误判为同一水平;但从规模化、成本优化、用户体验的角度看,差别非常大。 因此,Agent 评测至少需要覆盖四层内容: 结果层:任务是否完成,输出是否可用 过程层:规划是否合理,步骤是否稳定 效率层:耗时、Token、工具调用次数是否可接受…