《Agent 评测白皮书》系列01:Agent 评测全览
·
综述 搭一个 Agent 正在变得越来越容易 过去三年,有两条趋势在同时发生。 一是基座模型的能力持续进化,它带来的结果是对使用者的要求在往下降。早期要让模型稳定地按格式输出、正确地选中一个工具,需要反复打磨 Prompt、设计各种兜底。现在这些能力越来越多地由模型本身承担,长上下文、原生工具调用、更强的指令遵循和多步推理,把大量原本需要工程去补的地方补上了。 二是 Agent 框架的功能持续丰富。从早期需要自己实现规划、记忆、工具注册和状态管理,到现在框架和协议层把这些抽象成标准组件,接一个工具、加一个 Skill,工作量都在显著下降。 两条曲线叠加,结论很直接:搭建 Agent 门槛正在逐年降低。这带来的直接变化是 Agent 落地场景越来越多,越来越发散。 评测认知的稀缺 自 2022 年底 ChatGPT(基于 GPT-3.5)发布以来,市场上出现了一波又一波 Agent 项目。但是那些真正走过冷启动、完成灰度扩量、推到全量的项目数量屈指可数。这导致掌握 Agent 评测方法的人非常稀缺。 过去三年绝大部分 Agent 项目都死掉了。它们消失的原因有一些共性: 停在 Demo:演示效果很好,一接真实流量就发现覆盖不住,用户的问法、数据的脏乱、场景的边界远超预期,团队疲于打补丁,最后不了了之。 卡在扩量:小范围试用还行,一放量各种问题集中暴露。团队既说不清问题出在哪一层,也不敢大改,因为改完不知道会不会把原来对的地方弄坏,项目在原地反复摇摆。 说不清业务价值:模型换了几轮,Prompt 迭代了几十版,团队自己觉得变好了,但拿不出证据。到了要资源、要继续投入的时候,回答不了“项目到底带来了什么”,最终停止投入。 这三种死法看起来不同,追下去会发现共同点:团队缺少一套可靠的判断机制。不知道当前版本行不行,不知道问题出在哪一层,不知道改完是真的变好还是换了个地方出错,也不知道怎么向外证明这件事的价值。做决策靠的是感觉和个别案例,而感觉在复杂系统面前不可靠。 把两件事放在一起看,会得到一个略显割裂的图景:搭 Agent 的门槛在快速降低,把 Agent 做好的认知却仍十分稀缺。并且,有限的评测认知面对发散的场景,同样力不从心。做好一个 ChatBot 的经验,并不能无缝泛化到做一个长程 Agent 身上。为此,我们希望将团队两年来在众多业务方中打磨出的评测的认知,以体系化的形式分享给大家,希望能帮大家少走一些弯路。 这个系列博客想做什么 前不久,我们发布了一篇博客《Agent 评测漫谈》,介绍了评测的核心方法论,回答的是“评测是什么、为什么这么做”。文章发出后,我们收到不少的反馈,其中出现频率最高的一类是:方法论看了,但具体到自己的项目,还是不知道从哪下手。 为此,我们计划撰写《Agent 评测白皮书》系列博客,体系化地为大家讲解评测的落地指南 —— 先做什么后做什么,每一步的产出物长什么样,做到什么程度算达标,遇到常见的坑怎么处理。计划分四篇: 本系列博客面向 Agent 产品、研发、算法、运营和评测负责人。如果你正在从零开始搭一个 Agent,或者手里的项目卡在某个阶段推不动,希望这几篇能提供一些可以直接用上的东西。…