Fashion

  • Agent评测漫谈 —— 由浅入深讲解Agent评测

    ·

    本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。 本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。 一、Agent评测是什么 1.1 评测的核心目的 评测的核心目的是为了回答 Agent 的好不好?以及到底哪里好,哪里不好? 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。 这也是为什么 Agent 评测不能只停留在离线打榜,更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。 而Agent评测的基石是观测,因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代 1.2 Agent评测与传统模型评测的不同 评测方法会随着 AI 形态变化而变化,大致经历了三个阶段: 传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是: 当模型被放进一个真实系统里,和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后,它能不能稳定交付好的结果。 这意味着 Agent 的评测对象已经不再是单一模型,而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。 1.3 为什么Agent评测不是只看结果,还要看行为和过程 在真实场景中,两个 Agent 可能最终都“做对了”,但工程价值完全不同: 一个路径清晰、工具调用稳定、耗时可控、可重复复现 一个反复试错、路径混乱、靠偶然命中结果、不可复现 如果只看最终答案,这两者会被误判为同一水平;但从规模化、成本优化、用户体验的角度看,差别非常大。 因此,Agent 评测至少需要覆盖四层内容: 结果层:任务是否完成,输出是否可用 过程层:规划是否合理,步骤是否稳定 效率层:耗时、Token、工具调用次数是否可接受…

    Read More

  • 美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化

    ·

    本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。 现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。 不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。 目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。 全时段运行,多终端协作的 AI 智能工作台 01 移动/PC/云端,全时段多端协作 提供独立的移动端 App 与 PC 客户端,双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策;PC 端专注本地深度执行,具备文件操作、浏览器控制与终端命令等完整能力。 云端模式支持 7 × 24 小时不间断运行,即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转,完成后随时打开手机或电脑即可查看成果。…

    Read More

  • 下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

    ·

    过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题? 美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。 LoHoSearch 的核心”硬核”看点 知识图谱自动化构造。 以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准含544道经人工核验的题目,覆盖11个领域。 双维度难度控制。 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。 当前模型性能表现。 已评测模型中,GPT-5.5准确率为34.74%;现有上下文管理策略在LoHoSearch上提升幅度为6.8%,低于在BrowseComp上的14.03%。 01 设计原理:让机器出题,需要几部? 机器出题的前提,是让机器拥有全局视野。整个构建流程可以分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。 1.1 建图:搭建知识图谱,让机器获得全局视野 LoHoSearch 的第一步,是从完整的英文维基百科出发搭建一张大规模知识图谱: 762 万个实体(每个维基页面是一个实体节点) 2.65 亿条有向边(页面正文中指向其他维基页面的超链接) 每个实体的类型取自其 Wikidata P31 类别,实体热度用入度来衡量 这张图谱为后续在全局视角下挑选”难题”提供了基础。 有了图谱之后,下一个问题是:什么样的题目才算”难”?LoHoSearch 从两个维度来定义难度。 1.2 控制难度:搜索空间和结构复杂度两个维度 决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的: 搜索空间:满足一个条件的候选实体有多少。候选越多,排除成本越高。 结构复杂度:要同时满足多少条件才能锁定答案。条件越多、咬合越紧,求解链条越长。 针对这两个维度,LoHoSearch 设计了两种子图结构: 树结构主要通过放大”搜索空间”来制造难度。 图结构则在巨大搜索空间之上,通过引入环形依赖和交叉约束,进一步叠加了”结构复杂度”。 1.3…

    Read More

  • 让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

    ·

    假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。 MineExplorer 核心看点: 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。 01 MineExplorer设计解密:让AI离开温室,走向动态世界 MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。 1.1 创新设计:构建一个动态开放的世界 创新点一:构建一个具备完整物理规则、会动态演化的世界 MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。 创新点二:隐藏前置条件的长程多跳任务 这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量: 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。 困难任务:由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。 我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。 创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」 这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI…

    Read More

  • 业绩快报|海底捞去年客流超4亿,收入、净利润实现连续两年增长

    ·

    3月25日,海底捞国际控股有限公司(以下简称“海底捞”)公布截至2024年12月31日的年度业绩报告。 数据显示,2024年海底捞实现营业收入427.6亿元,同比上升3%;净利润47亿元,同比增长4.6%。核心经营利润为62.3亿元,同比上升18.7%。收入、净利润实现连续两年增长。  门店扩张上,截至2024年年底,海底捞品牌共经营1368家餐厅,其中自营餐厅中国大陆地区1332家,港澳台地区共23家,加盟餐厅共13家。 海底捞2024年全年共接待顾客4.15亿人次,日均客流量超110万人次,较上年增加4.5%,平均翻台率达到4.1次/天。截至2024年年末,海底捞会员人数已超过1.8亿人,活跃会员数超过5200万人,较去年提升8.8%。 产品层面,海底捞根据不同地区的饮食习惯和食材供应,调整上架菜品和小料台调料搭配。数据显示,2024年,海底捞全年推出了超20款全国新品和超200款区域特色菜品,包括北京区域的鲜切山羊肉、陕西区域的油泼辣子锅底、湖北区域的藕汤锅底等产品。 场景层面,为满足特定顾客的延伸需求,2024年海底捞陆续推出包间店、亲子主题店、夜宵主题店以及与大型企业合作的企业店等不同形式特色场景店。 价格方面,采取“绝对好、相对便宜”的定价思路,门店根据自身情况精准执行差异化定价策略。针对外卖就餐场景,海底捞外送业务从2023年下半年开始推出“一人食”精品快餐。基于以上业务开展,海底捞外卖收入增加20.4%至12.54亿元。 2024年8月,海底捞宣布实施“红石榴计划”,旨在鼓励孵化和发展更多的餐饮新品牌,推动餐饮服务创新。年报显示,截至2024年末,海底捞集团通过内部创业创立了包括焰请烤肉铺子、火焰官、小嗨火锅等11个餐饮品牌共计74家门店,覆盖正餐、简餐、快餐等不同消费场景。 基于以上创新餐饮品牌及露营火锅、校园火锅、企业火锅等多种餐饮场景的贡献,2024年海底捞其他餐厅收入4.83亿元,同比增长39.6%。 2024年,海底捞正式启动加盟业务,截至2024年年末完成13家加盟门店的审核与落地,初步验证了加盟模式在规模化布局中的可行性。海底捞表示,加盟模式实施以来,下沉市场展现出强劲需求,超70%的加盟申请来自三线及以下城市,其中有不少来自县级城市。

    Read More

  • 陈果出任东方财富证券研究所副所长、首席策略官

    ·

    陈果将加盟东方财富证券研究所,拟任东方财富证券研究所副所长、首席策略官。陈果曾任职于申万、广发、长江、国投、中信建投等券商,多次获得新财富,提出过“信心重估牛”等市场观点。2024年以来,券商研究所的人才流动情况显著增多,国泰君安、天风、东吴、财通、华福等多家券商研究所的核心人员发生变动。(财联社)

    Read More

  • 最前线|剑指小鹏MONA,比亚迪秦L EV售价11.98万元起,全系标配天神之眼高阶智驾

    ·

    2025 年 3 月 23 日比亚迪王朝网正式发布全新中级纯电轿车 ——秦L EV,以 “全系后驱、全系智驾、中级空间” 三大核心优势,进军10万级纯电轿车市场。作为比亚迪 “技术普惠” 战略的里程碑之作,比亚迪希望秦L EV可以凭借越级配置与极致性价比,吸引更多的年轻消费群体,开启全民智驾新时代。 秦L EV价格(来源:企业授权) 据发布会介绍,秦L EV 全系标配天神之眼 C – 高阶智驾三目版(DiPilot 100),配备 29 个同级领先的硬件传感器,带来高快领航功能,可以实现早高峰高快路车流中自如跟车、智能避让加塞以及高速场景领航功能,从而缓解通勤焦虑;同时,秦L EV 支持全场景智能泊车,拥有自动泊车、代客泊车、遥控泊车三大技能,可以轻松应对断头路、狭窄车位等复杂场景,解决停车痛点,为用户打造更安全、智能的用车体验。 秦L EV(来源:企业授权) 在外观上,这辆新车采用比亚迪全新一代 Long Face 龙颜美学,以长车头、短车尾的黄金比例搭配溜背造型,赋予车身动感姿态。并提供四种配色,茶晶灰、润玉白、冰珀青、哥窑米,其灵感源自中国名瓷,将千年文化底蕴与现代潮流完美融合,成为移动的东方美学符号。 秦L EV 全系标配“冰箱 + 彩电 + 大沙发” 以及智能座舱,搭载同级唯一冷暖冰箱(-6℃至 55℃温控)、2+1 屏幕组合(W-HUD+8.8 英寸仪表 + 15.6 英寸旋转中控屏)及主副驾电动调节通风 / 加热座椅,辅以车载 ETC 与 VTOL 移动电站,满足全场景需求。 作为中级纯电轿车,秦L EV 拥有…

    Read More