让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层
·
假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。 MineExplorer 核心看点: 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。 01 MineExplorer设计解密:让AI离开温室,走向动态世界 MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。 1.1 创新设计:构建一个动态开放的世界 创新点一:构建一个具备完整物理规则、会动态演化的世界 MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。 创新点二:隐藏前置条件的长程多跳任务 这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量: 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。 困难任务:由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。 我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。 创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」 这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI…