美团 · 技术团队美团 · 技术团队
首页
历史文章
技术沙龙
关于我们
让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

美团LongCat 2026-07-24
LongCat开源大模型

假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。

此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。”

我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么?

为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。

MineExplorer 核心看点:

  • 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。
  • 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。
  • 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。

01 MineExplorer设计解密:让AI离开温室,走向动态世界

MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。

图1:MineExplorer自动化数据合成和评测范式简介

1.1 创新设计:构建一个动态开放的世界

创新点一:构建一个具备完整物理规则、会动态演化的世界

MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。

创新点二:隐藏前置条件的长程多跳任务

这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量:

  • 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。
  • 困难任务:由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。

我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。

图2:任务难度分布图

创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」

这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI 会不会玩 Minecraft」,而是「AI 能不能在一个动态物理世界里自主探索」。

图3:领域知识过滤图

1.2 构建方法:一套可复用的多智能体数据合成范式

构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程,五个专业 Agent 在一个群聊里协作,由一个 orchestrator 控制发言顺序:

整个流程分初始化和辩论(debate)两个阶段,先生成初稿,再由专家和验证器找出问题并修订。

如下表所示,人工评估结果显示,多智能体流程把有效率拉高了约 30 个百分点,质量分提升约 0.5 分,在最难的4-hop任务上优势尤其明显。最终,我们保留了 813 个通过人工验证的高质量复合任务实例。

表1:Benchmark质量人工评估表

1.3 能力覆盖:MineExplorer 到底在测什么?

MineExplorer 借鉴 ReAct 范式,把开放世界探索拆解成三大能力维度,共 14 项细粒度能力:

  • 感知(Perception): 空间、时序、实体、状态、资源。
  • 推理(Reasoning): 常识、因果、关系。
  • 行动(Action): 移动、跳跃、采集、放置、合成、攻击。

如图所示,最终的基准在三大维度上都有充足的覆盖,其中空间感知、移动、采集等基础能力出现频率最高,常识推理、因果推理也占了相当比例。

图4:能力覆盖分布图

02 核心洞察:18款顶级大模型测试,为何集体“考砸”了?

MineExplorer不仅定义了考题,更给出了18个顶级模型的真实分数。如下表所示,这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率(TSR)上的排行榜。

表2:主体评测结果表

我们发现,即便是表现最好的 Claude-Opus-4.6,整体成功率也只有 41 分。

| 洞察一:单跳尚可,多跳崩盘——问题就在隐藏前置条件

如图所示,最强模型Claude-Opus-4.6的表现,从1跳任务的77分,一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖,模型就掉一个台阶。

表3:分级评测结果图

图5:不同任务难度下的任务成功率对比图

| 洞察二:会看,但不会想 —— 感知强于推理

在几乎所有被测模型上,我们都观察到同一个规律:感知分数 > 行动分数 > 推理分数。如下图所示,以Claude-Opus-4.6为例,其整体感知分61.91,推理分54.71。瓶颈不在于看不见,而在于看懂了却无法串联成有效策略。

图6:维度评测热力图

| 洞察三:近60%的失败原因,都是因为走不到目标

我们对 Claude-Opus-4.6 的失败案例进行了归因分析。如下图所示,导航失败是最大的错误来源,占比近 60%。

图7:失败类型分布图

| 洞察四:给它更多步数、更多记忆,都不是解药

我们进一步做了消融实验,发现模型失败并非因为资源不足。

  • 步数:如图所示,能解的任务,模型在早期就解出来了;解不了的,给到 1800 步上限照样解不了。

图8:平均完成步数图

  • 记忆:如图所示,增加历史画面帧数到一定程度后,性能反而会下降,因为过期的观察会干扰对当前局面的判断。

图9:记忆帧数影响图

核心结论:瓶颈不在资源,而在模型没法把已有的信息和当前世界状态对齐。

03 总结:从看见世界到探索世界的鸿沟

MineExplorer 揭示了一个被乐观情绪掩盖的能力断层:当前的多模态大模型,已经具备了不错的感知力,但严重缺乏在动态世界中持续行动的探索力。

这对正在快速升温的具身智能赛道有几个直接的启示:

  • 感知层基本就绪,规划层是瓶颈。 模型能看懂环境,但把感知转化成长程、含隐藏前置的行动计划,才是从能看到能做之间真正的鸿沟。
  • 行业需要更接近真实复杂度的评测标准。在受控场景里跑通一个单步指令,不足以宣布AI能行动了。真实世界是动态的,充满未说明的前置条件,需要持续、长久化的探索。
  • 我们不仅提供了评测,还开源了自动合成任务的方法和训练环境。MineExplorer交付的不是一套静态题库,它还带着一整套自动合成长程任务的流程,和一个能直接拿来训练的Minecraft环境。评测、造题、训练,用的是同一套基础设施。

我们不是要给具身智能泼冷水。恰恰相反,把瓶颈定位清楚,比盲目乐观更有价值。MineExplorer提供的,正是这样一条诚实、可量化的能力基线。

看得见世界,不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界,必须先跨过的那道门槛。MineExplorer 已全面开源,欢迎各大模型前来挑战开放世界。

🚀 开源链接

  • Paper:https://arxiv.org/abs/2605.30931

  • GitHub:https://github.com/meituan-longcat/MineExplorer

  • HuggingFace:https://huggingface.co/datasets/meituan-longcat/MineExplorer

微信扫码关注
LongCat广告
技术沙龙
技术招聘
北斗招聘

推荐阅读

  • 1美团 LongCat-2.0 正式发布:国产芯片上跑出的万亿参数模型
  • 2用Agent评测思路管理AI Coding:31万行代码AI重构的实践
  • 3LongCat-Next:当视觉和语音成为AI的母语
  • 4美团 EvoCUA 刷新开源 SOTA,会用电脑还会持续进化的智能体!
  • 5LongCat-Flash-Thinking-2601 发布,工具调用能力登顶开源 SOTA
  • 6AI Coding与单元测试的协同进化:从验证到驱动
  • 72025 | 美团技术团队热门技术文章汇总
美团技术团队
CODE A BETTER LIFE
一行代码·亿万生活
美团技术团队,欢迎更多优秀技术人才加入
微信扫码关注美团技术团队