美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
El equipo LongCat de Meituan lanzó MineExplorer, el primer benchmark que implementa tareas de largo alcance a nivel de minutos en el mundo abierto de "Mine...
El equipo LongCat de Meituan lanzó MineExplorer, el primer benchmark que implementa tareas de largo
alcance a nivel de minutos en el mundo abierto de "Minecraft", que incluye 813 casos de verificación manual. La evaluación de 18 modelos multimodales de primer nivel mostró que el modelo más fuerte, Claude-Opus-4.6, tuvo una tasa de éxito general en las tareas de solo 41%, descendiendo drásticamente del 77% en tareas de un salto al 12% en tareas de cuatro saltos, y casi el 60% de los fracasos se debe a errores de navegación. MineExplorer ya se encuentra completamente abierto al público.
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
美团 LongCat 团队发布 MineExplorer,面向《我的世界》开放世界中的分钟级长程任务,提供包含 813 个人工验证实例的评测基准。对 18 款顶级多模态大模型的测试显示,最强模型整体成功率为 41%。
材料显示,Claude-Opus-4.6 在 1 跳任务中的成功率为 77%,到 4 跳任务降至 12%;近 60% 的失败源于导航。MineExplorer 已全面开源,评测聚焦开放世界中的连续任务执行能力。
Aioga 判断,MineExplorer 的价值在于把多模态模型从短步骤响应带入更长链路、开放环境下检验。成功率随任务跳数明显下降,可能反映规划、执行衔接与空间导航仍是关键限制。
这项评测可能促使模型能力比较从单步完成扩展到长程任务稳定性,也为导航失败等具体问题提供可量化观察维度。由于材料未说明开源范围和使用方式,相关影响仍需结合实际复现判断。 值得关注后续基于 MineExplorer 的复测结果,包括不同模型在任务跳数增加后的表现,以及导航失败是否持续成为主要失败来源。对开源基准的实际采用情况,也应等待更多公开材料确认。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.
Canal de ingesta: Agregación de resúmenes · Dominio original: mp.weixin.qq.com
Fuente: 公众号:龙猫LongCat(美团)
Enlace original: Abrir fuente original
Archivo Aioga: Abrir página de inteligencia
Content record: summary-fallback · Updated: 2026-07-23T11:58:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga agrega novedades globales de IA y conserva las fuentes para verificación y cita.