美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
Zespół Meituan LongCat opublikował MineExplorer, który jest pierwszym w świecie otwartym gry „Minecraft” benchmarkiem zadań długoterminowych realizowanych...
Zespół Meituan LongCat opublikował MineExplorer, który jest pierwszym w świecie otwartym gry
„Minecraft” benchmarkiem zadań długoterminowych realizowanych w minutach, zawierającym 813 ręcznie zweryfikowanych przypadków. Ocena 18 najlepszych wielomodalnych dużych modeli wykazała, że najsilniejszy model Claude-Opus-4.6 osiągnął ogólny wskaźnik sukcesu zadań zaledwie 41%, spadając gwałtownie z 77% w zadaniach skoków 1 do 12% w zadaniach skoków 4, a prawie 60% niepowodzeń wynikało z błędów nawigacji. MineExplorer został w pełni udostępniony jako open source.
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
美团 LongCat 团队发布 MineExplorer,面向《我的世界》开放世界中的分钟级长程任务,提供包含 813 个人工验证实例的评测基准。对 18 款顶级多模态大模型的测试显示,最强模型整体成功率为 41%。
材料显示,Claude-Opus-4.6 在 1 跳任务中的成功率为 77%,到 4 跳任务降至 12%;近 60% 的失败源于导航。MineExplorer 已全面开源,评测聚焦开放世界中的连续任务执行能力。
Aioga 判断,MineExplorer 的价值在于把多模态模型从短步骤响应带入更长链路、开放环境下检验。成功率随任务跳数明显下降,可能反映规划、执行衔接与空间导航仍是关键限制。
这项评测可能促使模型能力比较从单步完成扩展到长程任务稳定性,也为导航失败等具体问题提供可量化观察维度。由于材料未说明开源范围和使用方式,相关影响仍需结合实际复现判断。 值得关注后续基于 MineExplorer 的复测结果,包括不同模型在任务跳数增加后的表现,以及导航失败是否持续成为主要失败来源。对开源基准的实际采用情况,也应等待更多公开材料确认。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Źródło: 公众号:龙猫LongCat(美团)
原文链接: Otwórz źródło oryginalne
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T11:58:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。