美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
Il team LongCat di Meituan ha rilasciato MineExplorer, il primo benchmark di valutazione che realizza attività a lungo termine a livello di minuti nel mond...
Il team LongCat di Meituan ha rilasciato MineExplorer, il primo benchmark di valutazione che
realizza attività a lungo termine a livello di minuti nel mondo aperto di Minecraft, comprendente 813 casi verificati manualmente. La valutazione di 18 principali modelli multimodali ha rilevato che il modello più potente, Claude-Opus-4.6, ha un tasso di successo complessivo delle attività di solo il 41%, scendendo dal 77% nelle attività con 1 salto al 12% nelle attività con 4 salti, con quasi il 60% dei fallimenti dovuto a errori di navigazione. MineExplorer è stato completamente reso open source.
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
美团 LongCat 团队发布 MineExplorer,面向《我的世界》开放世界中的分钟级长程任务,提供包含 813 个人工验证实例的评测基准。对 18 款顶级多模态大模型的测试显示,最强模型整体成功率为 41%。
材料显示,Claude-Opus-4.6 在 1 跳任务中的成功率为 77%,到 4 跳任务降至 12%;近 60% 的失败源于导航。MineExplorer 已全面开源,评测聚焦开放世界中的连续任务执行能力。
Aioga 判断,MineExplorer 的价值在于把多模态模型从短步骤响应带入更长链路、开放环境下检验。成功率随任务跳数明显下降,可能反映规划、执行衔接与空间导航仍是关键限制。
这项评测可能促使模型能力比较从单步完成扩展到长程任务稳定性,也为导航失败等具体问题提供可量化观察维度。由于材料未说明开源范围和使用方式,相关影响仍需结合实际复现判断。 值得关注后续基于 MineExplorer 的复测结果,包括不同模型在任务跳数增加后的表现,以及导航失败是否持续成为主要失败来源。对开源基准的实际采用情况,也应等待更多公开材料确认。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Fonte: 公众号:龙猫LongCat(美团)
原文链接: Apri la fonte originale
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T11:58:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。