美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
메이투안 LongCat 팀이 MineExplorer를 출시했습니다. 이는 《마인크래프트》 오픈 월드에서 분 단위 장거리 임무를 구현한 최초의 평가 기준으로, 813개의 인공 검증 사례를 포함하고 있습니다. 18종의 최고급 멀티모달 대형 모델을 평가한 결과, 가장 강력한 모델 C...
메이투안 LongCat 팀이 MineExplorer를 출시했습니다. 이는 《마인크래프트》 오픈 월드에서 분 단위 장거리 임무를 구현한 최초의 평가 기준으로, 813개의 인공 검증
사례를 포함하고 있습니다. 18종의 최고급 멀티모달 대형 모델을 평가한 결과, 가장 강력한 모델 Claude-Opus-4.6의 전체 임무 성공률은 단 41%였으며, 1점 점프 임무의 77%에서 4점 점프 임무의 12%로 급격히 감소했고, 실패의 약 60%가 내비게이션 실패에서 비롯되었습니다. MineExplorer는 이미 전면적으로 오픈 소스화되었습니다.
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
美团 LongCat 团队发布 MineExplorer,面向《我的世界》开放世界中的分钟级长程任务,提供包含 813 个人工验证实例的评测基准。对 18 款顶级多模态大模型的测试显示,最强模型整体成功率为 41%。
材料显示,Claude-Opus-4.6 在 1 跳任务中的成功率为 77%,到 4 跳任务降至 12%;近 60% 的失败源于导航。MineExplorer 已全面开源,评测聚焦开放世界中的连续任务执行能力。
Aioga 判断,MineExplorer 的价值在于把多模态模型从短步骤响应带入更长链路、开放环境下检验。成功率随任务跳数明显下降,可能反映规划、执行衔接与空间导航仍是关键限制。
这项评测可能促使模型能力比较从单步完成扩展到长程任务稳定性,也为导航失败等具体问题提供可量化观察维度。由于材料未说明开源范围和使用方式,相关影响仍需结合实际复现判断。 值得关注后续基于 MineExplorer 的复测结果,包括不同模型在任务跳数增加后的表现,以及导航失败是否持续成为主要失败来源。对开源基准的实际采用情况,也应等待更多公开材料确认。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: mp.weixin.qq.com
출처: 公众号:龙猫LongCat(美团)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-23T11:58:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.