美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
Đội ngũ LongCat của Meituan đã phát hành MineExplorer, đây là tiêu chuẩn đánh giá đầu tiên thực hiện nhiệm vụ dài hạn theo phút trong thế giới mở của Minec...
Đội ngũ LongCat của Meituan đã phát hành MineExplorer, đây là tiêu chuẩn đánh giá đầu tiên thực hiện
nhiệm vụ dài hạn theo phút trong thế giới mở của Minecraft, bao gồm 813 trường hợp xác thực thủ công. Đánh giá 18 mô hình lớn đa phương diện hàng đầu cho thấy, mô hình mạnh nhất Claude-Opus-4.6 có tỷ lệ thành công tổng thể chỉ 41%, từ 77% cho nhiệm vụ 1 bước giảm xuống 12% cho nhiệm vụ 4 bước, gần 60% thất bại do lỗi điều hướng. MineExplorer đã được mở mã hoàn toàn.
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。
评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。
MineExplorer 已全面开源。
美团 LongCat 团队发布 MineExplorer,面向《我的世界》开放世界中的分钟级长程任务,提供包含 813 个人工验证实例的评测基准。对 18 款顶级多模态大模型的测试显示,最强模型整体成功率为 41%。
材料显示,Claude-Opus-4.6 在 1 跳任务中的成功率为 77%,到 4 跳任务降至 12%;近 60% 的失败源于导航。MineExplorer 已全面开源,评测聚焦开放世界中的连续任务执行能力。
Aioga 判断,MineExplorer 的价值在于把多模态模型从短步骤响应带入更长链路、开放环境下检验。成功率随任务跳数明显下降,可能反映规划、执行衔接与空间导航仍是关键限制。
这项评测可能促使模型能力比较从单步完成扩展到长程任务稳定性,也为导航失败等具体问题提供可量化观察维度。由于材料未说明开源范围和使用方式,相关影响仍需结合实际复现判断。 值得关注后续基于 MineExplorer 的复测结果,包括不同模型在任务跳数增加后的表现,以及导航失败是否持续成为主要失败来源。对开源基准的实际采用情况,也应等待更多公开材料确认。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Nguồn: 公众号:龙猫LongCat(美团)
原文链接: Mở nguồn gốc
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T11:58:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。