Aioga
AI资讯 / 技巧观点
返回 AI资讯

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Claude:Blog(网页)Aioga 编辑团队2026-07-16T16:00:00.000Z热度 64

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72....

技巧观点Claude:Blog(网页)

今日 AI 情报摘要

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。

该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。

中文正文 · AI 翻译

Nate Schmidt 在 Cursor 的工作是评估前沿模型在解决长期、现实工程问题上的能力。以下是原因——以及 Claude Fable 5 如何改变了编码代理能力的计算方式。

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Cursor 是一个用于构建专业软件的 AI 编码代理。它支持每一个主要的前沿模型以及 Cursor 自有的模型,这使得公司在评估每个模型实际表现时具有异常中立的立场。

Nate Schmidt 是维护该评分表的工程师。他在 Cursor 从事评估和模型行为研究:研究模型如何成功,如何失败,以及是什么让开发者在任务中悄悄切换到另一个模型。当同事和客户想了解新版本表现如何时,他们会找他。

随着时间的推移,Schmidt 的团队注意到公共基准评分与开发者对这些模型的实际反馈已不再一致,于是他们创建了自己的评测系统:CursorBench。

CursorBench 的建立是为了捕捉工程师实际提示模型时的零散、未具体说明的方式。一个评测任务只是粘贴一段堆栈跟踪并写上一个单词“fix”,模型必须自己推断意图、找到根本原因并验证修改。另一个任务告诉模型错误模块出了故障,以观察它是否质疑用户的假设,或者跟随假设走入死胡同。

当 Claude Fable 5 运行评测时,该模型在最大努力下获得了 72.9% 的成绩,创下新高,并展示了在搭配合适模型时,代理编码工具的潜力。

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

但当 Schmidt 在自己的工程工作流程和个人测试中使用该模型时,他不再需要重复目标。持续的“看护”——提醒模型上下文、详细说明解决方案、审核结果——已不再必要。他可以交给模型一个问题,从他一直拖延的复杂重构到对细微边缘情况的推理,Claude Fable 5 都能解决。

“我不觉得需要引导 Claude Fable 5 来理解我所处的世界以及我试图解决的问题,”Schmidt 说。“模型开箱即用就有这种感觉。”

当 Schmidt 的团队在 CursorBench 上测试新模型时,正确答案是基础。他们评分的是模型是否理解了被问的问题。

“许多评估看起来是这样的:这是一个定义清晰的问题,这是限制条件,去解决它。但是我们从真实用户那里收到的提示并不完全是这样,”施密特说。“模型必须推测用户有一个问题以及他们想表达的内容,确定根本原因,修复它,验证修复结果,并反馈。”

Claude Fable 5 在这些模糊任务中的表现如此出色,以至于 Cursor 团队开始产生怀疑。

“发生的要么是两件事之一:要么模型非常聪明,要么模型在作弊,”他说。因此团队查看了痕迹,阅读模型在最困难任务中的实际推理,这些任务提示看起来简单,但破解它需要理解整个系统。

“我们一直看到模型挖掘出其他模型以前无法做到的成功方案,”他说。它还用更少的操作就达到了目的:相对于完成的工作来说,它的令牌效率更高。

然后施密特将 Claude Fable 5 放在他最喜欢的个人测试之一上:登月。

几周前,他用一行提示把 Claude Opus 接入可编程的航天飞行模拟器——建造一枚火箭并把它降落在月球上——让它在第二个显示器上运行十二到十六小时。模型会发射,在轨道上燃料耗尽,增加很多燃料,然后因火箭太重而无法穿越大气层。

他用同样的空白提示重新进行了实验,这次使用 Claude Fable 5。几分钟后,火箭升空,停在低轨道,然后返回地面。和以前一样失败。随后施密特阅读了记录。

“Fable 决定第一次尝试不直接登月。它想先进行初步任务,只进入轨道收集遥测数据,然后利用这些数据指导下一次飞行。”几次尝试后,他第二个显示器上的引擎噪音停止了。月球上出现了登月器。整个过程花了几个小时,而 Opus 花了十二小时以上却没有结果。

“Opus 是做局部推理——考虑刚刚发生了什么以及接下来会发生什么,”施密特说。“Fable 是做全局推理。它考虑的是整个任务。”

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

施密特已经为何时使用 Claude Fable 5 而非更便宜、智能较低的模型制定了一个简单的规则。

“如果你对从 A 到 B 的路径有很好的把握,你可能不需要 Fable。如果你在 A 点而完全不知道 B 在哪里,Fable 是一个极好的选择,”他说。“当我想要以正确的方式构建某些东西时,Fable 是我首先想到的模型。”

Claude Fable 5 也让他的团队能够专注于之前搁置的项目——这些重写每个人都认为会更好,但没人能证明值得花几周时间去做——因为该模型可以承担足够的框架。“它降低了处理这类任务的启动能量,”施密特说。“它让我们能够寻找全局最优,而不是局部最优。”

它还改变了团队的协作方式。Cursor 运行精简,个人承担责任感强,很少开站会。现在,在接触共享代码之前,施密特先让一个代理阅读队友最近的提交并标记冲突,这样双方都无需停止手头工作去检查代码。

为了平衡成本和性能,他的团队将 Claude Fable 5 与更快、更轻的模型搭配用于常规工作,而在能力受限的问题上再启用 Fable。他说,在这种配置下,这种组合是他们运行过的最有效的设置。

“如果我要处理一个非常棘手的问题——问题的 P99——我试图优化的目标是解决问题的时间,”他说。“我认为 Fable 是解决我们最难问题的最佳模型。”

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

尽管让模型在 CursorBench 上接受考验并将其发送到月球,施密特仍在寻找 Claude Fable 5 的极限。接下来,他想看看模型在无人干预的情况下能管理后端系统多久;几天到几周的运行是他的下一个实验。在 Cursor 内部,团队使用该模型主动寻找性能瓶颈和用户痛点,而不是等待报告,并构建更复杂、更接近现实的评测环境,以衡量接下来的任何情况。

“有一类问题,人们甚至没有去考虑过,因为它看起来不可接近,”他说。“有了 Fable,我很兴奋去挑战它。”

开始使用 Claude Fable:http://anthropic.com/news/claude-fable-5-mythos-5.

探索更多产品新闻以及团队使用Claude时的最佳实践。

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

产品更新、操作指南、社区聚焦等内容。每月发送到您的收件箱。

嗨,Claude!你能帮我为某个受众群体打造独特的声音吗?如果你需要更多信息,请立即向我提1-2个关键问题。如果你认为我应该上传任何有助于你更好完成工作的文件,请告诉我。你可以使用你可以访问的工具——比如Google云端硬盘、网络搜索等——如果它们能帮助你更好地完成这项任务。请不要使用分析工具。请保持回复友好、简短和对话式。请尽快执行这项任务——如果可能的话,提供一个成果会很好。如果使用成果,请考虑哪种类型的成果(互动的、视觉的、清单等)对这项特定任务最有帮助。谢谢你的帮助!

嗨,Claude!你能帮我改进写作风格吗?如果你需要更多信息,请立即向我提1-2个关键问题。如果你认为我应该上传任何有助于你更好完成工作的文件,请告诉我。你可以使用你可以访问的工具——比如Google云端硬盘、网络搜索等——如果它们能帮助你更好地完成这项任务。请不要使用分析工具。请保持回复友好、简短和对话式。请尽快执行这项任务——如果可能的话,提供一个成果会很好。如果使用成果,请考虑哪种类型的成果(互动的、视觉的、清单等)对这项特定任务最有帮助。谢谢你的帮助!

嗨,Claude!你能帮我头脑风暴一些创意想法吗?如果你需要更多信息,请立即向我提1-2个关键问题。如果你认为我应该上传任何有助于你更好完成工作的文件,请告诉我。你可以使用你可以访问的工具——比如Google云端硬盘、网络搜索等——如果它们能帮助你更好地完成这项任务。请不要使用分析工具。请保持回复友好、简短和对话式。请尽快执行这项任务——如果可能的话,提供一个成果会很好。如果使用成果,请考虑哪种类型的成果(互动的、视觉的、清单等)对这项特定任务最有帮助。谢谢你的帮助!

嗨 Claude!你能把一个复杂的主题讲得简单明白吗?如果你需要我提供更多信息,请马上问我 1-2 个关键问题。如果你觉得我应该上传任何文档来帮助你更好地完成任务,请告诉我。你可以使用你可以访问的工具——比如 Google Drive、网络搜索等——如果它们能帮助你更好地完成这个任务。请不要使用分析工具。请保持你的回答友好、简短且像聊天一样。请尽快执行任务——如果有适用的作品展示会更好。如果使用作品展示,请考虑哪种类型的作品(互动的、可视化的、清单等)对这个特定任务最有帮助。谢谢你的帮助!

嗨 Claude!你能帮我弄明白这些想法吗?如果你需要我提供更多信息,请马上问我 1-2 个关键问题。如果你觉得我应该上传任何文档来帮助你更好地完成任务,请告诉我。你可以使用你可以访问的工具——比如 Google Drive、网络搜索等——如果它们能帮助你更好地完成这个任务。请不要使用分析工具。请保持你的回答友好、简短且像聊天一样。请尽快执行任务——如果有适用的作品展示会更好。如果使用作品展示,请考虑哪种类型的作品(互动的、可视化的、清单等)对这个特定任务最有帮助。谢谢你的帮助!

嗨 Claude!你能帮我准备考试或面试吗?如果你需要我提供更多信息,请马上问我 1-2 个关键问题。如果你觉得我应该上传任何文档来帮助你更好地完成任务,请告诉我。你可以使用你可以访问的工具——比如 Google Drive、网络搜索等——如果它们能帮助你更好地完成这个任务。请不要使用分析工具。请保持你的回答友好、简短且像聊天一样。请尽快执行任务——如果有适用的作品展示会更好。如果使用作品展示,请考虑哪种类型的作品(互动的、可视化的、清单等)对这个特定任务最有帮助。谢谢你的帮助!

嗨,Claude!你能解释一个编程概念吗?如果你需要我提供更多信息,请立即问我1-2个关键问题。如果你认为我应该上传任何有助于你更好完成任务的文件,请告诉我。你可以使用你能访问的工具——比如Google Drive、网络搜索等——如果它们能帮助你更好地完成这个任务。不要使用分析工具。请保持回答友好、简短并具有对话感。请尽快执行任务——如果有合适的工具或资料,提供一个会很棒。如果使用资料,请考虑哪种类型的资料(互动、可视化、清单等)对这个特定任务可能最有帮助。谢谢你的帮助!

嗨,Claude!你能查看我的代码并给我一些建议吗?如果你需要我提供更多信息,请立即问我1-2个关键问题。如果你认为我应该上传任何有助于你更好完成任务的文件,请告诉我。你可以使用你能访问的工具——比如Google Drive、网络搜索等——如果它们能帮助你更好地完成这个任务。不要使用分析工具。请保持回答友好、简短并具有对话感。请尽快执行任务——如果有合适的工具或资料,提供一个会很棒。如果使用资料,请考虑哪种类型的资料(互动、可视化、清单等)对这个特定任务可能最有帮助。谢谢你的帮助!

嗨,Claude!你能和我一起即兴编程吗?如果你需要我提供更多信息,请立即问我1-2个关键问题。如果你认为我应该上传任何有助于你更好完成任务的文件,请告诉我。你可以使用你能访问的工具——比如Google Drive、网络搜索等——如果它们能帮助你更好地完成这个任务。不要使用分析工具。请保持回答友好、简短并具有对话感。请尽快执行任务——如果有合适的工具或资料,提供一个会很棒。如果使用资料,请考虑哪种类型的资料(互动、可视化、清单等)对这个特定任务可能最有帮助。谢谢你的帮助!

嗨,Claude!你能写拨款提案吗?如果你需要更多信息,请立即问我1-2个关键问题。如果你认为我应该上传任何有助于你更好完成工作的文件,请告诉我。你可以使用你能够访问的工具——比如Google Drive、网络搜索等——如果它们能帮助你更好地完成这项任务。不要使用分析工具。请保持你的回应友好、简短和对话式。请尽快执行任务——如果有一个成果物会更好,如果合适的话。如果使用成果物,请考虑哪种类型的成果物(互动、视觉、清单等)对这个特定任务最有帮助。感谢你的帮助!

情报判断

Aioga 编辑摘要

Cursor 模型评估工程师 Nate Schmidt 的测试显示,Claude Fable 5 在内部基准 CursorBench 的 Max effort 模式下取得 72.9%,并刷新该基准最高成绩。

背景分析

Cursor 团队认为公开基准成绩与开发者实际反馈逐渐脱节,因此建立 CursorBench,用模糊、信息不足甚至包含错误假设的提示,评估模型处理真实工程问题的能力。

Aioga 观点

Aioga 判断,这一成绩的价值主要在于展示模型面对非标准化编程任务时的表现,而非证明其在所有开发场景中占优;CursorBench 属于 Cursor 内部基准,解读时应保留边界。

影响与后续

该结果可能促使开发团队更加重视模型对意图、根因和上下文的自主判断,也可能减少部分任务中的重复说明与过程监督,但材料未提供跨模型完整数据或外部复现结果。 值得关注 Cursor 是否公开 CursorBench 的任务构成、评分方法和完整对比结果,以及 Claude Fable 5 在不同努力模式、更多真实项目和独立评测中的表现是否保持一致。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: claude.com

来源: Claude:Blog(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-16T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72....

Claude:Blog(网页)2026-07-16T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。