Aioga
AI资讯 / 行业动态
返回 AI资讯

Simon Willison 用 pelican 基准实测 Claude Fable 5.1 的五个推理档位

Simon Willison 博客Aioga 编辑团队2026-09-01T23:57:28.000Z热度 58

Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。Anthropic 称该模型在 Terminal-Bench-Scien...

行业动态Simon Willison 博客

今日 AI 情报摘要

Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。

Anthropic 称该模型在 Terminal-Bench-Science 0.1 上得 52.6%,高于 Fable 5 的 24.7%。

中文正文 · AI 翻译

今天是 Claude Fable(以及 Mythos)5.1 发布日:https://www.anthropic.com/claude-fable-and-mythos-5-1。Anthropic 表示 Fable 5.1 “为编程、知识工作和长期问题解决任务设定了新标准”。他们的公告中有相当多的篇幅讨论科学研究,炫耀在全新的 Terminal-Bench-Science 0.1 基准测试中获得了 52.6% 的得分:https://www.terminal-bench-science.ai(首次发布于 8 月 27 日:https://www.tbench.ai/news/terminal-bench-science-0-1),相比 Fable 5 的 24.7%、Opus 5 的 29.0% 和 GPT-5.6 Sol 的 22.4% 有显著提升。其他基准测试显示成绩略有提升,但没有一个像科学基准测试那样令人印象深刻。

回到七月,我写过一篇文章:https://simonwillison.net/2026/Jul/16/kimi-k3/ 讲述我对 pelican 基准测试信心下降——它与模型在其他任务表现的相关性似乎不像 2025 年:https://simonwillison.net/2025/Jun/6/six-months-in-llms/ 那样强。现在我从中得到的最有趣的见解是模型家族内部的比较,尤其是同一提示在不同推理努力水平下的比较。

Fable 5.1 有五个推理等级:低、中、高、超高、极限——且没有完全关闭推理的选项。

我在 llm-anthropic:https://github.com/simonw/llm-anthropic 修复了一个问题:https://github.com/simonw/llm-anthropic/issues/88,该问题导致推理跟踪未被正确记录,然后运行了一些提示。

这是所有推理等级的 pelican 全套数据:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7,每个都有完整的推理记录。我将在这里复现它们:

接下来,有点小谜题。这是我在低努力水平下得到的结果:

Minimalist flat illustration of a white pelican with an orange beak riding a black bicycle to the left, its orange legs pedaling and wings gripping the handlebars, with motion lines behind on a light blue background.

记录:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#options 没有显示任何总结过的推理 token,输出 token 数为 1,998。在 Claude 中,这个输出 token 数包括推理 token。耗时 23.8 秒,费用为 10.017 美分:https://www.llm-prices.com/#it=27&ot=1998&sel=claude-fable-5-1。

我将其提升到中等水平,得到如下结果:

Minimalist flat-style illustration of a white pelican with an orange beak riding a black bicycle to the right, with motion lines behind it, on a light blue background.

奇怪的是,这个也没有显示推理文本:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#options-1,并且使用了1,977个输出标记——比低设置少21个标记。它花了23秒,花费9.912美分:https://www.llm-prices.com/#it=27&ot=1977&sel=claude-fable-5-1。

所以对于这个特定的提示(“生成一只骑自行车的鹈鹕的SVG”),Fable 5.1在低和中设置下似乎完全跳过了推理。

这是高设置——29.6秒,2,612个输出标记,13.087美分:https://www.llm-prices.com/#it=27&ot=2612&sel=claude-fable-5-1:

Minimalist flat illustration of a white pelican with an orange beak riding a black bicycle, its orange legs pedaling, with motion lines behind it on a light blue background.

这个做了一些推理,摘要在这里:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#reasoning:

我正在规划一只骑自行车的鹈鹕的SVG布局,有天空和地面的背景,一辆有两个辐条轮子的自行车,车架、座位和车把,以及一只白色身体、长脖子、橙色喙的鹈鹕,位于自行车顶部。

不过,其实低档和中档差别不大。

在xhigh设置下情况完全不同。36,767个输出标记,7分51秒,1.83美元:https://www.llm-prices.com/#it=27&ot=36767&sel=claude-fable-5-1!

Minimalist flat illustration of a white pelican with an orange beak riding a black bicycle to the left, its orange legs pedaling, with motion lines behind it on a light blue background.

推理过程相当冗长:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#reasoning-1,并包含如下细节:

添加眼睛,翅膀伸展至车把握把,橙色的腿伸向踏板,还有一根小尾羽,同时让鹈鹕故意相比自行车过大以达到喜剧效果。[...]

我会接受略厚的设计,觉得这是可爱,而不是过度工程化。

将努力设置为最大值为我展示了Anthropic任何模型中最佳的鹈鹕。65,927个输出标记,13分54秒,3.30美元:https://www.llm-prices.com/#it=27&ot=65927&sel=claude-fable-5-1:

Minimalist flat illustration of a white pelican with an orange beak riding a black bicycle, its orange legs pedaling, with motion lines behind to indicate speed, on a light blue background.

这个有很多优点。背景很雅致,双腿清楚地分布在车架两侧,脚踏在踏板上,翅膀放在车把上,鹈鹕戴着可爱的蓝色帽子,还有一个装鱼的篮子。

它仍然没有像 Gemini 3.7 Flash 那样展示出几乎相同的风格:https://simonwillison.net/2026/Aug/13/llm-gemini/,但我没有要求风格——我要求的是一个 SVG,而我得到了它。

该推理追踪的一些亮点:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#reasoning-2:

在两只脚附近添加踏板形状,远处的第二条腿的脚从框架后面部分可见。我在考虑是否添加一条小围巾或帽子来增加角色感,但倾向于保持简单以避免杂乱。

现在我在权衡在头上戴自行车头盔还是保留鹈鹕标志性的冠——喙和袋子已经清楚地表现为“鹈鹕”,所以头盔可以强化自行车主题而不丢失身份,尽管它可能会与冠争夺视觉空间。

我意识到位于 (484,84) 的喙会与圆顶头盔重叠,因此我需要缩小头盔,使其只覆盖头顶,调整其弧形端点,使其更高更窄,以便喙可以在前方干净地附着而不碰撞。 [...]

我正在添加一个更深的顶端区域来表示主要羽毛,然后重新考虑尾缘,改为包括扇形羽毛曲线而不是一条光滑的线,使其看起来更自然。 [...]

现在我正在检查头盔通风孔的摆放位置,确保它们在考虑笔划宽度和圆形帽端的情况下,位于头盔边缘足够内部,并确认每个通风孔保持在头盔的圆形边界内。 [...]

我决定跳过车把铃和轮胎高光,因为它们是多余的添加。现在我在重新考虑前叉的曲线——当前的控制点会向后拉形状,而它应该向前拱起以获得正确的叉距,因此我需要将控制点右移以修正叉的倾斜。

在 Hacker News 上,swalsh 评论道:https://news.ycombinator.com/item?id=49525378#49526455 关于那个 Max pelican:

现在它已经成为一个已解决的基准,我们可以得到动画版本吗?

我不想再花 3 美元,所以我将 Max 鹈鹕导入默认的高思考级别:

6,121 输入,26,201 输出 = $1.37:https://www.llm-prices.com/#it=6121&ot=26201&sel=claude-fable-5-1。结果如下:https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F87282467acb3652e0f99c85155554a32#response,由于有些人无法查看动画 SVG,因此在此导出为视频:

您的浏览器不支持 HTML5 视频。

视频中的轮子旋转方向不对,但我认为这是转换为 MP4 的产物——在原始 SVG 中它们似乎是朝正确方向旋转的。

这是 Claude Fable 5.1 为我制作的一个非常漂亮的动画鹈鹕,由 Simon Willison 发布于 2026 年 9 月 1 日:/2026/Sep/1/。

上一篇:理解 ChatGPT 的工作:/2026/08/30/understanding-chatgpt-work/

每月赞助我 $10,即可获得精选邮件摘要,内容涵盖当月最重要的 LLM 发展。

情报判断

Aioga 编辑摘要

Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的五个推理档位。材料显示,该模型提供 low、medium、high、xhigh、max 五档,且没有关闭推理的选项。

背景分析

Anthropic 称 Claude Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,高于 Fable 5 的 24.7%。Simon Willison 同时指出,其他基准的提升相对有限。

Aioga 观点

Aioga 判断:这次材料的重点不只是单项基准分数,还包括同一模型在不同推理档位下的表现比较。来源也提示,pelican 更适合观察模型家族内部差异,不能直接代表全部任务能力。

影响与后续

可能影响:模型评估需要同时关注基准类型、推理档位与成本信息。单项科学基准的明显提升,不代表所有任务都会同步改善;使用方需要结合具体场景验证,并评估是否有必要采用更高推理档位。 后续观察:应继续关注 Simon Willison 对 medium、high、xhigh 和 max 档位的实测结果,以及各档位的耗时、输出规模和费用差异;现有摘录尚未完整呈现这些比较。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: simonwillison.net

来源: Simon Willison 博客

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T23:57:28.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。Anthropic 称该模型在 Terminal-Bench-Scien...

Simon Willison 博客2026-09-01T23:57:28.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。