Aioga
AI资讯 / 行业动态
返回 AI资讯

Fable 5.1 体验评测:Anthropic Is So Back(again)

Every:最新文章(网页)Aioga 编辑团队2026-09-01T19:29:04.000Z热度 58

Every 发布 Fable 5.1 的体验评测文章,标题称 Anthropic Is So Back(Again)。正文未提供有效文本,具体评测内容以原文为准。

行业动态Every:最新文章(网页)

今日 AI 情报摘要

Every 发布 Fable 5.1 的体验评测文章,标题称 Anthropic Is So Back(Again)。

正文未提供有效文本,具体评测内容以原文为准。

中文正文 · AI 翻译

快速、友好,甚至比其前身更强大

Katie Parrott
Dan Shipper

我们称第一个 Fable:/vibe-check/anthropic-mythos-our-fable-vibe-check 为“曲速引擎”,因为它是我们测试过的最强大的编码模型。但它运行缓慢且难以理解——感觉像是一个仅供最资深 AI 用户使用的强力工具。

在我们的测试中,它比 Fable 5 更强大,可以连续运行数天,解决其前身无法解决的编码挑战。但它也快速且友好,更重要的是,它像普通人,呃,像 AI 一样说英语。与原始 Fable 和 Anthropic 最近的 Sonnet 5:/vibe-check/sonnet-5 及 Opus 5:/vibe-check/opus-5 模型不同,Anthropic 回归正轨,创造了一个我们真正享受交流的模型。

哦,还有更多:在我们的测试中,它在执行类似任务时使用的 token 约为 Opus 5 的一半。这应该能在 Opus 预算内完成 Fable 级别的工作。因此,价格也适合所有人。

更有趣的是,“所有人”现在也包括企业。Fable 5.1 提供零数据保留选项,消除了之前阻止大多数大型公司使用它的障碍。

Fable 5.1 是一个罕见的组合:我们使用过的最强大的编码模型,同时也是一个可以推荐给不写代码的人使用的协作者。它应该是大多数知识工作者第一次真切体验 AI 委托工作——以前只能由程序员完成的任务。你可以给它一个任务,比如制作演示文稿,然后去处理其他事情,相信它一两个小时内就能完成出色的成果。

我们已经测试了一周左右,涵盖了编码、写作和知识工作任务。以下是我们零日的 Vibe Check。

Anthropic 表示 Fable 5.1 使其最强大的能力更易用且更便宜。其主要声明如下:

Anthropic 表示该模型可以在长时间运行中追求目标,并对如何解决潜在问题做出更好的决策。Kieran 的经验支持这一点:与 Fable 5 在从零构建 Every 的文档编辑器 Proof 克隆的任务相比,它更深入、添加了他未请求的有用细节,并对什么方法有效表现出更好的判断力。

Anthropic 承诺减少套话、更新更简短,并且对写作指令更加关注。我们也看到了这一点:它的写作中 AI 特征较少,团队发现其解释更易理解。但它仍然经常超出请求的字数。

Anthropic 表示,Low 和 Medium 设置的性能至少可以达到 Fable 5 的水平,且成本明显更低。High 是 Claude Code 中的默认设置;Medium 是 Claude.ai 和 Cowork 中的默认设置。Kieran 对三种设置下的编程结果都很满意,尽管我们的写作测试偏向 High 和 Extra-high。

Anthropic 估算,典型 API 工作负载和 Claude Code 额外使用下,成本比 Fable 5 低约 25%,而对于大量自主工作,节省接近 45%。我们的测试提供了令牌效率的证据:在 Every 的 Slack 助手中,它使用的令牌不到 Opus 5 的一半,但结果相当。我们尚未衡量与 Fable 5 相比的成本节省。

Anthropic 表示,它比 Mythos 5 更不可能忽视约束、为决策寻找理由或操控评估。我们没有做这些安全测试,但普通的指令遵循仍有不足:在 Extra-high 设置下,Kieran 有时发现当他打断它询问正在做什么时,它仍会继续工作。

标准 API 费率仍为每百万输入令牌 10 美元,每百万输出令牌 50 美元,与 Fable 5 相同。读取先前缓存的输入现在收费为每百万令牌 0.25 美元,降低了 75%。Anthropic 估算,对于典型 API 工作负载和 Claude Code 额外使用,总体节省约 25%,对于大量自主工作可提升至约 45%。

在发布时,Fable 5.1 将通过 Anthropic 的 API 在 Claude.ai、Claude Code 和 Cowork 中提供,并通过亚马逊网络服务、谷歌云和微软 Azure 提供。

它处理与 Fable 相同的工作,从单提示应用构建到整天运行的编程任务,并且在工作过程中更容易操作。它回答更快,用简单语言解释正在做的事情,并在你告诉它改变方向时执行,而不会争辩。

Dan 给团队的第一条信息是:“我实际上能理解它在说什么。”我测量的输出读起来比 Opus 5 或 GPT-5.6 Sol 的年级水平低,这意味着文本对更多人来说可以理解,AI 的痕迹更少。

要求写1000字,它写了1288字。要求三到六个主题,它给出了八个。要求八到12条引用,它提取了43条,其中有五条引用不在来源中。在最高努力设置下,它启动了不需要的子代理,并在Dan要求它停止并解释时仍然继续。

Kieran Klaassen
Mike Taylor

白天是AI迷作家,晚上是氛围编程师

在编码方面,Fable 5.1 做到了 Fable 5 所做的事情,而且在执行时更容易操作。Dan 将他所有的编码任务从Codex迁移过来。Mike 将他所有的新项目都交给它处理。

Kieran 要求它从单一提示重建 Proof:https://www.proofeditor.ai/ —— 这是 Fable 5 在六月完成的同一测试。Fable 5.1 也一次性构建了可运行版本,但 Kieran 发现它做得更深入,添加了他未指定的有用细节。他还看到更多风格和对有效方案的更好判断。正如他所说,“能一次性完成这个真是活在好时代。”

它还处理了他的 LFG 工作流程,在该流程中,模型无需人工介入即可进行计划、写作、审查和测试。到周末时,他已经用为模型量身定制的说明更新了复合工程插件:https://github.com/everyinc/compound-engineering-plugin。“它在有自己的观点和完成任务与进行反驳之间取得了恰当平衡,”他说。

Dan仍然更多地使用ChatGPT处理日常工作,但他将巨大的编码任务交给 Fable 5.1 并让其运行。在他获得访问权限后,Claude Code 每天向模型发出的请求大约增加了五倍。

Mike 让它将博客从 Webflow 迁移出去。它一次提示就完成了。接着他要求它构建斯坦福的 AI 城镇模拟版本:https://arxiv.org/abs/2304.03442,该模拟跟随 AI 角色的日常生活,观察他们如何建立关系和传播信息。一次性提示中,它创建了25个带有记忆和日常作息的角色,这些角色交流并传播关于镇上派对和市长选举的消息。“在这一点上,我甚至不确定模型有什么不能做的,”Mike 说道。

丹(Dan)处理了六月份 Fable 拒绝的与安全相关的编码工作,当时 Fable 的防护措施将这些请求发送给了 Opus 4.8。丹指出,以安全风险为由的拒绝“明显减少”——模型在判断什么构成安全风险时更多地信任人的判断。凯兰(Kieran)在常规工程工作中也出现了更少的误报,而 Fable 5 有时会将常规编码任务误判为安全工作并阻止它们。凯兰唯一遇到的拒绝情况是:在自动测试循环中无法使用测试密码登录,他称其为“有点过头”。

关于工作强度,凯兰在每种强度设置下运行了相同类型的任务,并发现低、中、高强度都“超级好”。超高强度在长时间运行时“消耗很猛”,但将太多工作分配给子代理。他宁愿完全不选择:“我只希望它没有强度设置,它会自动完成任务。”团队大部分人对需要保持参与的工作选择了高强度。

这是过去一年中我们团队的作者希望使用的首个 Claude 模型。它的文字顺序清晰,并且能够接受修改而不争论。但在长工作中仍需要事实校对,它尚未取代我们自动化编辑流程中的 Opus 5:/context-window/benchmarks-don-t-know-your-job,至于它的风格是否胜过 GPT-5.6 Sol,则取决于个人喜好。

在 Every 的写作测试台上,该平台安排模型完成 TK 编辑任务,新模型表现最好的任务是长篇任务,例如从零开始写介绍或填补论文中缺失的部分。在缺失段落任务中,该任务要求模型从丹的文章《自动化之后》中定义 AI slop:/p/after-automation,它的得分超过我们运行过的所有模型,包括 Fable 5。它的段落更多地使用了周围文章的细节,使论证清晰,每段表达一个观点,并且忠实于原始材料,而 Fable 5 和 Opus 5 往往会进行推测。Fable 5.1 的输出同样比其他模型的 AI 特征更少,阅读水平为七年级,比 Fable 5 低一个年级,比 Sol 低两个年级。

X 帖子是唯一一个落后的工作,几乎排在最后,仅高于 Sonnet 5,而 Sol 在每个 Anthropic 模型中都领先。基准测试一直沿着这条线分化:Anthropic 模型喜欢扩展论点,GPT 模型则希望压缩它。新模型是我们测试过的最强扩展器,而压缩能力低于平均水平。它的 X 帖子在简短要求一条论点时却堆叠了第二和第三个想法。

当你提高努力水平时,模型在判断如何删减内容上表现更好。High 和 xHigh 得分最高。在段落填充任务中,中等和高之间的差距最大,在这个任务中,模型必须阅读周围的论点并决定插入内容以使论点完整,而高设置下写得更短:同一篇介绍在 Medium 下为 805 字,在 xHigh 下为 657 字。与以往模型一样,我选择 High 作为起草的最佳选项。

同样的直觉让它成为一个优秀的起草者,却让它成为一个有风险的报道者。给它一个紧凑的简报和特定资料时,它很忠诚。但如果你给它长的源文档和扩展的空间,它可能会以错误的方式发挥创造力:Mike 让它用 Every 团队的 8 到 12 个精确引用制作一个 Vibe Check。它生成了 43 个引用,其中包括几条在提供的文本中缺失的。

作为编辑,它速度快但谨慎。Jannik 让它编辑了 20 篇过去 Every 草稿,方式和 Kate Lee(Every 的主编)编辑它们的方式一致。它找到了 Kate 的精确修改次数与 Opus 5 相差不大,但用时不到一半,却丢掉了大约一半找到的修改;Opus 5 保留了大部分自己的修改,Sol 几乎保留全部。它能看见编辑,但没有足够的自信展示给你,这与它起草时的问题正好相反。Jannik 的结论是 Opus 5 仍然适合该流程;Dan 的结论是 Fable 5.1 略差但快得多。

给新模型一个大型咨询任务,它能完成整个任务,在像幻灯片演示和角色访谈这样重判断的任务上,它超过 GPT-5.6 Sol。给它一个带有字数、主题数或引用数的简报,它就会超出限制。

迈克的EC(执行咨询)基准涵盖12项咨询任务:仪表板、培训需求综合、研讨会运行表、品牌幻灯片、角色扮演面试等。Sol在六项结构化构建任务上得了满分100分,然后在博客文章上得了44分,在角色扮演面试上得了33分。新模型则相反。它在角色答案上得了88分,在幻灯片上得了93分,在角色扮演上得了53分,迈克仍然称其为“基本上失败”,但已经超过了Sol。它会在忽略明确限制的地方失分。

迈克要求模型为学习使用AI进行构建的高管设计三个动手项目,包括提示语和真实的练习数据。其中一个是跟踪四次公司收购的仪表板。模型提供了电子表格、状态邮件和Slack对话,包括对尚未到达跟踪器的项目延迟的警告。在不到23分钟的时间里,它生成了一套培训包,迈克称其“接近完美”。

限制是它失分的地方。一个字数上限为1000字的酒店推荐结果为1288字。要求三到六个主题的培训需求综合出了八个。允许八到十二个支持引用的简报出了43个。要求Markdown的结果是HTML。Opus 5在同样任务中,每一项都在限制范围内,且有两次超时。

设计是另一个弱点。迈克要求它构建一个让人们通过与AI面试官对话填写表单的应用。面试功能有效,但应用的设计是通用的黑底紫字,大面积空白,控件下方还显示一个“假”字。Fable在六月也生成了同样的紫色界面。Opus 5没有出现这种情况。

在像Slack助手这样设计用于执行需要工具使用的长任务的自动化流程中,Fable 5.1使用约一半的令牌、约60%的时间完成与Opus 5相同的工作。在最高努力设置下放任不管,它会继续工作,继续生成子代理,并且不总是在你要求时停止。故事的寓意:在开始之前先设定预算。

Marcus 在 Every Agent(https://agent.every.to/,我们的基于 Slack 的 AI 助手)中测试了两种模型,使用内部检查评估它们的写作能力以及使用工具完成任务的能力。两者均设置为中等努力,指令最初为 Opus 5 调整。Marcus 认为这两种模型的输出可比,但 Fable 5.1 使用的 token 不到一半,响应速度更快。在 Jannik 的编辑测试中,它完成的时间不到 Opus 5 的一半。

Marcus 的注意事项:因为它行动迅速且使用的 token 很少,所以“在复杂多工具任务中可能表现较差”。如果你的流程需要模型小心地调用八个工具,Opus 5 仍然是更安全的选择。

Kieran 在 xHigh 设置下运行长任务,发现它“非常彻底,甚至可能过度,尤其是在委派给子代理时”,并表示“有时候[它]也会忽略我。” 他在 xHigh 会话中“每次大约持续一天”。当他中断一个会话问:“你能解释你正在做什么吗?”时,他说它“只是忽略我继续使用无数子代理”。Mike 的演练包运行时间超过他平常的两倍。Kieran 在一天内处理了 18 亿个 token。每个步骤成本低,它会执行你允许的所有步骤,而努力设置决定了执行的步骤数量。

Fable 5.1 是 Fable 的升级版,更少等待,礼貌更佳。它更快,写作更清晰,每步使用的 token 更少,争论更少,并能处理长任务,效果与 Fable 5 相当。Mike 把他的新工作迁移到了它上面。Dan 把他的编程迁移到它上面。Katie 在决定 Fable 不适合她两个月后,把她的写作迁移到它上面。

Dan 和 Kieran 给它在响应速度和 token 效率上打了金星。Mike 持有它们的金星,以一个让更多人负担得起 Fable 级别工作的价格出售,而 Anthropic 在我们撰写本文时尚未公布价格。Kieran 对它回归的评价是:“Fable 从未糟糕。” Anthropic 的不佳时期是由于 Fable 暂时不可用以及其他两种模型未达到标准,而 GPT-5.6 则发布了。

你需要在循环中与模型协作。进行写作、编辑,并在你阅读时编写代码。大努力设置是团队大多数人的选择。

你希望在长时间任务中获得 Fable 水平的结果,却不想等待 Fable 的时间。委派构建、大型重构以及整个项目的重建,对于 Kieran 和 Mike 来说,都能以与 Fable 相同的水平完成,而且更快。

你手上有 Opus 5 代理提示和代币账单。Marcus 在 Every Agent 的 Medium 任务完成率上,用了不到一半的代币获得了相同的通过率,并且写作评分更高,无需重写提示。

简报有严格限制。我们测试中,字数、主题数、引用数和输出格式全都被超出。Opus 5 每一项都严格遵守。

引用必须第一次就正确。在某项任务中可检查的 27 个引用里,有 5 个不在来源中。在引用或新增的细节离开你手中之前,要全部核实。

任务是重型多工具工作或者调优的编辑流程。Marcus 和 Jannik 都发现 Opus 5 在这些方面更稳定。

没人设定预算。在 xHigh 模式下,如果放任不管,可能要花整整一天时间。

这是否是一个 4.5 级时刻——那种发布能让一整批新用户意识到 AI 潜力的时刻——还是仅仅是一个非常好的 Fable,要取决于 Anthropic 目前尚未公开的包装和定价决策。无论如何,团队再次使用了 Claude。

披露:Anthropic 在 Fable 5.1 发布前向 Every 提供了预先访问权限。该公司没有参与本次评测。

现在每个人都是建设者。Every All Access:https://every.to/builder-pack 为你提供完整会员资格加 Builder Pack——即我们构建工具所需的 $9,000+ 代币。

情报判断

Aioga 编辑摘要

Every 在约一周的测试后发布 Fable 5.1 体验评测,称其在编程、写作和知识工作任务中比 Fable 5 更强,同时更快、更易交流;文章还称,相似任务下其令牌用量约为 Opus 5 的一半。

背景分析

Every 此前将初代 Fable 称为其测试过最强的编程模型,但认为该模型速度慢且难以理解。本次文章称 Fable 5.1 提供零数据保留选项,并表示 Anthropic 的主要主张是让模型能力更易用、成本更低。

Aioga 观点

Aioga 判断:这篇文章的核心价值在于提供早期实际使用感受,并将能力、交互体验、令牌用量和数据保留并列考察;但其结论来自 Every 的短期测试,适用范围仍需更多材料验证。

影响与后续

可能影响:若令牌用量、长任务执行和零数据保留等表现得到进一步验证,Fable 5.1 可能降低部分使用门槛;不过单篇体验评测不足以证明其在不同任务和环境中的普遍表现。 后续观察:需要核对 Anthropic 对 Fable 5.1 的完整说明,并关注独立测试对编程、写作、知识工作、令牌消耗及零数据保留选项的验证结果,同时区分厂商主张与 Every 的体验结论。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: every.to

来源: Every:最新文章(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T19:29:04.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Every 发布 Fable 5.1 的体验评测文章,标题称 Anthropic Is So Back(Again)。正文未提供有效文本,具体评测内容以原文为准。

Every:最新文章(网页)2026-09-01T19:29:04.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。