Aioga
AI资讯 / 技巧观点
返回 AI资讯

Kimi K3 与 Fable 5 对比:开源模型在 93% 路由准确率下成本低至 50 倍

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-22T04:52:13.379Z热度 57

在约 1,000 项智能体任务测试中,开源模型 Kimi K3 与闭源模型 Fable 5 整体准确率接近(SWE 基准 92.4% vs 92.6%),但 K3 在 Fire...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

在约 1,000 项智能体任务测试中,开源模型 Kimi K3 与闭源模型 Fable 5 整体准确率接近(SWE 基准 92.4% vs 92.6%),但 K3 在 Fireworks

上的推理成本可低至 Fable 的 1/50。 通过任务路由,两者组合可实现 93% 的准确率,其中 K3 承担 72-96% 的任务流量,在保持前沿质量的同时大幅降低总成本。

中文正文 · AI 翻译

宣布我们的D轮融资和10亿美元ARR

K3是一个前沿高质量的开源模型,成本仅为一小部分。更重要的是,它可以稳定地补充Fable,使得通过任务路由获得最高质量的智能成为可能。

🧭 简而言之:我们在约1,000个智能代理任务中,将Kimi K3(开源)与Fable 5(闭源)进行了对比,发现:

我们对每个基准进行了平均,每个基准针对不同类型的工作,并使用相同的框架运行K3和Fable 5。总共有约1,030个任务,在真实代理循环中进行。

在进入结果之前,先给出一个快速定义。Oracle路由是一种通过将任务在每个模型上运行后,选择最便宜的正确选项(成本/性能上限)来衡量最佳理论性能的方法。在实际路由中,你不能让任务同时运行在多个模型上。路由器会预测哪个模型在成本和质量上最优,但最终只是一个猜测。

在这项研究中,Oracle路由显示K3被选中的任务占72-96%。这表明,通过学习日常任务与前沿工作的真实长尾之间的差异,可能实现几乎完美的路由器。要得出明确结论,需要多一个数量级的路由数据和实际性能。

从10,000英尺的高度来看,很容易只看两个模型便认为正面对比是平手。例如,如果你看SWE这个主基准,K3得分92.4%,Fable得分92.6%。在我们基准测试的五种类型任务中,这两个模型的得分通常相差几个百分点,Fable在代码语言广度(多语言)上略占优势。

很容易就停止在这里,说“它们大致相当”。新闻是它们在不同任务类型上具有明显更好的性能。

如果你仔细查看单个基准,不只是看到一个顶线准确率就够了。以SWE为例,整体上两者完全相同。如果按问题领域拆分SWE,你可以看到每个模型的擅长领域。K3在符号数学和开发工具方面最为出色;Fable在网页和数据可视化工作上胜出。同样的模式在多语言集合中也存在,Fable在Java、Python和C++上具有广度优势,而K3在JavaScript和Rust上表现平分秋色。

对于在终端进行长周期工作的情况,如驱动 shell 并跨几十个回合操作系统,K3 展现了它的真实实力。它完成了一批 Fable 从未攻破的任务:7z 哈希、FEAL 密码分析、泄露的秘密、实时漏洞、失控的异步作业。

虽然在高水平上质量几乎不分伯仲,但价格却相差悬殊。

那么,这巨大的价格差距是从哪里来的呢?是令牌定价、提示缓存以及每个任务的处理工作量。例如在SWE上,K3 比 Fable 工作更努力:每个任务大约 55 回合和 130 万令牌,而 Fable 是 21 回合和 13 万令牌。在长终端任务上情况正好相反:Fable 才是耗费最多的,会达到 64 回合和 150 万令牌(有时直接导致超时)。

提示缓存大多负责将这些工作量转化为 K3 的价格优势:即使 K3 阅读的令牌数是 Fable 的十倍,但由于缓存命中,SWE 运行成本仍低于 Fable。这是一个权衡。增加回合数的任务通常意味着每次运行的实际时钟时间增加,即运行速度更慢。如果你需要在两秒内得到答案,这很重要;但如果你是在大规模后台运行代理,账单只是小部分,这就更重要了。

如果你将每个任务发送给最能处理它的模型,你并不会落在两种模型之间,而是超越两者。

按任务路由始终优于任何单一模型运行:

Oracle 路由器选择了 K3,占 72-96% 的任务流量。通过这样设计路由器,你最终获得的总体质量高于任何单一模型,成本接近仅使用最优化的模型。

将质量和成本放在同一图表上。K3 用蓝色表示,在所有五个任务类别中都位于 Fable(红色)左侧(更具成本效益的一侧)。准确率则此消彼长:Fable 在多语言上领先,K3 在终端和法律任务上领先,其他任务大致持平。

Kimi K3 + Fable 组合路由可以以最佳价格释放它们的最佳特性。

单一模型供应商、令牌最大化的时代即将结束。任务级数据表明,这些模型在不同价格下是专长不一的专家。最好的 AI 不再来自单一实验室,而是多模型的混合。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:在约 1,000 项智能体任务测试中,开源模型 Kimi K3 与闭源模型 Fable 5 整体准确率接近(SWE 基准 92.4% vs 92.6%),但 K3 在 Fireworks Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: fireworks.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-22T04:52:13.379Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

在约 1,000 项智能体任务测试中,开源模型 Kimi K3 与闭源模型 Fable 5 整体准确率接近(SWE 基准 92.4% vs 92.6%),但 K3 在 Fire...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-22T04:52:13.379Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。