Aioga
AI资讯 / 行业动态
返回 AI资讯

Fireworks AI 分析:前沿不是单个模型,而是路由器,FireRouter 发布

Fireworks AI(网页)Aioga 编辑团队2026-09-20T16:00:00.000Z热度 72

Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。

行业动态Fireworks AI(网页)

今日 AI 情报摘要

Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。

中文正文 · AI 翻译

加入我们,参加我们的首届会议,Forge 2026

The frontier isn't a model. It's a router headline image

如果编程代理对每个任务都使用最佳模型,它的表现会提升多少?

最佳的单一模型 GPT-6 Astra 在 DeepSWE 任务中达到 74.1%,每个任务花费 $6.52。为每个任务选择合适的模型,同样的十八个模型可以达到 97.6%,每个任务仅花费 $1.88。提高了 23 个百分点,成本不足三分之一。

这个数字来自事后分析。我们首先在每个任务上运行了所有十八个模型,然后选出每个任务的获胜者。它衡量的是已经存在于模型池中的能力,但这些能力分散在没有人一起使用的模型中。

将它们组合在一起是路由器的工作。在工作开始之前,它选择哪个模型处理每个任务,而“之前”才是难点。回头看很容易指出某个任务并说明哪款模型会做得更好。路由器必须在看到结果之前做出选择,而错误的选择所造成的成本远高于它节省的几美元。

我们分析了 DeepSWE v1.1:https://deepswe.datacurve.ai/,这是一个自主编码基准,其工作单元是一个工程任务:代理需要理解问题、检查代码仓库、使用工具、编辑代码、执行代码,并使任务通过。

策略故意保持简单。任务开始时选择一个模型,并在整个任务过程中保持该模型,不在中途切换。

one model per task

然后我们按实际通过率为每个任务指定获胜者,成本相同时打平。这就是所谓的“神谕路由器”。我们在 Kimi K3 和 Fable 分析中使用了相同方法:/blog/kimik3-fable。

神谕路由器在同样的 113 个任务上评分,每个模型-任务组合进行四次尝试,并取 18 个不稳定估计的最大值,这使得评分偏高。

最佳模型得分约为 70%,每个任务花费 $6.46 至 $13.41:

这就是固定模型策略的最佳表现。现在按任务选择模型:

hero results image

十八个模型的神谕路由器平均在每个任务 $1.88 时达到 97.6% 的通过率。这比 GPT-6 Astra 高 23 个百分点,成本不到三分之一。如果仅限于开源权重模型(DeepSeek V4 Flash 和 Pro,GLM-5.3 和 GLM-5.3 Flash,Kimi K3,Qwen3.8 Max),它仍能在每个任务 $1.45 时达到 90.3%,比这里的任何封闭模型高 16 个百分点,且花费不足 Astra 的四分之一。

这些结果使得“开放与封闭”的辩论不再那么有趣。新兴的竞争是从理论上的神谕路由器转向构建一个模型系统,其集体智能超过任何单一模型。原则上,一个开放模型系统已经可以远远超越封闭前沿。

池中的能力远超过任何单一模型所显示的能力。

在我们之前的工作中,我们发现不同的模型在不同的任务上是足够的(甚至是卓越的):/blog/kimik3-fable。DeepSWE分析使成本影响变得具体。在97.6%的点上,神谕仍将113个任务中的94个分配给每个任务成本低于3美元的模型。

该领域三个最昂贵的模型,每个任务的成本都超过11.50美元,仅在三个任务中是唯一最佳选择。

在113个任务中的79个任务上,至少有一个昂贵模型的得分与最高得分持平,但仅因价格而失去任务。一种强大的通用模型可以在广泛的分布上表现出色,而在大多数单独任务上并非必不可少。

固定模型策略为每个任务支付广泛的能力。系统可以提出一个更狭窄的问题:

这个任务实际上需要什么能力?

需要多少模型才能捕捉到效果?

coverage ladder

最佳组合的双模型比最佳单模型增加13.1个百分点,最佳三模型达到91.2%。从三模型扩展到全部十八模型,再增加6.4个百分点。真正有用的对象不是数百个几乎可互换模型的目录,而是具有互补覆盖的组合。

价值在于能力覆盖,而不是模型数量。

LLMRouterBench:https://aclanthology.org/2026.findings-acl.1881/ 评估了33个模型和超过400,000个实例的路由能力。它发现少量模型覆盖了完整集合的大部分能力,而且在没有精心策划的情况下,增大模型池几乎没有增加价值。

神谕容易让人喜爱,因为它永远不会出错。而生产路由器会出错。我们严格地衡量它:我们使用pass@1,即单次尝试成功的概率,而不是“这个模型在四次尝试中是否成功过”的规则。第二种规则会让上限看起来更令人印象深刻,但意义远小。

差距是一个产品问题,文献对此直接了当。LLMRouterBench发现在若干近期的路由方法中,包括商业方法,都无法可靠地击败简单的基准测试,且大部分原因归结于模型的记忆能力:即使池中存在具备合适能力的模型,路由器也必须识别何时调用它。

因此,坚持使用你熟悉的单一模型并不是保守,而是理性的:一个稳定的错误分布胜过一个不可预测地选择错误专家的路由器。路由系统的标准是使模型专业化足够可预测,这样更换模型能够提升系统性能而不降低其行为的可信度。

通常,路由被引入为成本优化:将简单任务发送给更优化的低成本模型,将昂贵的模型保留给复杂任务,并保留差额。在Fireworks:/nexus,我们采取更广的视角。

如果不同模型真正互补,那么在它们之间选择会让你沿能力曲线向上移动,而不仅仅是在成本曲线上向左移动。

这正是FireRouter的构建目标。它在任务层面跨开放模型和封闭模型进行路由,同时具有缓存感知能力,因此切换模型不会悄无声息地丢失你已经支付的上下文。

在我们自己四周的生产编码流量实验中,通过FireRouter路由的会话成本为7.42美元,而仅使用Opus 5的成本为15.81美元,2334个会话整体减少了53%。

有用的AI工作单位已经大于单次模型调用。一个编码代理是在提供上下文、工具、执行、测试、状态和反馈的套件中的模型。

harness

一旦多个模型具有互补优势,选择策略就成为系统的一个组成部分:https://www.faros.ai/blog/open-models-vs-frontier-models,和上下文、工具及测试一起。选择和组合这些组成部分就是工作内容。这就是AI工程学。

我们的实验只衡量该系统的最简单版本:在任务开始时选择一个模型并保持使用。选择策略是我们实际上可以构建的部分。

我们在生产中服务每一个前沿开放模型,这正是对每个模型优势进行真实理解的来源。你无法从基准平均分中了解一个模型的独特优势。你需要通过运行所有模型,在实际工作中大规模地测试,才能得出结论。这就是 FireRouter 模型选择的来源,也是我们打算达到的标准。我们将在未来的文章中介绍我们自己的路由器:https://docs.fireworks.ai/ecosystem/firerouter/overview,以及如何在你自己的专用智能上进行爬坡优化:/training。

在 FireRouter 上定义你的前沿:https://app.fireworks.ai/fire-router。

关于成本。本分析中所有成本数据均来自 DeepSWE 排行榜上发布的每个模型的数据。公共试验文件中的原始 cost_usd 与排行榜显示的数据不一致,对于 DeepSeek 系列更是有几倍的差异,因此,每个模型的每任务成本会按比例调整,使其均值与发布数据一致。准确率来自每个任务-模型对的四次原始运行数据,成本来自排行榜。

来源:DeepSWE v1.1 试验,刷新于 2026 年 9 月 17 日。共有 113 个任务,每个任务包含 18 个模型,均采用其最佳可用配置,总共 2,034 个模型-任务单元。

情报判断

Aioga 编辑摘要

Fireworks AI 发布 FireRouter,并以 DeepSWE v1.1 的 113 项工程任务、18 个模型分析路由潜力。正文称,单模型 GPT-6 Astra 的通过率为 74.1%、每项成本为 6.52 美元;事后择优的路由结果为 97.6%、每项 1.88 美元。

背景分析

该分析以单次工程任务为单位,任务涉及理解问题、检查代码库、使用工具、修改并执行代码,以使任务通过。策略是在任务开始时选定一个模型,整个运行期间不切换;oracle 则按每项任务的实测通过率选优,同分时比较成本。

Aioga 观点

Aioga 判断:结果显示,18 个模型的事后最优组合在该基准上优于单一模型;但它是在运行全部模型后才选出赢家,不能直接视为任务开始前的路由器已达到这一表现,两者衡量条件不同。

影响与后续

可能影响:该测试使路由方案值得评估,但事后 oracle 的结果不足以证明实际路由器能在任务开始前选中合适模型,也不代表其他任务或使用条件会有相同通过率与成本;评估时需要区分事后上限和实际策略表现。 后续观察:可关注 FireRouter 在任务开始前如何选择模型,以及后续是否披露实际路由表现、成本口径和与 oracle 的差距;当前材料说明了事后择优方法及其数据,未提供这些比较结果。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: fireworks.ai

来源: Fireworks AI(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-20T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。

Fireworks AI(网页)2026-09-20T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。