Aioga
AI资讯 / 行业动态
返回 AI资讯

Fireworks Research 发布 Ember-1,以更少推理 token 保持 Kimi K3 质量

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-27T19:09:18.000Z热度 58

Fireworks Research 发布基于 Kimi K3 的专用模型 Ember-1,以约少 40% 的 token 达到与 Kimi K3 相当的质量,今日以 Rese...

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Fireworks Research 发布基于 Kimi K3 的专用模型 Ember-1,以约少 40% 的 token 达到与 Kimi K3 相当的质量,今日以 Research Preview

形式在 Serverless 上线。

中文正文 · AI 翻译

加入我们,参加我们的首届大会 Forge 2026

Graph showing 40% fewer tokens than Kimi K3

Ember-1:/models/fireworks/ember-1 是 Fireworks Research 推出的新专用模型,它在使用的 token 数量减少 40% 的情况下,实现了 Kimi K3 的质量。基于 Kimi K3 构建,它学会了削减不必要的推理,同时保留关键思考。我们在外部基准测试、实时客户 A/B 测试以及我们自己的编码和代理工作负载中进行了测试,质量在每种环境下都保持稳定。Ember-1 今天即可使用,它开启了 Fireworks 持续推出的一系列专用模型,这些模型由开发者的下一步需求塑造。Ember 只是您可以在 Fireworks Training 平台上构建的开始。

我们听到用户反馈,他们需要 K3 的编码能力但成本更低,因为其长时间的推理路径使得大规模自动化编码变得昂贵。降低 K3 的推理强度并不能解决这个问题。降低推理强度会损失过多质量。为了保持质量并减少 token,模型必须学会更高效地推理,这就意味着必须进行训练。

实现这一目标需要严谨的研究。我们的团队进行了超过 50 项训练实验和 200 多次评估,并在此过程中开发了新的训练算法,以缩短推理时间而不损失准确性。我们完全在 Fireworks Serverless Training:/training#training-api:~:text=RUN%20THE%20LOOP-,Training%20API,-For%20ML%20researchers 上完成。因为无需配置或管理 GPU,我们可以在有想法的第一时间启动实验,仅为实际运行付费,并在比通常时间和成本少得多的情况下从研究进入发布阶段。

我们在广泛的任务集合上进行了训练,以确保 token 节省能够应用于多种工作负载。随后我们在 Specialized Intelligence Index:/specialized-intelligence-index/、公开基准测试以及实时生产流量中评估 Ember-1,以确认其在使用更少 token 的情况下没有质量下降。Ember-1 是 Fireworks 自有模型,也是 Fireworks Research 系列模型中的第一个。

像 Kimi K3 这样的推理模型,将其生成的大部分标记,有时超过 90%,用于内部推理,而不是直接给出答案。这种思考结构在单次请求中代价高昂,但在多轮的自主任务中情况会更糟。每一轮都会将之前的所有推理传回模型,因此上下文随着轮数的增加大致呈二次增长。早期轮次的长推理轨迹会在每次后续调用中被重新读取(并重新计费)。

所有这些推理真的有必要吗?我们的实验表明没有。Kimi K3 输出的推理远比任务需求长,多余部分可以在不触及答案的情况下去除。这就是我们如何创建 Ember-1 的方法,它是一个经济版的 Kimi K3,由专门的智能构建而成。

并非所有 K3 的推理都是浪费。有些是自我反思:重新审视假设、回应反馈或将结果追溯到早期决策可以帮助模型从错误中恢复。机会在于保留这种能力,同时减少不必要的推理并摆脱无效循环。我们认为,从任务和环境反馈中学习可以教会模型更高效地推理,同时保持其能力。

对于自主任务,这种学习延伸到整个交互过程。模型探索可能的行动,整合新的观察,并在执行过程中不断优化推理。反馈将决策与其后果连接起来,激励在整个任务过程中进行有用的反思。

我们将这些见解应用到一个涵盖数学、编码、指令执行、对话、搜索、工具使用和软件工程的训练集合中,覆盖独立问题和延伸交互,以强化对观察和结果的适应性。任务反馈指导策略性规划和学习,强调在各种环境中保持能力。

公共基准测试和实时 A/B 测试的结果支持这一方向:在七个基准和两个客户生产流量中,Kimi K3 的推理可以缩短 35–50% 而不影响准确性。内化行为还显示,在失败尝试中控制标记使用,减少了冗长且无效的推理。

本周早些时候,我们介绍了专门智能指数(Specialized Intelligence Index, SII):/specialized-intelligence-index/,用于在行业专家创建的真实任务中基准测试开放模型、封闭模型和专门模型。

我们在Doximity的床边基准(Bedside Bench)上评估了Ember-1,这是一个由医生验证的基准,涵盖了10个专业类别中的500个临床案例。

结果如何?Ember-1在床边基准上创造了新的帕累托前沿,无论是开放模型还是封闭模型,包括GPT-5 Sol、GPT-6 Astra和Claude Opus 5,在成本/任务方面均表现出色。

Figure of Cost/Task SII
Figure 2: Score vs. Duration Chart on Bedside Bench SII

我们还在一些其他行业基准上评估了Ember-1的质量与成本前沿。我们使用公开的Kimi K3 API定价(未缓存输入 $3/百万 token,缓存输入 $0.30/百万,输出 $15/百万)计算每个基准的成本,并将其与三种方案的通过率绘制对比:K3在低推理强度下、K3在高推理强度下、K3在最大推理强度下(默认)以及Ember-1。在每个测试样本超过50的基准中,Ember-1都位于或接近帕累托前沿,以极低的成本匹配K3-max的质量,并严格优于K3-low。我们还分析了GPT-6 Astra、Claude Opus-5、GPT 5.6 Sol和GLM 5.3,发现Ember-1在帕累托前沿上处于领先地位。

Figure 3: Average of 5 Industry Benchmarks on Open and Closed Model Cost/Task

我们对直接比较Ember-1与原始K3的结果进行了深入分析,并发现了以下结果:

运行K3成本最优的方法不再是让其减少思考,而是运行Ember-1,这是一种学会高效思考的模型。

基准测试只能告诉你那么多。正如我们在专门智能指数结果中发现的那样,我们希望在更多真实工作负载上测试模型,并使用生产流量测试模型。真正的考验通常是模型在生产流量中是否稳健,以及用户依赖的产品中表现如何。

我们对两位客户的生产编码工作负载进行了实时 A/B 测试。在这两种情况下,Ember-1 都展示了令人印象深刻的令牌节省,大约每个任务使用的令牌减少了 35%,同时质量相当。大部分下游产品指标保持不变或有所改善,包括任务完成率、成功评分和失败率,所有指标都朝着正确方向发展,同时令牌消耗大幅降低。在 A/B 测试之后,其中一位客户现在正在生产环境中使用 Ember-1,并计划扩大规模以完全替代基础模型。

Fireworks 内部的大部分编码/协作流量由我们自己的推理服务提供支持。在任何客户看到模型之前,我们就将 Ember-1 部署到 Fireworks 内部,并让我们自己的开发人员在日常编码工作中使用它,包括在真实任务上进行大规模的 Vibe 测试等。

我们最自豪的结果:没有任何新闻。没有新闻就是好消息。开发人员在不注意到切换的情况下继续进行他们的编码工作,同时消耗的令牌显著减少。对于一个其全部价值主张是“相同答案,更少令牌”的模型来说,在内部流量上的隐形部署是最有力的信号。

Ember-1 正作为服务选项与基础 Kimi K3 模型一起在 Serverless 上以研究预览版的形式推出。为了支持快速增长的开源生态系统,我们引入了研究发布,使开发人员能够在两周内无服务器访问新的研究模型,并根据社区需求将其转为永久使用。对于推理令牌占大部分成本的智能编码和其他工作负载,它以大约一半的令牌成本提供相同的质量。

Fireworks Research 将继续推动模型效率的前沿,通过将专用智能引入更多 Ember 模型,使您能够部署最经济的模型并减少令牌开支。令牌效率正在成为 Fireworks 的一个主题。

想将 Ember-1 推进到下一步,并针对您的用例进行优化吗?我们也正在启动 Ember-1 的训练支持,使企业能够使用自己的数据构建定制化、令牌高效的模型,以满足其需求。开放模型的未来是基于您特定工作负载训练的专用模型。

在您的工作负载上尝试 Ember-1:/models/fireworks/ember-1 吗?我们很想听听您的体验,所以请在 X 上标记我们 (@FireworksAI_HQ) 并告诉我们您正在构建什么!

Fireworks Research 发布 Ember-1,以更少推理 token 保持 Kimi K3 质量

情报判断

Aioga 编辑摘要

Fireworks Research 发布专门化模型 Ember-1。来源称,该模型基于 Kimi K3 训练,在保持同等质量的同时减少约 40% 的 token 消耗,现已提供,并被称为 Fireworks Research 系列模型的首款产品。

背景分析

Fireworks 表示,用户希望以更低成本使用 Kimi K3 的编码能力,而降低推理力度会损失过多质量。团队进行了超过 50 次训练实验和超过 200 次评估,并在公开基准、生产流量及多类任务中测试 Ember-1。

Aioga 观点

Aioga 判断:该发布的核心价值主张是通过专门化训练提升推理效率,而非简单降低推理力度。来源明确说明部分自我反思可能有助于纠错,但仅表示希望通过训练保留这类能力,不能据此断言 Ember-1 已被证实具备该能力。

影响与后续

可能影响:若来源所述结果能在独立场景中复现,Ember-1 可能降低部分长推理及多轮代理任务的 token 开销。现有材料不足以证明其在所有任务中都与 Kimi K3 等质,也不代表成本和效果已获外部统一验证。 后续观察:应关注独立评测是否复核约 40% 的 token 节省及质量表现,并核实这些结果在公开基准、实际生产流量、编码任务和代理任务中的适用范围,同时观察后续专门化模型是否发布。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: fireworks.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-27T19:09:18.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Fireworks Research 发布基于 Kimi K3 的专用模型 Ember-1,以约少 40% 的 token 达到与 Kimi K3 相当的质量,今日以 Rese...

Hacker News 热门(buzzing.cc 中文翻译)2026-09-27T19:09:18.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。