月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
月の暗面は Kimi Linear を発表しました。これはハイブリッド線形注意メカニズムで、短文脈、長文脈、強化学習のシナリオで初めて全注意メカニズムを包括的に上回りました。その 3B 活性化パラメータモデルは、すべての評価タスクで全 MLA よりも大幅に優れており、KV キャッシュ使用量を最大 75% 削減...
月の暗面は Kimi Linear を発表しました。
これはハイブリッド線形注意メカニズムで、短文脈、長文脈、強化学習のシナリオで初めて全注意メカニズムを包括的に上回りました。 その 3B 活性化パラメータモデルは、すべての評価タスクで全 MLA よりも大幅に優れており、KV キャッシュ使用量を最大 75% 削減し、1M 文脈で最大 6 倍のデコードスループットを実現しています。 月の暗面は KDA カーネル、vLLM 実装、モデルの重みをオープンソース化しました。
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
材料称,月之暗面推出混合线性注意力架构 Kimi Linear,其 3B 激活参数模型在所列评估任务上优于全 MLA,KV cache 使用量最多降低 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
该内容属于论文研究,公开材料来自 Hacker News 热门内容的 buzzing.cc 中文翻译,原文指向 arXiv。材料还称,月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
Aioga 判断,Kimi Linear 的关注点不仅是评估表现,也包括长上下文推理中的缓存占用与解码吞吐量。不过,现有摘录未提供任务清单、实验设置及对照细节,不能据此推断其在所有实际部署中均占优。
Aioga 判断,若论文报告的结果可在相同条件下复现,该架构可能为长上下文模型降低 KV cache 压力并提高解码效率提供新选择。值得关注的是,材料仅陈述最高值,尚不足以判断不同上下文长度下的稳定收益。 建议下一步核对论文中的评估任务、全 MLA 对照配置、硬件环境、吞吐量计算方式及 KV cache 统计口径,并结合已开源的 KDA 内核、vLLM 实现和模型权重开展独立复现。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: arxiv.org
出典: Hacker News 热门(buzzing.cc 中文翻译)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-28T15:21:28.545Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。