月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
A Face Oculta da Lua lançou o Kimi Linear, uma arquitetura de atenção linear híbrida, que supera totalmente os mecanismos de atenção completos pela primeir...
A Face Oculta da Lua lançou o Kimi Linear, uma arquitetura de atenção linear híbrida, que supera
totalmente os mecanismos de atenção completos pela primeira vez em cenários de contexto curto, contexto longo e aprendizado por reforço. Seu modelo de 3B de parâmetros ativados supera significativamente a MLA completa em todas as tarefas de avaliação, enquanto reduz o uso de cache KV em até 75% e alcança até 6 vezes o rendimento de decodificação em contextos de 1M. A Face Oculta da Lua abriu o código do núcleo KDA, a implementação vLLM e os pesos do modelo.
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
材料称,月之暗面推出混合线性注意力架构 Kimi Linear,其 3B 激活参数模型在所列评估任务上优于全 MLA,KV cache 使用量最多降低 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
该内容属于论文研究,公开材料来自 Hacker News 热门内容的 buzzing.cc 中文翻译,原文指向 arXiv。材料还称,月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
Aioga 判断,Kimi Linear 的关注点不仅是评估表现,也包括长上下文推理中的缓存占用与解码吞吐量。不过,现有摘录未提供任务清单、实验设置及对照细节,不能据此推断其在所有实际部署中均占优。
Aioga 判断,若论文报告的结果可在相同条件下复现,该架构可能为长上下文模型降低 KV cache 压力并提高解码效率提供新选择。值得关注的是,材料仅陈述最高值,尚不足以判断不同上下文长度下的稳定收益。 建议下一步核对论文中的评估任务、全 MLA 对照配置、硬件环境、吞吐量计算方式及 KV cache 统计口径,并结合已开源的 KDA 内核、vLLM 实现和模型权重开展独立复现。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Fonte: Hacker News 热门(buzzing.cc 中文翻译)
原文链接: Abrir fonte original
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-28T15:21:28.545Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。