月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
मून डार्क साइड ने Kimi Linear लॉन्च किया, एक मिश्रित रैखिक ध्यान संरचना, जो पहली बार छोटे संदर्भ, बड़े संदर्भ और सशक्तिकरण सीखने के परिदृश्यों में पूरी तरह...
मून डार्क साइड ने Kimi Linear लॉन्च किया, एक मिश्रित रैखिक ध्यान संरचना, जो पहली बार छोटे संदर्भ,
बड़े संदर्भ और सशक्तिकरण सीखने के परिदृश्यों में पूरी तरह से पूर्ण ध्यान तंत्र को पीछे छोड़ती है। इसका 3B सक्रिय पैरामीटर मॉडल सभी मूल्यांकन कार्यों में पूर्ण MLA से स्पष्ट रूप से बेहतर है, साथ ही KV कैश उपयोग को अधिकतम 75% तक घटाता है और 1M संदर्भ में अधिकतम 6 गुना डिकोडिंग थ्रूपुट प्राप्त करता है। मून डार्क साइड ने KDA कोर, vLLM कार्यान्वयन और मॉडल वज़न ओपनसोर्स कर दिए हैं।
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
材料称,月之暗面推出混合线性注意力架构 Kimi Linear,其 3B 激活参数模型在所列评估任务上优于全 MLA,KV cache 使用量最多降低 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
该内容属于论文研究,公开材料来自 Hacker News 热门内容的 buzzing.cc 中文翻译,原文指向 arXiv。材料还称,月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
Aioga 判断,Kimi Linear 的关注点不仅是评估表现,也包括长上下文推理中的缓存占用与解码吞吐量。不过,现有摘录未提供任务清单、实验设置及对照细节,不能据此推断其在所有实际部署中均占优。
Aioga 判断,若论文报告的结果可在相同条件下复现,该架构可能为长上下文模型降低 KV cache 压力并提高解码效率提供新选择。值得关注的是,材料仅陈述最高值,尚不足以判断不同上下文长度下的稳定收益。 建议下一步核对论文中的评估任务、全 MLA 对照配置、硬件环境、吞吐量计算方式及 KV cache 统计口径,并结合已开源的 KDA 内核、vLLM 实现和模型权重开展独立复现。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
स्रोत: Hacker News 热门(buzzing.cc 中文翻译)
原文链接: मूल स्रोत खोलें
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-28T15:21:28.545Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。