月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
DarkSide เปิดตัว Kimi Linear ซึ่งเป็นสถาปัตยกรรมความสนใจเชิงเส้นแบบผสม ซึ่งครั้งแรกที่สามารถเอาชนะกลไกความสนใจทั้งหมดได้อย่างครอบคลุมทั้งในบริบทสั้น บริบทย...
DarkSide เปิดตัว Kimi Linear ซึ่งเป็นสถาปัตยกรรมความสนใจเชิงเส้นแบบผสม
ซึ่งครั้งแรกที่สามารถเอาชนะกลไกความสนใจทั้งหมดได้อย่างครอบคลุมทั้งในบริบทสั้น บริบทยาว และสถานการณ์การเรียนรู้แบบเสริม โมเดลที่มีพารามิเตอร์กระตุ้น 3B ของมันเหนือกว่า MLA ทั้งหมดอย่างชัดเจนในทุกงานประเมินผล พร้อมลดการใช้ KV cache ได้สูงสุดถึง 75% และบรรลุอัตราการถอดรหัสสูงสุด 6 เท่าในบริบท 1M DarkSide ได้เปิดซอร์สเคอร์เนล KDA, การใช้งาน vLLM และน้ำหนักโมเดลแล้ว
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
材料称,月之暗面推出混合线性注意力架构 Kimi Linear,其 3B 激活参数模型在所列评估任务上优于全 MLA,KV cache 使用量最多降低 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
该内容属于论文研究,公开材料来自 Hacker News 热门内容的 buzzing.cc 中文翻译,原文指向 arXiv。材料还称,月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
Aioga 判断,Kimi Linear 的关注点不仅是评估表现,也包括长上下文推理中的缓存占用与解码吞吐量。不过,现有摘录未提供任务清单、实验设置及对照细节,不能据此推断其在所有实际部署中均占优。
Aioga 判断,若论文报告的结果可在相同条件下复现,该架构可能为长上下文模型降低 KV cache 压力并提高解码效率提供新选择。值得关注的是,材料仅陈述最高值,尚不足以判断不同上下文长度下的稳定收益。 建议下一步核对论文中的评估任务、全 MLA 对照配置、硬件环境、吞吐量计算方式及 KV cache 统计口径,并结合已开源的 KDA 内核、vLLM 实现和模型权重开展独立复现。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
แหล่งที่มา: Hacker News 热门(buzzing.cc 中文翻译)
原文链接: เปิดแหล่งต้นฉบับ
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-28T15:21:28.545Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。