月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
월의 암면은 Kimi Linear를 출시했으며, 이는 하이브리드 선형 주의 구조로서 짧은 문맥, 긴 문맥 및 강화 학습 시나리오에서 전통적인 전체 주의 메커니즘을 처음으로 전면적으로 능가합니다. 그 3B 활성 파라미터 모델은 모든 평가 과제에서 전체 MLA보다 현저히 우수하며,...
월의 암면은 Kimi Linear를 출시했으며, 이는 하이브리드 선형 주의 구조로서 짧은 문맥, 긴 문맥 및 강화 학습 시나리오에서 전통적인 전체 주의 메커니즘을 처음으로
전면적으로 능가합니다. 그 3B 활성 파라미터 모델은 모든 평가 과제에서 전체 MLA보다 현저히 우수하며, KV 캐시 사용량을 최대 75%까지 줄이고, 1M 문맥에서 최대 6배의 디코딩 처리량을 달성합니다. 월의 암면은 KDA 커널, vLLM 구현 및 모델 가중치를 오픈소스로 공개했습니다.
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。
其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
材料称,月之暗面推出混合线性注意力架构 Kimi Linear,其 3B 激活参数模型在所列评估任务上优于全 MLA,KV cache 使用量最多降低 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。
该内容属于论文研究,公开材料来自 Hacker News 热门内容的 buzzing.cc 中文翻译,原文指向 arXiv。材料还称,月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
Aioga 判断,Kimi Linear 的关注点不仅是评估表现,也包括长上下文推理中的缓存占用与解码吞吐量。不过,现有摘录未提供任务清单、实验设置及对照细节,不能据此推断其在所有实际部署中均占优。
Aioga 判断,若论文报告的结果可在相同条件下复现,该架构可能为长上下文模型降低 KV cache 压力并提高解码效率提供新选择。值得关注的是,材料仅陈述最高值,尚不足以判断不同上下文长度下的稳定收益。 建议下一步核对论文中的评估任务、全 MLA 对照配置、硬件环境、吞吐量计算方式及 KV cache 统计口径,并结合已开源的 KDA 内核、vLLM 实现和模型权重开展独立复现。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: arxiv.org
출처: Hacker News 热门(buzzing.cc 中文翻译)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-28T15:21:28.545Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.