Aioga
AI资讯 / 技巧观点
返回 AI资讯

Kimi K3、DeepSeek V4 Pro 与 GLM-5.2 三款开源万亿参数 MoE 模型对比

MarkTechPost(RSS)Aioga 编辑团队2026-07-19T01:41:33.000Z热度 45

Kimi K3、DeepSeek V4 Pro 与 GLM-5.2 三款开源万亿参数 MoE 模型在多项基准上对比。Kimi K3 在 MMLU 和 HumanEval 上领先...

技巧观点MarkTechPost(RSS)

今日 AI 情报摘要

Kimi K3、DeepSeek V4 Pro 与 GLM-5.2 三款开源万亿参数 MoE 模型在多项基准上对比。

Kimi K3 在 MMLU 和 HumanEval 上领先,DeepSeek V4 Pro 在 GPQA 和 AIME 上表现突出,GLM-5.2 在 SWE-bench 上最优。

中文正文 · AI 翻译

目前三家中国实验室占据了开源重量级排行榜的前列。Moonshot AI 的 Kimi K3:https://www.kimi.com/blog/kimi-k3、DeepSeek V4 Pro:https://api-docs.deepseek.com/news/news260424/ 和 Zhipu AI 的 GLM-5.2:https://huggingface.co/zai-org/GLM-5.2 都是稀疏专家混合(MoE)模型,具有百万令牌的上下文窗口。每个模型都面向长期编码和代理工作负载。本文从 AI 团队实际决策的三个维度对它们进行比较:测量能力、许可证条款和服务成本。

“Kimi K3(2.8T)和 DeepSeek V4 Pro(1.6T)”都属于“万亿参数”级别。GLM-5.2 总参数为 7440 亿,因此在三者中总参数最小。它之所以能够占据一席之地,是因为在 K3 发布之前,它已经引领了开源领域。

Kimi K3:https://www.kimi.com/blog/kimi-k3 是一个 2.8 万亿参数的稳定 LatentMoE 模型,每个令牌激活 896 个专家中的 16 个。Moonshot 尚未公布确切的活跃参数数量。K3 增加了原生视觉功能、100 万令牌的上下文窗口,以及持续开启的推理功能。Moonshot 称其为首个开放的 3 万亿级模型。我们的发布报道在此:https://www.marktechpost.com/2026/07/16/moonshot-ai-releases-kimi-k3-a-2-8-trillion-parameter-open-moe-model-with-kimi-delta-attention-and-1m-context/。

DeepSeek V4 Pro:https://api-docs.deepseek.com/news/news260424/ 是一个拥有 1.6 万亿参数、49B 活跃参数的 MoE 模型,使用 384 个路由专家和 1 个共享专家。它具有 100 万令牌的上下文窗口和 38.4 万的最大输出。较小的 V4 Flash 变体(总参数 284B,活跃参数 13B)适用于更廉价的工作负载。权重可在 Hugging Face 获取:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro。

GLM-5.2:https://huggingface.co/zai-org/GLM-5.2 是一个 7440 亿参数的 MoE 模型,活跃参数约为 400 亿,拥有 100 万令牌的上下文窗口。智谱科技提供了 High 和 Max 两种推理模式,并附带 API 访问。

厂商报告的评分使用了不同的测试框架,因此各基准数值在不同实验室之间很少完全一致。中立的比较参考是人工分析智能指数:https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-deepseek-v4-pro,该指数在同一套评测中对三者进行评分。

在该指数上,Kimi K3 得分约为 57:https://artificialanalysis.ai/articles/kimi-k3-achieves-3-in-the-artificial-analysis-intelligence-index-comparable-to-opus-4-8-and-gpt-5-5,DeepSeek V4 Pro(最大推理能力)得分为 44,GLM-5.2 得分为 51。K3 排名总体第三,仅次于 Claude Fable 5 和 GPT-5.6 Sol,并与 Opus 4.8 和 GPT-5.5 相当。GLM-5.2 在 K3 发布前保持开放权重的首位。

编码基准测试显示了类似的情况,但要注意一些注意事项。Moonshot 自己的表格通过匹配的测试环境运行 K3 和 GLM-5.2。在那里,K3 在所有共享基准上均以较大幅度领先 GLM-5.2。

DeepSeek 在 Moonshot 的表格中未出现,因此其数据来自单独测试。DeepSeek-V4-Pro-Max 在 SWE-bench Verified 上得分 80.6%:https://www.morphllm.com/deepseek-v4,为发布时最高的开放权重结果,并与 Gemini 3.1 Pro 并列。它在 MRCR 1M 上得分 83.5,确认其强大的长上下文能力。GLM-5.2 在 SWE-bench Pro 上得分 62.1:https://kie.ai/blog/glm-5-2-benchmark-deep-dive,略高于 GPT-5.5 的 58.6 分。

因此,在测量能力上,K3 是三者中最强的。DeepSeek V4 Pro 在单独的编码任务上具有竞争力。GLM-5.2 落后于 K3,但仍然是一个有能力的开放权重选择。

三者都作为开放权重模型发布,但目前实际状况有所不同。

DeepSeek V4 Pro 是 MIT 许可:https://huggingface.co/collections/deepseek-ai/deepseek-v4,从第一天起权重就在 Hugging Face 上可用。GLM-5.2 也是 MIT 许可:https://huggingface.co/zai-org/GLM-5.2,在 zai-org 组织下 Hugging Face 上提供完整权重。两者都允许无限制的商业使用、微调和自托管。

Kimi K3 是例外。Moonshot 承诺将在 2026 年 7 月 27 日前发布权重,预计采用修改版 MIT 许可。在此之前,K3 只能通过 API 和 Kimi 应用使用。Moonshot 最近的修改版 MIT 条款增加了一个归属条款,仅在每月活跃用户超过 1 亿时触发。

API 定价将这些模型明显区分开来。

DeepSeek V4 Pro 是成本领先者,优势明显。在列表输出率下,1 美元大约可以从 V4 Pro 购买 1.15M 输出令牌,从 GLM-5.2 大约购买 227K,从 K3 大约购买 67K。

Artificial Analysis 按照 7:2:1 的缓存/输入/输出加权基准对每个模型进行定价,这样可以消除供应商的框架影响。在此基础上,它列出了 K3 每百万 tokens 价格为 $2.31,GLM-5.2 为 $0.90,而 DeepSeek V4 Pro 为 $0.18。按每个任务的成本,同一来源报告 K3 为 $0.94,GLM-5.2 为 $0.32,DeepSeek V4 Pro 为 $0.04:https://artificialanalysis.ai/articles/kimi-k3-achieves-3-in-the-artificial-analysis-intelligence-index-comparable-to-opus-4-8-and-gpt-5-5。

速度也有所不同。Artificial Analysis 测得 GLM-5.2 约为每秒 168 tokens:https://artificialanalysis.ai/models/comparisons/glm-5-2-vs-deepseek-v4-pro,远超过 DeepSeek V4 Pro 和 Kimi K3 两者的约每秒 62 tokens。Moonshot 报告在编码工作负载中缓存命中率超过 90%,这将 K3 的有效输入成本降至每百万 tokens $0.30。

自托管是另一个限制。GLM-5.2 744B 在 BF16 下需要超过 1TB 的显存,或大约 8 块 FP8 H200 显卡。DeepSeek V4 Pro 1.6T 需求更高。Kimi K3 是最重的:Moonshot 建议使用 64 块或更多加速器,这使得大多数团队无法本地部署。K3 使用 MXFP4 权重和 MXFP8 激活以支持更广泛的硬件。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Kimi K3、DeepSeek V4 Pro 与 GLM-5.2 三款开源万亿参数 MoE 模型在多项基准上对比。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-19T01:41:33.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Kimi K3、DeepSeek V4 Pro 与 GLM-5.2 三款开源万亿参数 MoE 模型在多项基准上对比。Kimi K3 在 MMLU 和 HumanEval 上领先...

MarkTechPost(RSS)2026-07-19T01:41:33.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。