Aioga
AI资讯 / AI资讯
返回 AI资讯

Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-16T19:49:39.000Z热度

Kimi is launching K3, a multimodal open-weight model with 2.8 trillion parameters and on...

AI资讯The Decoder:AI News(RSS)

今日 AI 情报摘要

Kimi is launching K3, a multimodal open-weight model with 2.8 trillion parameters and one million

tokens of context. In the company's own benchmarks, it comes close to Claude Fable 5 and GPT 5.6 Sol while beating Opus 4.8 and GLM 5.2, in some cases by a wide margin. The model is also significantly pricier than its predecessor. Full weights are scheduled for release by July 27.

中文正文 · AI 翻译

Kimi 正在推出 K3,这是一款参数量为 2.8 万亿、具有一百万令牌上下文窗口的多模态模型。在公司自己的基准测试中,它的表现与领先的专有模型相当。

Image description

据 Kimi 介绍,新旗舰模型 K3 共有 2.8 万亿参数,能够原生处理图像和视频,并支持一百万令牌的上下文窗口。Kimi 称 K3 是大约 3 万亿参数范围内的首个开放模型。完整的模型权重预计于 7 月 27 日发布。该模型主要面向长期运行的编程任务、知识工作和复杂推理。

在 Kimi 自己的基准测试中:https://www.kimi.com/blog/kimi-k3,K3 仍然落后于顶级专有模型 Claude Fable 5 和 GPT 5.6 Sol,但击败了所有其他测试系统,包括 Claude Opus 系列模型和中国竞争对手 GLM-5.2。根据公司介绍,所有结果均来自 Kimi,并在最大或高强度思考下获得。

Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI

在所有 35 个测试中,K3 大约有七次排名第一,在其余大部分测试中排名第二或第三。Fable 5 赢得了最多的单项测试。在几乎每个基准测试中,K3 都以较大优势击败了 Opus 4.8、GPT 5.5 和 GLM 5.2。根据不同的基准测试,使用了三种代理系统中的一种:KimiCode、Claude Code 或 Codex。这意味着结果并非全部在相同条件下收集。

独立测试实验室 Artificial Analysis:https://x.com/ArtificialAnlys/status/2077832874183860404 已发布其对 Kimi K3 的首次评估。该模型在 Artificial Analysis 智能指数中的得分为 57,与 Opus 4.8 和 GPT-5.5 相当,但仍落后于 Fable 5 和 GPT-5.6 Sol。这与 Kimi 自己的说法大致一致。

Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI

在代理任务中,K3 在 GDPval v2 上的 Elo 评分达到 1,668,相较 K2.6 的 1,190 是一个大幅提升。它击败了 GLM-5.2(1,514)、GPT-5.5(1,494)和 Claude Opus 4.8(1,600),但仍未超过 Claude Fable 5(1,760)。在 AutomationBench-AA——Artificial Analysis 对 Zapier 代理 SaaS 工作流程评估的版本——中,K3 同样位居榜首,得分为 53%。

在 AA-Briefcase(一个私人长期知识工作评估)中,K3 达到了 1,547 的整体 Elo 分,比 K2.6 高出 732 分。只有 Claude Fable 5 得分更高。Artificial Analysis 评价 K3 表现全面,其评分标准和分析质量接近 Fable 5 的水平。不过,GPT-5.6 Sol 在展示质量上仍然领先。

K3 在 AA-Omniscience 指数上的准确率从 33% 提高到 46%,将整体分数从 +6 提升至 +18。但其幻觉率也从 39% 上升到 51%,意味着即使 K3 回答更多问题正确,它也会编造更多答案。Ad DEC_D_Incontent-2

根据 Kimi 的说法,该模型的主要使用场景是长期软件开发,且几乎无需人工监督。K3 旨在分析大型代码库、协调终端工具,并在多个工作步骤中保持对任务的专注。Ad

该模型将编程与视觉反馈相结合:它会检查屏幕截图、修改代码,然后检查可见输出。Kimi 将这种闭环系统称为“Vision in the Loop”,并将其定位为游戏开发、UI 设计和 CAD 的基础。

作为演示,Kimi 展示了一个程序生成的 3D 开放世界游戏:https://horseback-open-world.ok.kimi.link/,据称 K3 完全在浏览器中使用 Three.js、WebGPU 和 GPU Compute 构建,以及一个交互式黑洞可视化:https://blackhole-visualizer.ok.kimi.link/。对于开放世界演示,K3 程序生成了环境,并使用外部工具创建了 3D 骑手和马模型。其他演示:https://www.kimi.com/blog/kimi-k3 包括长征十号火箭发射与返回的模拟,以及一个 Game Boy Advance 模拟器。

K3 使用专家混合架构,每次仅激活 896 个专家中的 16 个。它配备了一个名为 Kimi Delta Attention 的新注意力架构:https://arxiv.org/abs/2510.26692,Kimi 称该架构可实现百万 token 上下文的解码速度提高至 6.3 倍。所谓的“注意力残差”:https://arxiv.org/abs/2603.15031 据称可将训练效率提高约 25%,同时额外计算开销不足 2%。

根据 Kimi API 文档:https://platform.kimi.com/,一百万输入令牌的成本为缓存命中时 $0.30,未命中时 $3.00。包括推理在内的一百万输出令牌成本为 $15.00。这些价格与上下文长度无关。缓存会自动进行,这使得未修改的长前缀对于代理和大型代码库特别有用。

这使得 K3 的价格远高于其前代 K2.6。K2.6 官方价格为缓存命中时每百万令牌 $0.16,未命中时 $0.95,输出为 $4.00。中国供应商也不再以极低价格提供其前沿模型。

不过,K3 仍比最顶级的西方模型便宜,处于上中档价格区间。例如,Anthropic 的新模型 Sonnet 5:https://the-decoder.com/claude-sonnet-5-continues-anthropics-pattern-of-hiding-price-increases-behind-unchanged-token-rates/,输入令牌每百万 $3,输出 $15,但性能较低。

根据 Artificial Analysis:https://x.com/ArtificialAnlys/status/2077832885021835289,K3 在智能指数上的平均每任务成本为 $0.94,接近 GPT-5.6 Sol 的 $1.04,大约是 Opus 4.8 $1.80 的一半。然而,它明显高于开源权重的同类模型,如 GLM-5.2($0.32)和 DeepSeek V4 Pro($0.04)。

At $0.94 per task, Kimi K3 lands in the same price range as GPT-5.6 Sol ($1.04) but costs about half as much as Opus 4.8 ($1.80). Open-weight competitors like DeepSeek V4 Pro ($0.04) and GLM-5.2 ($0.32) remain far cheaper. | Image: Artificial Analysis

K3 的令牌使用量也比其前代少。完成所有九项评估大约需要 1.32 亿输出令牌,而 K2.6 约需 1.66 亿,减少了 21%,同时得分高出 13 分。由于令牌价格大幅提升,在大多数情况下,K3 每任务的成本仍可能高于 K2.6。

K3 已可通过 Kimi.com:http://kimi.com/,iOS、Android 和 HarmonyOS 移动应用,Kimi Work 桌面客户端:https://www.kimi.com/zh-cn/products/kimi-work(版本 3.1.0 及以上),以及 Kimi Code:https://www.kimi.com/code 获取。在 OpenRouter 上,该模型的标识为 "moonshotai/kimi-k3",但目前只通过 Moonshot 本身提供服务。预计开源权重将在七月底前发布。

保持对 AI 的了解,内容清晰、有用,无冗余。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI。 Aioga 将其归入「AI资讯」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:AI 行业动态需要结合来源、时间、实际可用性和后续反馈判断,标题或单次发布本身不能替代完整证据。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察原文更新、官方说明、用户反馈和同类产品的后续动作。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-16T19:49:39.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Kimi is launching K3, a multimodal open-weight model with 2.8 trillion parameters and on...

The Decoder:AI News(RSS)2026-07-16T19:49:39.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。