Aioga
AI资讯 / 技巧观点
返回 AI资讯

开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

Nathan Lambert:Interconnects(RSS)Aioga 编辑团队2026-07-22T14:09:04.000Z热度 62

Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题...

技巧观点Nathan Lambert:Interconnects(RSS)

今日 AI 情报摘要

Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。

Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题加速演进。 Qwen 宣布下一代大模型将开源权重,中国厂商在开源策略上持续加码。 讨论还涉及开源模型与闭源前沿的性能差距、知识蒸馏争议,以及后训练对特定任务的价值。

中文正文 · AI 翻译

Nathan 和 Florian 坐下来讨论开放模型的所有动向。在上周 Kimi K3 发布之后,似乎一切都在加速——美国与中国的地缘政治、开放模型与封闭模型的经济学、AI 前沿的安全性等等。章节:00:00 欢迎与背景 04:38 使用 / 体验 Kimi K3 08:53 GLM 5.2 的持续作用 12:47 中国模型为什么这么强? 17:41 数据、环境以及中国实验室巡礼 19:47 中国提供商综述:Qwen、DeepSeek、MiniMax… 24:08 美国开放模型生态 30:25 前沿与接近前沿,以及反对禁令的网络安全案例 34:58 蒸馏与 Ben Thompson 辩论 44:12 预测与前沿等级列表 48:36 总结

Interconnects AI
Interconnects AI

在 Apple Podcasts 收听:https://podcasts.apple.com/us/podcast/interconnects-audio/id1719552353,Spotify:https://open.spotify.com/show/6XNzfJULeVxR7SneeesDUs,以及你获取播客的任何平台:https://www.interconnects.ai/podcast。其他 Interconnects 采访请访问:https://www.interconnects.ai/t/interviews。

分享:https://www.interconnects.ai/p/open-models-recap-more-on-kimi-k3?utm_source=substack&utm_medium=email&utm_content=share&action=share

更多教育性训练后视频,请见我正在整理的课程:https://rlhfbook.com/course

00:00:06 Nathan Lambert:好的,欢迎回到 Interconnects。我们正在进行季度开放模型回顾,主要是我们调侃或解释,当然不是调侃,为什么这么多蒸馏观点不好,并理解当前的状态。我记得 Kimi K3 是在上周四发布的。我认为在不久的将来我们会看到更多。这似乎几乎是不可避免的。周末,习近平发表了演讲,他直接承诺将开放与开源作为战略。这并不是一份详细的事务布局报告。

Qwen 宣布他们的下一个大模型将是开源权重,这将是一个重大变化。我觉得有很多内容可以讨论。我认为 Flo 你已经开始谈论性能差距和蒸馏的内容了,所以我们可能可以从这里开始,然后我也有一个小清单,我们可以随时浏览我写的博客,里面内容都非常细致。我觉得我们有无穷无尽的话题可以聊。所以请继续你的抱怨式讨论。

00:01:17 Florian Brand: 是的,我认为每次发布模型时,至少在每次开源模型发布时,最大的问题是它落后封闭前沿多少或者几个月。人们喜欢给这个问题一个明确的数字,这实际上很混乱,因为现在我们有这么多不同的基准提供者,也有许多不同的基准,每个网站——我自己也不例外——都会拿出自己喜欢的基准来显示当前模型或新发布的模型已经达到了前沿水平,而另一方则会拿出另一个基准来显示,哦,它实际上落后一年左右。这在很大程度上似乎取决于这个问题:开源模型落后多少个月。

00:02:26 Nathan Lambert: 是的。所以我的挑衅是,有些基准实际上与人们正在做的任务相当相关,比如智能代理编码和智能代理计算机使用任务,而有些基准则与长尾相关,我认为 Claude 和 GPT 在这方面非常有价值。但如果市场是针对 Claude Code 和 Codex 的话,而现在市场是软件工程,那么模型落后几个月可能就是一个非常非常大的问题。我怀疑这个模型会表现得不错,声明一下,模型权重还没发布,据说是在 7 月 27 日,而很多讨论将会依赖于权重已发布的假设。

但人们可以对这个模型进行后续训练,从而在很多特定的利基领域中非常可能匹配 Opus 和 GPT,我认为,关注这个,我的意思是我们在后训练开放模型行业中有不同的看法,但在让这些模型针对特定高价值任务进行微调方面,有大量的兴奋和进展。这在历史上是通过 Qwen 和 GLM 的混合方式完成的,而 GLM 5.2 确实加速了这一进程。我很好奇,第一个发布博客文章的人会说“我们在我们的任务上微调了 Kimi K3”,因为我打赌你可以获得很大的提升。我认为,即使你比我更多使用 Kimi K3,但我的直觉是,这将是一个有点粗糙的后训练过程,仅仅因为它的规模扩展很大,而这通常意味着仍然有很多性能可以被挖掘。不是。

00:04:03 Florian Brand: 是的。运行、运行、运行,尤其是后训练,这将非常困难,因为你需要一节点的 B300 来仅仅加载权重,这在规模上是疯狂的。所以可能需要一些时间,并且我听说要投入大量的工程工作才能真正使其处于可微调的状态。嗯,但人们,你想谈论使用模型的事情,你实际上注册了编码计划并使用了它。所以,把这个拿出来是很好的背景信息。

00:04:38 Nathan Lambert: 是的。所以我在发布后的第二天左右注册了 200 美元的计划,这是他们最大的一个,类似于其他所有计划,但他们还有我认为 40 美元和 100 美元的计划。嗯,但最大的计划有 100 万的上下文,我认为,或者至少感觉上在 API 请求方面也有一些优先权,因为很多人在线上说他们不断遇到 API 错误,而到目前为止,如果要我说的话,我的情况还算不错。嗯,就模型能力而言,除了前端很优秀之外,在某些方面它确实非常出色,而且表现优异。

嗯,即使是我对一些研究任务的期望,比如我在互联公司(Interconnects)进行的一些任务,我们现在有一年多关于开放模型的数据,我让前沿模型做一些有趣的分析,这是我们以前从未在自己分析并发表的工作中做过的。我让它们好吧,做一些新的,然后惊艳我,基本上就是这样。很多模型或前沿模型,或者基本上所有模型,都会盯着我们做过的东西,重新做数据分析部分,然后再做一些奇怪、深奥的部分。

嗯,Kimi K3 做了一些更有趣的事情,我明确告诉它去抓取 Reddit,然后它找到了我甚至没考虑过的一些子版块,然后发现例如 Reddit 的讨论是最近一两个月的,或者它们发现有趣的模型通常在下载量激增前一两个月就被关注,比如大家都关注 Qwen,之后人们就更多下载 Qwen 模型,这种分析是开创性的。但是相比其他前沿模型,Kimi 确实让我感到惊讶。

一个简单的问题是,你是否可以在大多数核心工作中使用它?比如说实验工作,你通常会做的很多都是用 Codex,我认为你是 Codex 用户而不是 Claude 用户,那么你觉得这个模型的适用范围与 Codex 的重合度是多少?

00:07:24 Florian Brand:嗯,这真的取决于我给它多少自由度。比如我目前看到 Kimi K3 的大问题是,我正在工作框架上进行研究,这个框架是在我工作的 Prime Intellect 公司进行的,主要发现是 Kimi 的代码简单很多,这使得它更易读,但它缺失了一些 Codex 或者说我们谈论的 56、55 尤其是 54 级别的东西。因此,我会说 Kimi K3 在这些任务上的水平大约是 54-55 级别。

但是如果我愿意,我可以阅读代码,然后说,好吧,这真的是好代码,然后我用 Codex 稍微检查一遍,它会找到所有这些小众的小案例,在这些地方它表现不算出色,但用于监督性运行或进行一些实验,它实际上是挺可用的。嗯,对于一些其他小众的事情,你可以让它直接运行。唯一的缺点是,这也因为 API 完全被用户淹没,而且它们的服务器在中国。实际墙钟时间明显明显比 GPT 高。但是我会说,如果我要在日常工作流程中推动它并使用它,我会更慢,但不会慢到让我说,“好吧,这完全不能用”。

00:08:53 Nathan Lambert:那和 GLM 5.2 相比如何?因为在我看来,GLM 5.2 仍然是一个正在展开的故事,比如我会在旧金山各处走动,人们会说,是的,我真的在我的某些代理式编码和/或工作流程中使用它。嗯,你觉得呢,我感觉你在使用 GLM 吗,还是

00:09:20 Florian Brand:是的。我也主要使用和曾经使用 GLM,因为我们有一个内部端点,它非常快;或者在那之前,我也使用过一个 API,大概每秒 200 或 300 个 token。嗯,如果你能在足够好的水平下快速完成很多任务,你就会用那个模型,而不是去 Codex 然后选择较低性能的模型,再选择合适的推理努力,再选择快速,我只是用 GLM 得到相同的结果,而且它还挺好的。它绝对在功能上达到了 Sonnet 级别,对于很多清理任务或者仅仅是琐碎工作的任务,它真的很有效。我会说,你可能可以用 Kimi K3 作为主要代理,GLM 作为子代理,完成很多工作。

00:10:24 Nathan Lambert: 关于Kimi的发布和模型规模,有一些非常不同的地方。我认为这些开放模型真正被优化并在各个推理提供商上可用可能还需要一段时间。比如GLM 5.2已经相当快,但首先,我们还没有得到权重;其次,我认为它的采纳推广速度不会像500B、700B的MoE那样快。我觉得那里会遇到更多问题,这是一个非常不同的局面,以前中国的模型会在完成强化学习训练后,在几小时到几天,甚至最多一周内发布开放权重的模型,然后生态系统几乎立即就知道如何使用它。

我认为在下一代开放权重模型上,基础设施的提升要大得多,我们必须考虑到这一点。封闭实验室在宣布模型之前会在幕后完成这些工作。所以这在某种程度上会操控时间差,人们实际上可能需要额外一个月才能在大规模工作流程中后训练并使用Kimi。而作为开放权重的粉丝,我们喜欢说,只有在封闭模型可用时,你才可以考虑时间差;但是现在在开放模型中也存在类似的动态,比如Kimi的API完全崩溃了,供应过多,需求过多,供应不足。所以这个模型并不会立即扩散,我只是在考虑它与性能时间差的关系。

00:11:54 Florian Brand: 这确实如此,但另一方面,过去几个月开放生态系统已经专业化了很多。在你最初的发布期间,它们都会带一些合作伙伴,这些合作伙伴提前拿到权重。他们会在几天甚至几周前就发布vLLM补丁,这与一年前完全不同,那时权重刚开始发布,模型制造商会说,好吧,你们自己摸索吧。所以我预计第一天的普遍可用性会相当不错,然后各种提供商开始竞速优化,以获得更高的速度,因为这带来很高的声望。

00:12:47 Nathan Lambert: 是的。好的,有两个方向可以讨论。为什么我们认为中国的模型能够达到这么好的水平?我写过关于这一点的内容,在我们的 Discord 上和 JSD 在 Epoch:https://epoch.ai/ 上有一个讨论,我觉得非常好。我在我的文章中有一个部分,我开始倾向于认为中国的实验室在资本利用方面更高效,你可以以一种使模型更好的方式,将资本转化为计算资源、数据和人才。我认为这非常重要,如果这确实是一种结构性优势,无论原因如何,我认为原因可能是人才更适合他们的教育体系去解决可以提升大语言模型(LLM)的相关问题。

也有可能是在中国,所有的计算资源和人才等成本都要低得多。不管是因为补贴,还是工资水平普遍较低,但在我们推进模型迭代的过程中,这都是一个非常重要的因素。如果下一代模型对 Anthropic 的成本是 100 亿美元,但对 Kimi 只需要 40 亿美元,这可能会产生非常大的影响,但原因尚不明确。例如,我想 Big Eagle(Kimi 的工程师)在我关于这个的推文下回复说,这有帮助,因为我们并不是在尝试推动前沿,只是在努力追赶,这实际上可能是一种心态问题,即中国实验室在设定目标时的思路,使得他们构建这些模型的成本要低得多。

但在过去一年里,我们问了很多类似“中方模型会不会掉队”的问题。我曾认为,由于训练的资本密集性,封闭模型和开放模型之间的差距会扩大,但看来情况正在朝相反方向发展,这很难解释。那么,你是否同意中国实验室的进展比我们预期的要更快一些?为什么会这样?

00:14:43 Florian Brand: 好吧,我实际上看了我们基于去年的回顾对今年的预测,我们基本上说过差距会保持在几个月之内。所以这个预测似乎大体上成立。幸运的是,我们没有给出一个具体的数字,无论是3个月、6个月还是9个月,所以我们在这方面是安全的。但我认为,像我们在中国与这些人交谈时的总体感觉,他们——研究人员本身——都是两三百人的团队,平均二十多岁,他们只想让一个模型非常好,他们似乎不做任何额外的实验。

他们似乎不做任何偏离这些事情的事情。就计算能力而言,这对我们来说是一个非常难回答的问题,尤其是现在这些中国芯片开始上线。我也认为芯片走私在过去六到九个月大幅增加,或者被走私的芯片开始上线。

00:15:58 Nathan Lambert: ‘走私’是规避出口限制的一个通用说法。如果这些芯片在马来西亚并且他们在使用它们,我也算作类似情况,我认为在过去六到九个月这大幅增加,这是部分原因,而且你说的,但我只是想指出,我确实认为他们拥有的计算能力比训练上一代模型时要多得多。

00:16:24 Florian Brand: 是的,比如说,为了提供一些背景信息,两周前我认为LongCat发布了他们的模型,他们声称——我们知道这很可能是真的——完全使用中国芯片训练。他们没有公开说明具体是哪种芯片,但人们推测是华为的Ascend芯片。随着国内生产的增加,它们可能主要用于训练,但对于推理也特别有用,而推理也是训练中非常重要的一部分。

所以他们可能在训练部分使用了某种混合的Nvidia和其他芯片,然后在推理部分使用的比例越来越大,而在这个阶段这真的很重要。所以我认为他们的整体计算量在增加,而且实际上他们没有很多用户。所以他们不需要像ChatGPT那样为10亿用户提供动力,也不需要像Anthropic那样为数百或数千家企业提供服务,因为他们没有那么多付费客户。

00:17:41 Nathan Lambert: 是的。我认为即便是那些付费客户,至少在企业端,也会占用公司时间和交流,当你在支持这些东西时。即使你不是做研究的,即使这不是你的工作,也会改变公司的关注点。如果SSI推出了一个好的模型,那将是对注意力分散问题的最终验证,不过那是另一个话题,我们可以稍后再谈。我认为数据和环境产业开始出现的迹象也有一些传闻。

你记得具体的例子吗?因为当我们在中国的时候,看到他们几乎不利用外部数据,确实有点令人震惊。所以就在我们四月旅行后的几个月,也就是七月,我们听到了一些关于中国新公司想要购买数据的消息。这也是一个有趣的时间线,反映了这种情况是如何变化的。

00:18:40 Florian Brand: 我会在他们实际告诉我们的内容上加上误差范围。

00:18:44 Nathan Lambert: 因为时间太接近,我不太确定。

00:18:49 Florian Brand: 是的,那可能,那可能是对的。不过这些事情很难确定。我会说,看起来购买外部数据正变得越来越重要。这将帮助开放模型赶上封闭模型,如果它们只是购买相同的数据,也许还能享受折扣,因为它们是在后期购买数据环境的。但这确实是一个因素。这个因素有多大,我们不知道。我们没有任何公开的洞察,我怀疑我们能从任何人那里获得这些洞察,所以这绝对是我们能够赶上或提高他们模型评分的原因之一。

00:19:47 Nathan Lambert: 好的,汇总一下其他中国模型提供商。我们谈到了Kimi,谈到了智谱/GLM。我认为很快会有更多非常优秀的GLM模型。他们可能称之为GLM 5.5。我们谈到了Qwen,他们最大的模型即将推出。我会说,Qwen最大的模型相较于他们的小模型在绝对性能排名上一直没有那么出色,这可能是专注策略的代价。我认为这与云公司有关。这几乎就像,如果你仔细看,几乎就像谷歌一样。

就像Qwen、阿里巴巴这里有这么多机会,并且通过这些小模型将开发者与阿里巴巴Qwen联系起来,对于他们的云来说是巨大的机会,我认为他们非常成功。但他们的大模型一直没有像他们的小模型那样出色。所以我不认为他们的模型会像Kimi K3或GLM 5.2那样具有突破性。我预计它会作为重大开放新闻在媒体上报道,就像中国的‘开放瓶’名称大热一样,但我认为它不会像一则新闻故事那样持续。DeepSeek,你可以插话,随你。

00:21:01 Florian Brand: 有趣的是,不知道你们有多少关注这一点,但他们有一个端点,你可以用来预览版本,他们每天都会更新这个端点,所以他们有非常快的迭代周期,因为我们在所有这些推特的基准测试中都有进展。所以很多这些 SVG 事情和 three.js 这些可视化生成任务,这个模型在过去几天里有很大提升。所以他们想出了一种快速反馈机制,其他公司也有。我们知道这个,Cursor 有很多博客讲述他们如何快速迭代。但他们似乎不断上传新的检查点并提供使用。

00:21:47 Nathan Lambert: 但是我同意。我猜它是在他们最终的 RL 运行中时间受控的,就像在他们的 RL 运行结束时仍在略微改进,他们只是勾选了完成框。

00:22:03 Nathan Lambert: 好的。Qwen DeepSeek V4 预览版本应该会发布。我觉得 DeepSeek V4 的情况是 flash 模型实际上更受欢迎,它们的体积更小,看起来对用户来说是一个真正的工作马。所以我认为这是值得关注的模型。我不指望 V4 Pro 会有戏剧性的突破。这和任何事情类似,比如小米如果很快发布一个新的 MiMo Pro 型号,我不指望它会有多大的创新,但它可能会是一个非常可靠的模型。只是很难知道。他们仍然是一个相当新的参与者。MiniMax,我认为是在玩不同的游戏。我不认为 MiniMax 在追求这种 Kimi/GLM 向 AGI 的突破感觉。

00:22:46 Florian Brand: 哦,我不同意。

00:22:49 Nathan Lambert: 你认为,MiniMax 还在追这个吗?

00:22:52 Florian Brand: 是的,我,我,我觉得他们确实看到了这种紧张,尤其是因为他们是一家上市公司,类似于 GLM,如果你看看股价表现,过去几天这些股票 RIP,这似乎有巨大差别。有趣的部分将是许可证,因为他们改变了很多许可证,越来越严格,如果在习…演讲后又改变主意,那会很有意思。

呃,看看 MiniMax 是否会回到完全开放的许可证,这将会很有趣。同样有趣的是看看 K3 将使用哪种许可证,因为他们说过会开源它,但我认为他们并没有在具体的许可证上做出任何承诺。

00:23:45 Nathan Lambert: 是的,这真的非常重要。我们拭目以待。嗯,Ling、美团、LongCat,有点类似,非常强大的模型,可能从中获得了很多内部价值,但并没有同样的开发者突破。嗯,所以大概是七、八个中国实验室,我可能遗漏了一些。我们也可以谈谈美国的实验室。顺便提一下,Gemini 3.6 闪电版发布了,看起来还可以。就是小幅提升,运行更快,少点唠叨,但其实没什么大不了的。我们会停止分享这个,嗯,这就是我们对 Gemini 的提及量。

但我确实认为值得稍微谈一下美国生态系统。我认为有一些新兴玩家。Thinking Machines 发布了他们的第一个模型,我和他们中的一些人聊过,他们非常支持探索如何用 Tinker 制作可微调模型,我认为这是一个我非常推荐给大多数开源模型开发者的研究领域。我认为如果你能在这里占据心智份额,将会获得大量采用,因为这更多是关于让模型能够真正为实际任务微调,而不是追求最佳指标。嗯,所以这是他们的 Inkling 模型,是一个一万亿参数的模型,评分还不错,但并不是前沿水平。

我觉得有点像 DeepSeek V4,他们计划发布一个规模更小的模型,总参数只有原来的大约四分之一,但性能非常好。如果 Inkling 小型预览版在几周内推出,我确实认为那将会是一个被广泛使用的模型。它的大小适合自动化任务和领域特定任务,但可能不会像 Kimi 和 GLM 5.2 那样成为通用型智能体,但我认为这非常适合他们的业务。我知道还有一些其他的,美国一些小型玩家,比如 Arcee,今年早些时候发布了他们的模型,而且依然在运作中。Poolside 也开始发布一些模型。

过去几个月他们发布了一些模型,看起来还准备在此基础上发布更多。因此,他们真的非常反复地处于“模型即将推出”状态,如果他们真的致力于开源,推出一些模型或代码对他们来说非常有利,这样可以开始启动开发者的循环。不过,这件事非常耗费精力,实际上很难推出模型。我和 Thinking Machines 的一些人聊过,他们说这确实很复杂,做这件事要付出很多努力。Nvidia 也在持续推进,我觉得他们现在是一个稳健的参与者,他们会持续发布模型,很快会发布更多,并且发布了大量数据。我正努力推动他们尝试发布 Qwen 风格的小型模型,比如 Gemma。

Gemma 只有一些像 Qwen 的竞争模型,非常受欢迎。嗯,Gemma 的模型在不同尺寸和架构上有些混乱,但在采用率方面,Gemma 模型确实和 Qwen 模型非常接近。我不确定它们在研究上使用是否那么方便,这可能需要一些时间,可能需要多次迭代。现在很多语言模型研究都是围绕小型 Qwen 模型和 Qwen 基础模型设计的,所以需要一些时间。人们已经非常熟悉如何使用这些模型,并结合研究结果。所以我希望 Gemma 能持续发展,并在这个小众领域竞争。我不确定我是否遗漏了其他人。

00:27:22 Florian Brand:不,我认为两者都是大玩家。呃,它确实在变得更广泛。呃,就模型创建者而言,比如去年,除了 Gemma 3 和 GPT-OSS,我们还有其他版本发布吗?

00:27:41 Nathan Lambert:GPT-OSS 2 进展很快,显然,Nemotron 也是如此。呃,哦,我认为年初还有 Llama 4,但我不想让它被遗忘,但我们确实看到,更多玩家现在加入,并以非常惊人的速度推出模型。

00:27:59 Florian Brand:像 Poolside 在过去两三个月里已经发布了三到四个模型。呃,他们似乎找到了一种比较稳定地推出模型的方法。呃,我们在开源方面也看到类似的情况。我们在谈论 GLM,像我认为他们的模型发布迭代时间现在在 1 到 2 个月之间,每个新迭代都变得越来越好,这非常类似封闭实验室的做法,就像我们现在大约每六周会有一个新的 GPT 或 Claude 一样,呃,所以在有足够好的流程去发布越来越强大的模型方面,开源生态系统已经真正找到了方法,或者看起来已经找到了方法。

00:28:59 Nathan Lambert:是的,我同意。这很有前景,但也很有趣,美国生态系统开始发布一些模型,然后你就看到像 Xi 在麦克风上,这两个模型。就像真的很难赶上,因为训练人们实际会使用的模型需要大量的机构专业知识。我认为这是美国 releasing 模型的公司现在才意识到的:这些不仅仅是经过基准优化的、蒸馏后的、侵犯知识产权的模型。

这些模型是真正不错的模型,人们会拿它们和自己的内部交易基准进行比较,然后看看在可衡量的指标上击败它们有多难。我觉得我从美国一些交易模型的人那里感受到这种情绪,我觉得大家应该在规模和微调能力上进行创新,尝试利用这个潜在市场,这个市场离我们很近,但同时每家公司都有很大的压力去发布一个可以称作前沿的模型。我认为投资者对许多这些玩家都有这样的期望,他们实际上正在尝试做一件相当困难的事情,接下来一年美中平衡如何发展会很有意思。

00:30:25 Florian Brand: 是的,我想我和很多其他人都讨论过整体生态系统,你在一开始也提到过这个。我认为我们越来越明显地看到模型能力上的分化,对于很多任务来说已经足够好了,比如很多编程任务,目前的前沿模型,无论是开放还是封闭的,已经足够好了。在这些方面的改进感觉越来越不那么重要。

但如果我们看真正的前沿,例如寻找新的数学证明、发现新疗法、开发新药物和发明新事物,这似乎是完全不同的挑战,并且可能在相当长的一段时间里被非常前沿的模型主导。接下来的大问题是,这在可触及的市场方面有多重要,以及这会成为多大的关注重点。我认为,或者说我的一般基本判断是,我们看到前沿模型越来越封闭。我们在网络安全方面的Mythos GPT看到过……或者在生物技术方面看到过,这些模型不会对所有人开放,甚至考虑到有关Anthropic现在正在孵化或创建一些内部实验室来开发药物的报道,可能甚至不对外部合作伙伴开放。

情报判断

Aioga 编辑摘要

Nathan Lambert 与 Florian Brand 在季度播客中讨论 Kimi K3 发布后的开放模型生态,议题包括中美模型产业、开源与闭源经济性、前沿安全、性能差距、知识蒸馏及后训练价值。

背景分析

材料称,Kimi K3 于播客录制前一周发布,Qwen 宣布下一代大模型将采用开放权重策略。两位讨论者还梳理了多家中国模型提供方及美国开放模型生态,但未提供 Qwen 3.8 或 WAIC 演讲的明确事实。

Aioga 观点

Aioga 判断,用单一的“落后几个月”衡量开放模型与闭源前沿的差距并不稳健。讨论者指出,不同机构和参与者会选取不同基准,编码、计算机操作及长尾任务也可能呈现不同结论。

影响与后续

值得关注的是,开放权重策略可能继续影响模型竞争与部署选择,但材料未给出成本、用户规模或市场份额数据。对企业而言,具体任务表现可能比笼统的前沿排名更有参考价值。 后续应核验 Kimi K3 权重是否按讨论中提到的预期时间发布,并关注 Qwen 下一代模型的正式公告、许可证和评测结果;同时应基于多类任务基准审视性能差距与蒸馏争议。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: interconnects.ai

来源: Nathan Lambert:Interconnects(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-22T14:09:04.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题...

Nathan Lambert:Interconnects(RSS)2026-07-22T14:09:04.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。