Aioga
AI资讯 / 模型更新
返回 AI资讯

Poolside 发布 Laguna S 2.1:118B 参数开源编程模型,8B 活跃参数性能超越十倍大模型

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-23T12:24:53.000Z热度 51

Poolside 发布第三款编程模型 Laguna S 2.1,采用 MoE 架构,总参数 118B,每 token 仅激活 8B 参数,支持百万 token 上下文窗口与思考...

模型更新The Decoder:AI News(RSS)

今日 AI 情报摘要

Poolside 发布第三款编程模型 Laguna S 2.1,采用 MoE 架构,总参数 118B,每 token 仅激活 8B 参数,支持百万 token 上下文窗口与思考/非思考双模式。

中文正文 · AI 翻译

Poolside 发布了 Laguna S 2.1,这是其三个月内发布的第三个编程模型。该专家混合模型使用了 80 亿个活跃参数,并且相比规模更注重在长时间代理会话中的更好行为表现。

总部位于美国的 Poolside 表示,Laguna S 2.1 在同类重量的代理编程模型中表现优于其他模型,有时性能接近体积大 10 到 20 倍的系统。该模型总参数为 1180 亿,其中每个 token 使用 80 亿活跃参数。它支持高达一百万个 token 的上下文窗口,并提供“思考模式”和“不思考模式”。

Poolside 在 2026 年 4 月通过 Laguna M.1 和 XS.2 向更广泛的受众开放了其首批模型:https://poolside.ai/blog/laguna-a-deeper-dive。在此之前,该公司主要面向政府和公共部门客户。XS.2 也是其在 Apache 2.0 许可下发布的第一个开源模型。Laguna S 2.1 是该系列在大约三个月内发布的第三个版本。

Rangliste auf Terminal-Bench 2.1 zeigt Laguna S 2.1 auf Platz 11 von 22 Modellen mit 70,2 % Pass@1.

Poolside 表示:https://poolside.ai/blog/introducing-laguna-s-2-1 Datacurve 的 DeepSWE 基准测试提供了更好的比较,因为其分数分布更广。Laguna S 2.1 的得分为 40.4%,而一些拥有超过一万亿参数的开放权重模型得分仍低于 10%。它在 SWE-Bench 多语言、SWE-Bench Pro 和 SWE Atlas 中也位居同类前列。

思考模式对性能有重大影响。没有思考模式时,Laguna S 2.1 的 Terminal-Bench 得分下降到 60.4%,而 DeepSWE 得分降至 16.5%。Poolside 表示,以往的 Laguna 模型中没有哪个模型在两种模式下的性能差距如此之大。

Liniendiagramm vergleicht Erfolgsquoten mit und ohne Thinking-Modus und zeigt durchgängig höhere Werte mit aktiviertem Thinking.

Poolside 表示,此次发布反映了其对模型性能的更广泛理念。公司在发布文章中写道:https://poolside.ai/blog/introducing-laguna-s-2-1“我们在这个模型中所做的工作不一定是增加更多智能,而是改进那些能造就更强大模型的行为:更多验证、减少理所当然、不轻易宣布胜利,以及更持久的执行力。”

早期的 Laguna 模型有时只在部分通过测试套件后就停止,或者在某种方法即将成功的前两步就放弃。Poolside 将坚持不懈、验证和修改失败方法视为除模型本身扩展之外的一条实现更好性能的路径。一个更大的 Laguna 模型已经在预训练中。

Poolside 用三个有记录的试运行来支持其主张。在其中一次试运行中,Laguna S 2.1 从一个空文件夹在 50 分钟内构建了一个可工作浏览器引擎:https://trajectories.poolside.ai/trials/019f6c37-7621-7ec1-96b5-f041f83c1540,该引擎可以渲染 HTML 和 CSS。在另一项试运行中,模型找到了 Erdos 问题 #397 的证明:https://trajectories.poolside.ai/trials/019f2a95-b4b3-77b8-ad7c-dbdf59c0d9ca,这个数学问题自 1975 年起一直未解,模型在没有 Python 的沙箱中工作。Poolside 表示该结果是一次独立的再发现。GPT-5.2 Pro 在 2026 年 1 月解决了该问题及其他几个问题:https://the-decoder.com/terence-tao-says-gpt-5-2-pro-cracked-an-erdos-problem-but-warns-the-win-says-more-about-speed-than-difficulty/,而 Laguna 的训练截止日期为 2025 年 11 月。

Screenshot des Trial: Prompt „this is an unsolved problem, solve it…“ und Lösung von Erdős-Problem 397 in 40 Schritten mit 283.981 Zeichen Reasoning, Tokens 2,8 M/115 K/2,4 M, Kosten 0,088 $.

Poolside 表示,从 XS 2.1 到 S 2.1 的飞跃主要来自模型扩展和训练后阶段,而非新的预训练数据。代理训练阶段覆盖了 409,000 个环境,其中包括 83,000 个终端任务环境和 168,000 个软件工程工作流环境。最大的单一数据来源约为 38,000 个真实提交,来自大约 17,000 个代码仓库。一个新的任务类别训练模型自行安装仓库,设置所有依赖项并运行测试套件。

Poolside 增加了部署预算并延长了超时期限。它还建了一个新的沙箱系统,可以选择性地阻止网络访问以抑制奖励作弊。多环境部署会在多个代理环境中运行相同的提示,从而降低对某一设置过拟合的风险。

根据 Poolside,训练开始到发布不到九周。预训练始于 2026 年 5 月 22 日,使用 4,096 块 Nvidia H200 GPU:https://the-decoder.com/nvidia-unveils-new-h200-gpu-for-ai-and-hpc-workloads/。S 2.1 也成为该公司首个使用 FP8 精度进行强化学习训练的模型。

Poolside 在 trajectories.poolside.ai 上发布了每一个基准轨迹:http://trajectories.poolside.ai/。在训练期间,由于模型在解题时会在线搜索匹配的 pull request,而不是自己解决任务,SWE-Bench 任务上的奖励作弊率一度超过 50%。一次小的提示修改使该比率降至不到 2%。

Laguna S 2.1 在某些情况下仍然对 Poolside 的代理框架调优得过于紧密。Poolside 表示,在稍微不同的工具模式的陌生环境中,模型可能偏离所需格式。它在竞争性数学题上也倾向于产生过长的思考序列。用户目前无法调整其思考强度。

Laguna S 2.1 可在 Hugging Face 获取:https://huggingface.co/poolside/Laguna-S-2.1,采用 OpenMDW 1.1 许可协议。在 Linux 基金会的支持下,该许可允许任何人使用、修改和重新分发模型权重,包括商业用途。

Baseten、Vercel AI Gateway 和 OpenRouter 提供托管访问。OpenRouter 提供一个 256K 上下文窗口的免费端点,以及支持完整一百万 token 窗口的付费端点。Poolside 表示,该模型也可以在单个 Nvidia DGX Spark 上本地运行:https://the-decoder.com/early-reviews-suggest-nvidia-may-have-found-another-way-to-sell-its-chips-with-the-dgx-spark/。免费的演示聊天可在 chat.poolside.ai 使用:https://chat.poolside.ai/,不需要登录。

Poolside 正在进行两个战略性押注。一个是认为通向智能的路径通过代理式编码实现:https://the-decoder.com/new-review-paper-argues-code-is-how-ai-agents-think-and-act-not-just-what-they-produce/,因为软件为代理提供了最具表现力的接口。它还认为 AI 可以“解压网络”。大部分书面材料记录的是答案而非背后的推理,Poolside 认为强化学习可以恢复这一过程。

保持 AI 最新动态。清晰、有用,无废话。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Poolside 发布第三款编程模型 Laguna S 2.1,采用 MoE 架构,总参数 118B,每 token 仅激活 8B 参数,支持百万 token 上下文窗口与思考/非思考双模式。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-23T12:24:53.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Poolside 发布第三款编程模型 Laguna S 2.1,采用 MoE 架构,总参数 118B,每 token 仅激活 8B 参数,支持百万 token 上下文窗口与思考...

The Decoder:AI News(RSS)2026-07-23T12:24:53.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。