Aioga
AI资讯 / 模型更新
返回 AI资讯

Poolside 发布 Laguna S 2.1:118B 开源智能体编程模型,SWE-Bench Multilingual 表现超越同尺寸模型

MarkTechPost(RSS)Aioga 编辑团队2026-07-22T00:01:32.000Z热度 45

Poolside 发布 Laguna S 2.1,一款 118B 参数的开放权重 MoE 编程模型,每 token 仅激活 8B 参数,支持 1M token 上下文。该模型在...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

Poolside 发布 Laguna S 2.1,一款 118B 参数的开放权重 MoE 编程模型,每 token 仅激活 8B 参数,支持 1M token 上下文。

该模型在智能体编程基准测试中匹配或超越数倍于其规模的模型,采用 OpenMDW-1.1 许可,可在单块 NVIDIA DGX Spark 上运行。

中文正文 · AI 翻译

Poolside:https://poolside.ai/ 发布了 Laguna S 2.1:https://poolside.ai/blog/introducing-laguna-s-2-1,这是一款拥有 1180 亿参数的开源权重模型,专为代理编码构建。它是一个专家混合(MoE)模型,每个 token 激活 80 亿参数。它支持在思考模式和非思考模式下最多 100 万个 token 的上下文窗口。权重可在 Hugging Face 上获取:https://huggingface.co/poolside/Laguna-S-2.1,采用 OpenMDW-1.1 许可证,模型体积足够小,可在单个 NVIDIA DGX Spark:https://www.nvidia.com/en-us/products/workstations/dgx-spark/ 上运行。

在长周期编码基准测试中,Laguna S 2.1 可以与几倍于自身规模的模型媲美,包括 DeepSeek-V4-Pro-Max、NVIDIA 的 Nemotron 3 Ultra 和 Thinking Machines 的 Inkling。Laguna S 2.1 是 Laguna XS 系列的扩展版,训练数据与 XS 2.1 相同。

该模型在任意给定 token 上大约激活 6.8% 的参数。全部 1180 亿参数都驻留在内存中,但每步仅约 80 亿参数通过网络路由。这种稀疏性使中等规模模型能够像大型模型一样运作,同时运行成本低。

Poolside 团队以 BF16、FP8、INT4 和 NVFP4 格式发布权重,同时提供官方 GGUF 和 MLX 转换以及 DFlash 草稿模型。从训练开始到发布仅用了不到九周的时间。预训练于 2026 年 5 月 22 日在 4096 个 NVIDIA H200 GPU 上开始。这是 Poolside 首个在 FP8 精度下进行强化学习的模型。

Laguna S 2.1 在启用思考模式的 Terminal-Bench 2.1:https://poolside.ai/blog/introducing-laguna-s-2-1 上得分为 70.2%。这使其在 Poolside 汇总的排行榜上位列开源、公开大小模型第一,仅次于更大或封闭系统。在 SWE-Bench 多语言测试中得分为 78.5%,直接排名公开表首位。Poolside 发布的完整对比如下。

最明显的信号来自 DeepSWE v1.1,它仍有提升空间。在该测试中,Laguna S 2.1 得分为 40.4%,而 DeepSeek-V4-Pro-Max 为 9.0%,活跃参数约为其六分之一。封闭前沿模型如 Claude Fable 5 和 Kimi K3 在多个基准测试中仍然领先。Poolside 所宣称的是权重类别上的表现,而不是绝对第一。最终评估集的轨迹发布在 trajectories.poolside.ai:https://trajectories.poolside.ai/。

Laguna S 2.1 有两种模式:关闭和最大,默认启用最大模式。在最大模式下,模型会自行设置测试时的计算预算。目前 Poolside 还没有提供用户可配置的低/中/高努力控制。

最大思考模式将 Terminal-Bench 2.1 从 60.4% 提升到 70.2%。它将 DeepSWE 从 16.5% 提升到 40.4%。这些提升需要消耗代币:DeepSWE 在思考模式下运行大约需要 249k 完成代币,而非思考模式下为 99k。Poolside 团队报告称,模型能够在数小时和几十万个代币内进行连贯、高效的推理。

Poolside 团队分享了三个未编辑的轨迹,以展示模型行为而非评分。在其中一个案例中,模型从一个空文件夹构建了一个可工作的 HTML/CSS 浏览器引擎。该运行在一次 50 分钟的会话中使用了 181 步,没有人工干预,并且模型将其输出在无头 Chromium 上进行了验证。

在第二个案例中,模型优化了 Poolside 自己的代理工具。它使工具速度提升了 5.2%,内存分配减少了约 71%,用缓冲区替代了 O(n²) 字符串拼接。在第三个案例中,它在 Perl 环境下离线重新推导了 Erdős 问题 #397:https://www.erdosproblems.com/397,因为沙箱环境没有 Python,耗时 68 分钟。该结果是独立的再发现;GPT-5.2 Pro 在 2026 年 1 月解决了同一问题,而 Laguna 的知识截止日期是 2025 年 11 月。

模型尺寸使用了完整的 118B 参数,而不是 8B 活跃参数,因为每个专家都保持在内存中。在 4-bit(NVFP4 或 INT4)下,权重大约需要 59 GB,这可以轻松放入单个 DGX Spark 的 128 GB 统一内存中。在 FP8 下需要大约 118 GB,仍可放入单个 Spark 或单个 H200:https://www.nvidia.com/en-us/data-center/h200/。在 BF16 下需要大约 236 GB,这就需要两个互联的 Spark 或多 GPU 数据中心节点。

Poolside 与 NVIDIA 合作,将 TRT-LLM 服务的推理优化到 Blackwell 上的 NVFP4,甚至只需单台 DGX Spark。它在第一天就支持了 vLLM:https://github.com/vllm-project/vllm、SGLang:https://github.com/sgl-project/sglang 和 Ollama:https://ollama.com/。托管访问通过 OpenRouter 运行:https://openrouter.ai/poolside,免费提供 256K 上下文,付费提供完整 1M 上下文,费用为每 1M 输入/输出/缓存读取令牌 $0.10/$0.20/$0.01。该模型也可以在 Baseten:https://www.baseten.co/、Kilo:https://kilocode.ai/、Prime Intellect:https://www.primeintellect.ai/ Prime Lab 和 ZML:https://zml.ai/ 上使用。

来源:Poolside 技术文章—推出 Laguna S 2.1:https://poolside.ai/blog/introducing-laguna-s-2-1,Robert McHardy 在 X 上:https://x.com/robert_mchardy/status/2079614440295506171,Poolside 在 X 上:https://x.com/poolsideai/status/2079613777343848465 以及 Hugging Face 模型卡:https://huggingface.co/poolside/Laguna-S-2.1。

Poolside 发布 Laguna S 2.1:118B 开源智能体编程模型,SWE-Bench Multilingual 表现超越同尺寸模型

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而闻名,既技术扎实又易于广大读者理解。该平台每月浏览量超过 200 万,显示了其受欢迎程度。

Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

构建一个自主事件场地运营商 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队将很快与您联系 🙌

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Poolside 发布 Laguna S 2.1,一款 118B 参数的开放权重 MoE 编程模型,每 token 仅激活 8B 参数,支持 1M token 上下文。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-22T00:01:32.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Poolside 发布 Laguna S 2.1,一款 118B 参数的开放权重 MoE 编程模型,每 token 仅激活 8B 参数,支持 1M token 上下文。该模型在...

MarkTechPost(RSS)2026-07-22T00:01:32.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。