Aioga
AI资讯 / 模型更新
返回 AI资讯

德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-16T21:28:29.737Z热度 57

德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的Mo...

模型更新Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。

该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。 模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。 在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。 在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。 上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。 模型权重已开源。

中文正文 · AI 翻译

Soofi S是首批完全在慕尼黑德国电信工业人工智能云上训练的大型语言模型之一。OPEN 30B模型采用精益混合架构和故意向德国加权的训练组合。

Soofi S是一个专家混合模型。它总共包含316亿个参数,但每个生成的代币仅激活约32亿个。这使得它的计算成本比传统的30B模型更接近3B模型。 联合体采用英伟达Nemotron 3 Nano架构: https://the-decoder.com/nvidias-nemotron-3-ultra-becomes-the-smartest-open-us-model-but-china-still-leads/未经修改,采用Mamba-2层与标准关注层相结合的混合设计。广告

与典型变压器的关键区别在于记忆行为。在传统模型中,存储用于注意力计算的先前令牌的KV缓存随上下文长度线性增长。对于长输入和许多并行请求,重新加载缓存成为瓶颈。Soofi S的52层中只有6层保留了这样的缓存。广告DEC_D_Incontent-1

实际回报体现在发电吞吐量上。Soofi S的上下文长度为40,000个令牌, 32个并行请求,每个GPU每秒生成的令牌大约是140亿到240亿个参数范围内密集模型的8倍。虽然随着环境的增长,传统模型的吞吐量显着下降,但Soofi S的吞吐量几乎保持不变,从4,000个代币降至256,000个代币。 在测量中显示类似行为的唯一模型是阿里巴巴的Qwen3.5 35B-A3B: https://the-decoder.com/alibabas-open-qwen-3-5-takes-aim-at-gpt-5-mini-and-claude-sonnet-4-5-at-a-fraction-of-the-cost/,它也使用混合架构。

该联盟总共处理了大约27万亿个代币,分为三个阶段。在第一阶段,该模型从大约20万亿个令牌中学习语言基础知识,这些令牌来自网络、代码、数学和特定领域的广泛混合文本。第二阶段接下来是来自更高质量来源的大约6万亿个代币,旨在锐化之前学习的模式。 然后,较短的第三阶段通过对多达一百万个令牌的非常长的文档进行培训来扩展上下文窗口。广告

Flow chart showing the training data mix across three phases. Seven categories including English Web, Code, Reasoning, Math, and German shift from Phase 1 (about 23T tokens) through Phase 2 (about 6T) to Phase 3 (about 188B), with the German share rising from 7.2 to 15.3 percent.

对德语的刻意关注是核心。在第一阶段,德语占培训组合的7.2%;在第二阶段,这一比例上升至15.3%。在Nvidia的Nemotron参考配方中,所有非英语语言合计仅占约5%。

对于数据源,该联盟结合了来自HPLT的德语Web文本、公开许可的德国公共语料库、FinePDF和FineWiki的德语部分以及商业许可的Genios语料库,其中包含来自916家德国出版物的1.93亿篇报纸文章。机器翻译和合成生成的德语文本完美融合。广告DEC_D_Incontent-2

根据该报告,在对其他16个开放模型的评估中, Soofi S在德语和英语的总分上领先于所有完全开放的模型。其中包括来自艾伦人工智能研究所的OLMo 3 32B和来自苏黎世联邦理工学院和EPFL的Apertus 70B。相对于每个欧洲主权基准,该模型在套件中的所有德国基准上都领先,有时以两位数的利润率领先。广告

在代码基准测试中, Soofi S在HumanEval上的得分为73.8%,在MBPP上的得分为70.2,在德国MBPP变体上的得分为84.2,这是开源同行中最好的结果。在针对德国特定区域知识的INCLUDE-DE测试中, Soofi S以61.2分与较大的Qwen3.5 35B-A3B并列第一。 与Nemotron基线相比,德国数据配方将语言熟练度提高了15.1分,科学测试GPQA-Diamond提高了9.6分,而不会牺牲英语表现。

Soofi S在德国竞争数学方面表现不佳,在Minerva MATH-DE上得分56分,远远落后于Qwen3.5 35B-A3B ( 76.5 )和Gemma 3 27B: https://the-decoder.com/google-releases-new-gemma-3-open-model-family/ ( 65.6 )。它在NaturalQuestions中的开放式事实检索方面也滞后。 后者可能与只有30亿个活动参数有关,与密集的27B模型相比,它可以存储更少的世界知识: https://the-decoder.com/sinas-open-model-vibethinker-3b-aims-to-show-reasoning-compresses-well-but-factual-knowledge-doesnt/。

标尺长上下文测试还揭示了一个特定的弱点:当模型必须从长文本中提取频繁出现的单词时, Soofi S的命中率在32,000个上下文令牌之外下降到约3 %,而可比较的Nemotron模型仍然管理着60 %至64 %。 作者将此归因于他们的长上下文训练数据包含许多长文档,但缺乏专为提取任务设计的合成数据。在其余的十二个标尺任务中,两个模型的执行情况大致相同。

培训于3月至5月期间在德国电信位于慕尼黑的工业AI云( https://the-decoder.com/10000-nvidia-blackwell-gpus-set-to-increase-germanys-ai-capacity-by-50-percent/ )上使用多达512个Nvidia B200 GPU进行,总计约253,000个GPU小时。 根据该报告,该设施完全依靠可再生能源运行,用Eisbach运河的水冷却,并向周围的Tucherpark社区供给废热。Soofi S是这一基础设施的首批主要培训项目之一。

Soofi背后是一个由德国研究机构和公司组成的联盟,由德国人工智能协会协调,由德国联邦经济事务和能源部资助,作为欧洲IPCEI-CIS计划的一部分。

参与者包括弗劳恩霍夫研究所IAIS和IIS、德国人工智能研究中心( DFKI )、达姆施塔特工业大学、维尔茨堡大学、L3S研究中心、柏林应用科学大学以及人工智能公司Ellamind和Merantix Momentum。该项目的目标是建立一个开放的欧洲人工智能模型家族,可以在主权基础设施上运行,并在工业应用中进行测试。

研究人员正在发布模型权重以及选定的中间检查点: https://huggingface.co/collections/Soofi-Project/soofi-s-beta-models、完整的训练和评估代码以及详细的数据清单,其中列出了原始令牌计数、纪元编号和每个来源的有效贡献。还记录了已审核但排除的来源。 根据该团队的说法,这意味着Soofi S符合开源倡议( Open Source Initiative )的开源AI定义1.0: https://the-decoder.com/open-source-initiative-releases-first-formal-definition-of-open-source-ai/。

一项更严格的欧洲开放数据定义提案要求每一个培训令牌都是可自由分发的,但由于Genios数据的1.3%份额(带有商业许可证)而没有得到满足。报告称,大约99%的训练组合可以独立重建。该模型发布的确切许可证尚未最终确定。

正如主要作者Michael Fromm所写: https://x.com/effi288/status/2075904321707798699, Soofi S将自己定位在广泛的多语言欧洲主权项目之间,如EuroLLM或Teuken: https://the-decoder.com/eu-project-releases-7b-model-that-speaks-24-european-languages/,涵盖多种语言,以及性能最高的国际开放权重模型。 根据该项目网站,该联盟正在寻找下一阶段的行业合作伙伴,以便在涉及技术文档、代码生成和基于代理的系统的应用程序中测试该模型。

随时掌握人工智能的最新动态。清晰、实用、无绒毛。

关注解码器,了解AI新闻、背景故事和专家分析。

解码器: https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:德国AI协会协调的研究联盟发布开源大语言模型Soofi S,总参数316亿,每token仅激活约32亿参数。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: the-decoder.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-16T21:28:29.737Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的Mo...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-16T21:28:29.737Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。