德国AI联盟发布Soofi S:30B开源模型在英语和德语基准测试中双双登顶
要点速览
- •Soofi S训练使用了约27万亿个token,并异常重视德语数据,德语在第二阶段训练混合物中占比达15.3%。
- •该模型的混合架构使长上下文吞吐量在4,000至256,000 token范围内几乎保持平稳,活跃参数远少于总参数量。
- •联盟发现改写的GPQA测试题因Hugging Face具有误导性的拆分标签而进入了训练数据集,由此引发了针对测试题目的新自动核查机制。
- •Soofi S在报告的综合英语和德语基准测试结果中领先于所有完全开源模型,但在德国竞赛数学、NaturalQuestions和RULER单词提取任务上落后于部分同类模型。
- •该项目正在发布模型权重、部分检查点、训练和评估代码以及详细的数据清单,并指出约99%的训练混合物可被独立重建。

德国AI联盟发布Soofi S:30B开源模型在英语和德语基准测试中双双登顶
由德国AI联邦协会(KI Bundesverband,即德国人工智能协会)协调的德国研究联盟发布了Soofi S 30B-A3B,这是一个完全在慕尼黑德国电信工业AI云上训练的开源语言模型。根据其预训练报告,该模型在完全开源模型中,英语和德语基准测试均取得了最高分,超越了此前的领先者——来自艾伦人工智能研究所的OLMo 3 32B和来自苏黎世联邦理工学院及洛桑联邦理工学院的Apertus 70B。
该模型采用资源高效的混合架构,在316亿总参数中每个生成token仅激活约32亿参数,即使在输入非常长的情况下也能保持处理速度几乎恒定。对德语训练数据的有意侧重——在第二阶段训练混合物中德语占比高达15.3%——使Soofi S在德语任务中具有显著优势,同时保持有竞争力的英语表现。这种组合解决了欧洲AI项目中一个反复出现的难题:在匹配国际开源权重模型性能的同时,将训练方法、基础设施和数据源的文档化程度提高到足以供外部审查的水平。
更新报告中披露的数据污染事件(2026年7月24日)
2026年7月24日,联盟发布了其预训练报告的3.0版本,并记录了一起数据污染事件,该事件由社区在公开发布后在公开披露的训练数据中发现。问题出在QA-base数据集上,该数据集原本应仅包含来自25个标准基准测试的改写训练集拆分——这些是旨在教会模型测试格式的练习题,而非实际的测试题目。
然而,该数据集还包含了来自科学基准测试GPQA测试集的改写问题,包括GPQA Diamond变体,涵盖英语和机器翻译的德语版本。报告将根本原因追溯到GPQA在Hugging Face上的一个结构性特点:该基准测试没有单独的训练集,所有测试材料都位于默认标签"train"下。由于数据管道根据拆分名称选择内容,测试集无意中被混入了练习题中。
该发现触发的一次全面审查还发现了三个具有相同标签模式的基准测试——TruthfulQA、BLiMP和Inverse Scaling——尽管这些都没有用于Soofi-S的评测。作为回应,联盟将GPQA从评测套件中完全移除,并重新计算了所有16个对比模型的整体结果。据作者称,排名顺序保持不变。
值得注意的是,在训练过程中没有人发现这个问题。模型在受影响的GPQA任务上确实有稳步提升,从32.3分上升到43.4分,但这一增幅处于正常范围内,与其他测试上的进展无异——没有出现可作为警示信号的突然跃升。今后,团队现在会自动将所有训练数据与测试题目进行交叉核对,而不是依赖可能具有误导性的拆分标签。
来自弗劳恩霍夫IAIS的项目参与者Nicolas Flores Herr将该事件视为开源方法有效性的证据,他指出,正是因为数据是公开的,社区才能发现这个问题。团队已提供约152,000个单独结果供验证。联盟合作伙伴Ellamind使用其自己刻意保留的测试数据(确保模型在训练中未曾见过)进行了独立评估,确认了结果的可靠性。联盟表示,受影响的部分仅占整个语料库的极小比例。
微调版instruct和reasoning变体目前处于测试阶段,预计将在未来几周内以宽松许可证发布。更大的Soofi L模型已在训练中。
对过度训练质疑的回应(2026年7月15日)
发布后,批评者认为按照经典Chinchilla缩放定律的标准,Soofi S被严重"过度训练"了。该定律由Google DeepMind于2022年发布,描述了如何在固定计算预算下平衡模型大小和训练数据,确定的最佳比例大约是每个参数20个token。
Soofi S远超这一比例。约27万亿token配合300亿参数,比率达到数百比一。若仅按每个token激活的32亿参数计算,比率更跳升至数千比一。
项目技术领导团队成员Michael Fromm对这一批评进行了反驳,认为这些规则不能直接套用到混合专家架构上。"有新的研究表明,来自密集模型的旧缩放定律不再适用于MoE架构,"Fromm说。他解释道,单个专家从重复阅读相同文档中获益,因此在大型高质量数据集中的重复数据所造成的问题远小于密集模型。作为对比,Fromm指出Nvidia用自己的模型训练了多达25万亿个token。
为长上下文构建的精简架构
Soofi S是一个混合专家模型,总共包含316亿参数,但每个生成token仅激活约32亿参数。这使得其计算成本更接近于一个3B模型而非传统的30B模型。联盟未经修改地采用了Nvidia Nemotron 3 Nano的架构——这是一种将Mamba-2层与标准注意力层相结合的混合设计。
与传统Transformer的关键区别在于内存行为。在传统模型中,用于注意力计算、存储先前token的KV缓存随上下文长度线性增长,在长输入和大量并行请求下成为瓶颈。Soofi S的52层中仅有6层需要维护这样的缓存。
实际收益在生成吞吐量上体现明显。在40,000 token的上下文长度下处理32个并行请求时,Soofi S每GPU每秒生成的token数量大约是140亿至240亿参数范围内密集模型的八倍。虽然传统模型的吞吐量随上下文增长而大幅下降,Soofi S在4,000到256,000 token范围内几乎保持平稳。在测量中唯一表现类似的是阿里巴巴的Qwen3.5 35B-A3B,它同样采用混合架构。
以德语为核心的训练组合
联盟在三个阶段中共处理了约27万亿个token。在第一阶段,模型从约20万亿个token中学习语言基础,这些token来自涵盖网页、代码、数学和领域特定文本的广泛组合。第二阶段使用约6万亿个来自更高质量来源的token,旨在强化之前学到的模式。较短的第三阶段通过训练长达一百万token的极长文档来扩展上下文窗口。
对德语的有意强调是设计的核心。在第一阶段,德语占训练混合物的7.2%;在第二阶段,这一比例上升至15.3%。作为对比,在Nvidia的Nemotron参考配方中,所有非英语语言合计仅占约5%。对于德语地区的企业和公共部门用户而言,这种数据平衡具有实际意义,因为许多技术、法律、行政和客户服务工作流依赖于以英语为中心的语料库所不能充分覆盖的领域语言。
在数据来源方面,联盟结合了来自HPLT的德语网页文本、开源许可的German Commons语料库、FinePDFs和FineWiki的德语部分,以及包含来自916家德国出版物的1.93亿篇报纸文章的商业授权Genios语料库。机器翻译和合成的德语文本构成了其余部分。
德语、英语和代码基准测试结果
在与另外16个开源模型的评测中,据报告显示,Soofi S在德语和英语的综合得分上均领先于所有完全开源模型。在与所有欧洲主权基准的对比中,该模型在套件中所有德语基准测试上都名列前茅,有时优势达到两位数。
在代码基准测试中,Soofi S在HumanEval上得分73.8%,在MBPP上得分70.2%,在德语版MBPP变体上得分84.2%——这是开源同类模型中的最佳成绩。在INCLUDE-DE(一项测试德国特定区域知识的测试)上,Soofi S以61.2分与更大的Qwen3.5 35B-A3B并列第一。与Nemotron基线相比,德语数据配方将语言能力提升了15.1分,科学测试GPQA-Diamond提升了9.6分,且没有牺牲英语性能。
Soofi S在某些领域表现欠佳。在德国竞赛数学方面,它在Minerva MATH-DE上得分56分,远落后于Qwen3.5 35B-A3B(76.5分)和Gemma 3 27B(65.6分)。它在NaturalQuestions的开放事实检索方面也较为落后,这可能与仅有30亿活跃参数有关,活跃参数能存储的世界知识少于一个密集的27B模型。
RULER长上下文测试揭示了一个具体弱点:当模型需要从长文本中提取频繁出现的单词时,Soofi S在超过32,000 token上下文后的命中率降至约3%,而可比较的Nemotron模型仍能达到60%至64%。作者将此归因于他们的长上下文训练数据包含大量长文档,但缺乏专为提取任务设计的合成数据。在其余十二项RULER任务中,两个模型表现相当。
主权基础设施与文档化开放性
训练运行于3月至5月期间进行,在慕尼黑德国电信的工业AI云上使用了多达512块Nvidia B200 GPU,总计约253,000个GPU小时。据报告称,该设施完全使用可再生能源,用Eisbach运河的水进行冷却,并将废热输入周边的Tucherpark社区。Soofi S是该项基础设施上首批重大训练运行之一。
Soofi背后的联盟由德国研究机构和企业组成,由德国人工智能协会协调,并作为欧洲IPCEI-CIS计划的一部分获得德国联邦经济事务和能源部的资助。参与者包括弗劳恩霍夫IAIS和IIS研究所、德国人工智能研究中心(DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3S研究中心、柏林应用科学大学,以及AI企业Ellamind和Merantix Momentum。该项目的目标是构建一个可在主权基础设施上运行并在工业应用中进行测试的开放式欧洲AI模型家族。
研究人员正在发布模型权重及部分中间检查点、完整的训练和评估代码,以及详细的数据清单,列出每个来源的原始token数、训练轮数和实际贡献。经过审查但被排除的数据源也有记录。据团队称,这意味着Soofi S符合开源倡议组织的开源AI定义1.0。
一项更严格的欧洲开放数据定义提案要求每一个训练token都可自由分发,由于Genios数据占1.3%的份额且带有商业许可证,该提案未能满足。报告指出,约99%的训练混合物可以被独立重建。模型发布的确切许可证尚未最终确定。
正如技术负责人Michael Fromm所写,Soofi S的定位介于覆盖多种语言的广泛多语言欧洲主权项目(如EuroLLM或Teuken)与性能最高的国际开源权重模型之间。据项目网站称,联盟正在为下一阶段寻找行业合作伙伴,以在涉及技术文档、代码生成和智能体系统的应用中测试该模型。