德國AI聯盟發布Soofi S:在英語與德語基準測試中均居首的開源30B模型
重點速覽
- •Soofi S在約27萬億個token上進行訓練,對德語資料的重視程度異常突出,第二階段德語佔訓練組合的15.3%。
- •該模型的混合架構使長上下文吞吐量從4,000到256,000個token幾乎保持平穩,且使用的啟用參數遠少於其總規模。
- •聯盟發現因Hugging Face分割標籤的誤導,GPQA測試題目的改寫版本被混入訓練資料集,促使團隊建立針對測試題目的自動交叉檢查機制。
- •Soofi S在報告的英文和德文綜合基準測試結果中領先所有完全開源模型,但在德語競賽數學、NaturalQuestions和一項RULER詞彙提取任務上落後部分同儕。
- •該專案正在發布模型權重、選定檢查點、訓練與評測程式碼以及詳細的資料清單,同時指出約99%的訓練組合可獨立重建。

德國AI聯盟發布Soofi S:在英語與德語基準測試中均居首的開源30B模型
由KI Bundesverband(德國AI協會)協調的德國研究聯盟,發布了Soofi S 30B-A3B——一款完全在德國電信慕尼黑工業AI雲端上訓練的開源語言模型。根據其預訓練報告,該模型在完全開源模型中,於英文和德文基準測試均取得最高分,超越了此前的領先者,包括艾倫AI研究院的OLMo 3 32B以及蘇黎世聯邦理工學院與洛桑聯邦理工學院的Apertus 70B。
該模型採用資源高效的混合架構,每生成一個token僅啟用其31.6億參數中的約3.2億,即使輸入非常長的文字,處理速度也幾乎保持不變。刻意側重德語訓練資料——在第二階段佔訓練混合比例高達15.3%——讓Soofi S在德語任務中具備顯著優勢,同時維持具競爭力的英文表現。這樣的組合填補了歐洲AI專案中一個長期存在的缺口:既要達到國際開放權重模型的效能水準,又要將訓練方法、基礎設施和資料來源記錄得足夠詳細,以接受外部審查。
更新報告揭露資料污染事件(2026年7月24日)
2026年7月24日,聯盟發布了預訓練報告的第3.0版,記錄了一起資料污染事件——該問題是社群在初始發布後,於公開披露的訓練資料中發現的。問題出現在QA-base資料集中,該資料集原本應僅包含來自25個標準基準測試的改寫訓練分割——即設計用來讓模型學習測試格式的練習題,而非實際的測試題目。
然而,該資料集也包含了科學基準測試GPQA測試集中改寫後的題目,包括GPQA Diamond變體,涵蓋英文和機器翻譯的德文版本。報告將根本原因追溯到GPQA在Hugging Face上的一個結構性特殊問題:該基準測試沒有獨立的訓練集,所有測試資料都置於預設標籤「train」之下。由於資料管線是根據分割名稱來選取內容,測試集因此被意外混入練習題中。
該發現觸發的全面審計又發現了三個具有相同標記模式的基準測試——TruthfulQA、BLiMP和Inverse Scaling——但這些均未用於Soofi-S的評測。作為回應,聯盟將GPQA從評測套件中完全移除,並重新計算所有16個比較模型的整體結果。據作者表示,排名順序保持不變。
值得注意的是,在訓練過程中沒有人發現這個問題。模型在受影響的GPQA任務上確實穩步提升,從32.3分上升至43.4分,但該增幅落在正常範圍內,與其他測試的進展無異——沒有出現任何可作為警示訊號的突然飆升。今後,團隊改為自動將所有訓練資料與測試題目進行交叉比對,而非依賴可能具有誤導性的分割標籤。
來自弗勞恩霍夫IAIS的專案參與者Nicolas Flores Herr指出,該事件證明了開放方法的有效性,並表示正因為資料是公開的,社群才能發現這個問題。團隊已提供約152,000個個別結果供驗證。聯盟合作夥伴Ellamind使用其刻意保留的測試資料(保證模型在訓練期間從未見過這些資料)進行了獨立評測,結果予以證實。聯盟表示,受影響的部分僅佔整個語料庫的極小比例。
微調後的指令版和推理版目前正在測試階段,預計將在未來數週內以寬鬆授權發布。更大的Soofi L模型已在訓練中。
對過度訓練質疑的回應(2026年7月15日)
發布後,有批評者認為按照經典的Chinchilla縮放定律標準,Soofi S被嚴重「過度訓練」。Google DeepMind於2022年發表了該定律,描述如何在固定運算預算下平衡模型大小與訓練資料,並找出約每個參數20個token的最佳比例。
Soofi S遠超該比例。以約27萬億個token和300億參數計算,比例達到數百比一。若僅計算每個token啟用的3.2億參數,比例更飆升至數千比一。
專案技術領導團隊成員Michael Fromm反駁了這一批評,認為這些規則不能直接套用於混合專家(MoE)架構。「有新的研究表明,密集模型的舊縮放定律已不再適用於MoE架構,」Fromm表示。他解釋道,個別專家受益於重複看到相同文件,因此在大型高品質資料集中,重複資料造成的問題比在密集模型中小得多。作為比較,Fromm指出Nvidia訓練其自身模型時使用了高達25萬億個token。
為長上下文打造的精簡架構
Soofi S是一個混合專家模型,總共包含31.6億參數,但每生成一個token僅啟用約3.2億參數。這使其運算成本更接近3B模型,而非傳統的30B模型。聯盟未經修改地採用了Nvidia Nemotron 3 Nano的架構——這是一種結合Mamba-2層與標準注意力層的混合設計。
與典型Transformer的關鍵差異在於記憶體行為。在傳統模型中,儲存先前token以供注意力計算的KV快取,會隨上下文長度線性增長,在長輸入和大量平行請求下成為瓶頸。Soofi S的52層中,只有6層需要維護此類快取。
實際效益體現在生成吞吐量上。在40,000個token的上下文長度下,配合32個平行請求,Soofi S每秒每GPU生成的token數量大約是140億至240億參數範圍密集模型的八倍。隨著上下文增長,傳統模型的吞吐量顯著下降,但Soofi S從4,000到256,000個token幾乎保持平穩。在測量中唯一表現出類似行為的模型是阿里巴巴的Qwen3.5 35B-A3B,它同樣採用混合架構。
以德語為核心的訓練組合
聯盟在三個階段中處理了約27萬億個token。第一階段,模型從約20萬億個token中學習語言基礎,這些token來自廣泛的網頁、程式碼、數學和特定領域文本。第二階段接著使用約6萬億個來自更高品質來源的token,旨在強化先前學到的模式。第三個較短的階段則透過在長達100萬個token的超長文件上訓練,來延伸上下文視窗。
對德語的刻意強調是設計的核心。第一階段,德語佔訓練組合的7.2%;第二階段,該比例上升至15.3%。作為對比,在Nvidia的Nemotron參考配方中,所有非英語語言合計僅佔約5%。對於德語區企業和公共部門使用者而言,這種資料平衡至關重要,因為許多技術、法律、行政和客服工作流程依賴的領域語言,在以英語為中心的語料庫中代表性不足。
在資料來源方面,聯盟結合了來自HPLT的德語網頁文本、開放授權的German Commons語料庫、FinePDFs和FineWiki的德語部分,以及包含來自916家德國出版物的1.93億篇報紙文章的商業授權Genios語料庫。機器翻譯和合成生成的德語文本則補充了其餘部分。
德語、英語與程式碼的基準測試結果
在與其他16個開源模型的評測中,Soofi S在德語和英語的綜合得分上均領先所有完全開源模型。對抗所有歐洲主權基準線,該模型在套件中所有德語基準測試上均勝出,有時差距達到兩位數。
在程式碼基準測試中,Soofi S在HumanEval上得分73.8%,在MBPP上得分70.2%,在德語版MBPP變體上得分84.2%——為開源同儕中的最佳結果。在INCLUDE-DE(一項測試德國特定區域知識的測驗)上,Soofi S以61.2分與更大的Qwen3.5 35B-A3B並列第一。與Nemotron基準線相比,德語資料配方將語言能力提升了15.1分,科學測試GPQA-Diamond提升了9.6分,且未犧牲英文表現。
Soofi S在某些領域表現較弱。在德語競賽數學方面,它在Minerva MATH-DE上得分56分,遠落後於Qwen3.5 35B-A3B(76.5)和Gemma 3 27B(65.6)。在NaturalQuestions的開放式事實檢索方面也較為落後,這可能與僅有30億啟用參數有關——相較於密集的27B模型,能儲存的世界知識較少。
RULER長上下文測試揭示了一個特定弱點:當模型需要從長文本中提取頻繁出現的詞彙時,Soofi S在超過32,000個token上下文後的命中率降至約3%,而可比較的Nemotron模型仍能維持60%至64%。作者將此歸因於其長上下文訓練資料雖然包含許多長文件,但缺乏專為提取任務設計的合成資料。在其餘十二項RULER任務中,兩個模型的表現相當。
主權基礎設施與透明的開放性
訓練於3月至5月間進行,在德國電信慕尼黑工業AI雲端上使用了最多512個Nvidia B200 GPU,總計約253,000個GPU小時。根據報告,該設施完全使用再生能源運作,以Eisbach運河的水進行冷卻,並將廢熱回饋至周邊的Tucherpark社區。Soofi S是該基礎設施上最早的主要訓練任務之一。
Soofi背後的聯盟由德國研究機構和企業組成,由德國AI協會協調,並由德國聯邦經濟和能源部作為歐洲IPCEI-CIS計畫的一部分提供資金。參與者包括弗勞恩霍夫IAIS和IIS研究所、德國人工智慧研究中心(DFKI)、達姆施塔特工業大學、維爾茨堡大學、L3S研究中心、柏林應用科技大學,以及AI公司Ellamind和Merantix Momentum。該專案的目標是建立一個能夠在主權基礎設施上運行、並可在工業應用中測試的開放歐洲AI模型家族。
研究人員正在發布模型權重及選定的中間檢查點、完整的訓練和評測程式碼,以及一份詳細的資料清單,列出各來源的原始token數量、訓練輪次和有效貢獻。經過審查但被排除的來源也已記錄在案。據團隊表示,這意味著Soofi S符合開源倡議組織(OSI)的開源AI定義1.0。
一項更嚴格的歐洲開放資料定義提案——要求每一個訓練token都必須可自由分發——則未能達成,原因是Genios資料佔比1.3%,帶有商業授權。報告指出,約99%的訓練組合可以獨立重建。模型發布的確切授權尚未最終確定。
正如技術負責人Michael Fromm所述,Soofi S定位於覆蓋多種語言的廣泛多語言歐洲主權專案(如EuroLLM或Teuken)與效能最高的國際開放權重模型之間。根據專案網站,聯盟正在尋找產業合作夥伴,以在下一階段測試該模型在涉及技術文件、程式碼生成和代理人系統等應用中的表現。