НовостиМакроНемецкий консорциум в области ИИ выпустил Soofi S — открытую модель 30B, лидирующую в бенчмарках на английском и немецком

Немецкий консорциум в области ИИ выпустил Soofi S — открытую модель 30B, лидирующую в бенчмарках на английском и немецком

Автор: The Decoder·

Ключевые выводы

  • Soofi S обучалась примерно на 27 трлн токенов и делает необычно сильный акцент на немецкоязычных данных, доля которых на втором этапе обучения достигла 15.3 процента.
  • Гибридная архитектура модели сохраняет почти неизменную пропускную способность в длинном контексте от 4,000 до 256,000 токенов и использует значительно меньше активных параметров, чем ее общий размер.
  • Консорциум обнаружил, что переформулированные тестовые вопросы GPQA попали в обучающий датасет из-за вводящих в заблуждение меток разбиений Hugging Face, после чего были введены новые автоматические проверки по тестовым вопросам.
  • По опубликованным совокупным результатам бенчмарков Soofi S лидирует среди полностью открытых моделей на английском и немецком языках, но уступает некоторым аналогам в немецкой олимпиадной математике, NaturalQuestions и задаче извлечения слов RULER.
  • Проект публикует веса, выбранные чекпойнты, код обучения и оценки, а также подробную инвентаризацию данных, отмечая, что около 99 процентов обучающей смеси можно независимо реконструировать.
Немецкий консорциум в области ИИ выпустил Soofi S — открытую модель 30B, лидирующую в бенчмарках на английском и немецком

Немецкий консорциум в области ИИ выпустил Soofi S — открытую модель 30B, лидирующую в бенчмарках на английском и немецком

Немецкий исследовательский консорциум под координацией KI Bundesverband (German AI Association) выпустил Soofi S 30B-A3B — открытую языковую модель, полностью обученную на Industrial AI Cloud Deutsche Telekom в Мюнхене. Согласно ее отчету о предобучении, модель показывает самые высокие результаты в английских и немецких бенчмарках среди полностью открытых моделей, превосходя прежних лидеров, включая OLMo 3 32B от Allen Institute for AI и Apertus 70B от ETH Zurich и EPFL.

Модель использует ресурсоэффективную гибридную архитектуру, которая активирует только 3.2 из 31.6 млрд параметров на каждый сгенерированный токен, сохраняя скорость обработки почти постоянной даже при очень длинных входных данных. Намеренный акцент на немецких обучающих данных — до 15.3 процента обучающей смеси на втором этапе — дает Soofi S сильное преимущество в задачах на немецком языке при сохранении конкурентоспособной производительности на английском. Такое сочетание закрывает повторяющийся пробел в европейских ИИ-проектах: сопоставимость с международными моделями с открытыми весами при достаточно подробном документировании методов обучения, инфраструктуры и источников данных для внешней проверки.

Инцидент с загрязнением данных раскрыт в обновленном отчете (July 24, 2026)

24 июля 2026 года консорциум опубликовал версию 3.0 своего отчета о предобучении и задокументировал инцидент с загрязнением данных, который сообщество обнаружило в публично раскрытых обучающих данных после первоначального релиза. Проблема затронула датасет QA-base, который должен был содержать только переформулированные обучающие разбиения из 25 стандартных бенчмарков — тренировочные вопросы, предназначенные для обучения модели форматам тестов, а не сами тестовые вопросы.

Однако датасет также включал переформулированные вопросы из тестового набора научного бенчмарка GPQA, включая вариант GPQA Diamond, как на английском, так и на машинно переведенном немецком. В отчете первопричина связывается со структурной особенностью GPQA на Hugging Face: у бенчмарка нет отдельного обучающего набора, а все тестовые материалы находятся под стандартной меткой "train." Поскольку конвейер данных выбирал контент по названиям разбиений, тестовый набор непреднамеренно оказался смешан с тренировочными вопросами.

Полный аудит, начатый после обнаружения, выявил еще три бенчмарка с той же схемой маркировки — TruthfulQA, BLiMP и Inverse Scaling, — хотя ни один из них не используется в оценке Soofi-S. В ответ консорциум полностью исключил GPQA из своего оценочного набора и пересчитал общие результаты для всех 16 сравниваемых моделей. По словам авторов, порядок в рейтинге остался неизменным.

Примечательно, что во время обучения проблему никто не заметил. Модель действительно стабильно улучшала результаты на затронутых задачах GPQA, поднявшись с 32.3 до 43.4 балла, но этот прирост находился в пределах нормального диапазона и не отличался от прогресса по другим тестам — резкого скачка, который мог бы послужить предупреждающим сигналом, не было. Теперь команда автоматически сверяет все обучающие данные с тестовыми вопросами, а не полагается на потенциально вводящие в заблуждение метки разбиений.

Участник проекта Nicolas Flores Herr из Fraunhofer IAIS назвал этот инцидент свидетельством того, что открытый подход работает, отметив, что сообщество смогло выявить проблему только потому, что данные были публично доступны. Команда предоставила для проверки около 152,000 отдельных результатов. Отдельная оценка, проведенная партнером консорциума Ellamind с использованием собственных намеренно закрытых тестовых данных, которые модель гарантированно не видела во время обучения, подтвердила результаты. Консорциум заявляет, что затронутая часть составляет лишь крошечную долю общего корпуса.

Дообученные варианты instruct и reasoning сейчас находятся в бета-тестировании и, как ожидается, будут выпущены под разрешительной лицензией в ближайшие недели. Более крупная модель Soofi L уже находится в обучении.

Ответ на обвинения в переобучении (July 15, 2026)

После запуска критики утверждали, что Soofi S была сильно "переобучена" по меркам классических законов масштабирования Chinchilla, опубликованных Google DeepMind в 2022 году. Эти законы описывают, как балансировать размер модели и объем обучающих данных при фиксированном вычислительном бюджете, определяя оптимум примерно в 20 токенов на параметр.

Soofi S существенно превышает это соотношение. При примерно 27 трлн токенов и 30 млрд параметров соотношение составляет несколько сотен к одному. Если учитывать только 3.2 млрд параметров, активных на токен, оно возрастает до нескольких тысяч к одному.

Michael Fromm, входящий в техническое руководство проекта, не согласился с этой критикой, заявив, что эти правила напрямую не переносятся на архитектуры Mixture-of-Experts (MoE). "There's new research showing that the old scaling laws from dense models no longer apply to MoE architectures," — сказал Fromm. Он пояснил, что отдельным экспертам полезно многократно видеть одни и те же документы, поэтому дублирование данных в большом высококачественном датасете представляет меньшую проблему, чем в случае плотных моделей. Для сравнения Fromm отметил, что Nvidia обучала собственные модели на объеме до 25 трлн токенов.

Компактная архитектура для длинных контекстов

Soofi S — это модель mixture-of-experts, содержащая в общей сложности 31.6 млрд параметров, но активирующая только около 3.2 млрд на каждый сгенерированный токен. Это делает ее вычислительную стоимость ближе к модели 3B, чем к традиционной модели 30B. Консорциум без изменений использовал архитектуру Nvidia Nemotron 3 Nano — гибридный дизайн, сочетающий слои Mamba-2 со стандартными слоями внимания.

Ключевое отличие от типичных трансформеров заключается в поведении памяти. В традиционных моделях KV cache, который хранит предыдущие токены для вычисления внимания, растет линейно с длиной контекста и становится узким местом при длинных входных данных и большом числе параллельных запросов. Только 6 из 52 слоев Soofi S вообще поддерживают такой кэш.

Практический эффект заметен в пропускной способности генерации. При длине контекста 40,000 токенов и 32 параллельных запросах Soofi S генерирует примерно в восемь раз больше токенов в секунду на GPU, чем плотные модели в диапазоне от 14 до 24 млрд параметров. В то время как у традиционных моделей пропускная способность значительно падает по мере роста контекста, у Soofi S она остается почти неизменной в диапазоне от 4,000 до 256,000 токенов. Единственная модель, демонстрирующая сходное поведение в измерениях, — это Qwen3.5 35B-A3B от Alibaba, которая также использует гибридную архитектуру.

Обучающая смесь с акцентом на немецкий язык

Консорциум обработал примерно 27 трлн токенов в три этапа. На первом этапе модель изучала языковые основы примерно на 20 трлн токенов из широкого набора веб-текстов, кода, математики и доменно-специфических материалов. Затем последовал второй этап примерно с 6 трлн токенов из более качественных источников, предназначенный для уточнения ранее усвоенных закономерностей. Более короткий третий этап расширил контекстное окно за счет обучения на очень длинных документах объемом до одного миллиона токенов.

Намеренный акцент на немецком языке является центральной частью дизайна. На первом этапе немецкий составляет 7.2 процента обучающей смеси; на втором этапе эта доля вырастает до 15.3 процента. Для сравнения: в эталонной рецептуре Nvidia Nemotron все неанглийские языки вместе составляют лишь около 5 процентов. Для немецкоязычных компаний и пользователей в государственном секторе такой баланс данных важен, поскольку многие технические, юридические, административные и сервисные процессы зависят от доменного языка, который недостаточно представлен в англоцентричных корпусах.

В качестве источников данных консорциум объединил немецкие веб-тексты из HPLT, открыто лицензированный корпус German Commons, немецкие части FinePDFs и FineWiki, а также коммерчески лицензированный корпус Genios, содержащий 193 млн газетных статей из 916 немецких изданий. Смесь дополнили машинно переведенные и синтетически сгенерированные немецкие тексты.

Результаты бенчмарков на немецком, английском и в коде

Согласно отчету, в оценках против 16 других открытых моделей Soofi S лидирует среди всех полностью открытых моделей по совокупным результатам как на немецком, так и на английском языке. По сравнению со всеми европейскими суверенными базовыми моделями она опережает конкурентов во всех немецких бенчмарках набора, иногда с двузначным отрывом.

В бенчмарках по коду Soofi S набирает 73.8 процента в HumanEval, 70.2 в MBPP и 84.2 в немецком варианте MBPP — лучшие результаты среди открытых аналогов. В INCLUDE-DE, тесте на региональные знания, специфичные для Германии, Soofi S делит первое место с более крупной Qwen3.5 35B-A3B, набрав 61.2 балла. По сравнению с базовой Nemotron немецкая рецептура данных улучшила языковую компетентность на 15.1 балла и результат в научном тесте GPQA-Diamond на 9.6 балла без ухудшения производительности на английском.

В некоторых областях Soofi S уступает конкурентам. В немецкой олимпиадной математике она набирает 56 баллов в Minerva MATH-DE, заметно отставая от Qwen3.5 35B-A3B (76.5) и Gemma 3 27B (65.6). Она также отстает в открытом фактическом поиске в NaturalQuestions, что, вероятно, связано с наличием лишь 3 млрд активных параметров, способных хранить меньше знаний о мире, чем плотная модель 27B.

Длинноконтекстный тест RULER выявил конкретную слабость: когда модель должна извлекать часто встречающиеся слова из длинного текста, доля попаданий Soofi S падает примерно до 3 процентов за пределами 32,000 токенов контекста, тогда как сопоставимая модель Nemotron все еще достигает 60–64 процентов. Авторы объясняют это тем, что их длинноконтекстные обучающие данные содержат много длинных документов, но не включают синтетические данные, специально предназначенные для задач извлечения. В остальных двенадцати задачах RULER обе модели показывают сопоставимые результаты.

Суверенная инфраструктура и документированная открытость

Обучение проходило с марта по май на мощности до 512 GPU Nvidia B200 в Industrial AI Cloud Deutsche Telekom в Мюнхене и в сумме составило примерно 253,000 GPU-часов. Согласно отчету, площадка полностью работает на возобновляемой энергии, охлаждается водой из канала Eisbach и передает отработанное тепло в окружающий район Tucherpark. Soofi S стала одним из первых крупных обучающих запусков на этой инфраструктуре.

За Soofi стоит консорциум немецких исследовательских организаций и компаний, координируемый German AI Association и финансируемый Федеральным министерством экономики и энергетики Германии в рамках европейской программы IPCEI-CIS. Среди участников — Fraunhofer Institutes IAIS and IIS, German Research Center for Artificial Intelligence (DFKI), TU Darmstadt, University of Würzburg, L3S Research Center, Berlin University of Applied Sciences, а также ИИ-компании Ellamind и Merantix Momentum. Цель проекта — создать открытую европейскую линейку ИИ-моделей, которая сможет работать на суверенной инфраструктуре и проходить испытания в промышленных приложениях.

Исследователи публикуют веса модели вместе с выбранными промежуточными чекпойнтами, полный код обучения и оценки, а также подробную инвентаризацию данных с указанием исходного числа токенов, номеров эпох и фактического вклада каждого источника. Источники, которые были рассмотрены, но исключены, также задокументированы. По словам команды, это означает, что Soofi S соответствует Open Source AI Definition 1.0 от Open Source Initiative.

Более строгому предложению по европейскому определению открытых данных, которое потребовало бы свободного распространения каждого обучающего токена, модель не соответствует из-за доли данных Genios в 1.3 процента, имеющих коммерческую лицензию. В отчете говорится, что примерно 99 процентов обучающей смеси можно независимо реконструировать. Точная лицензия релиза модели пока не финализирована.

Как пишет технический руководитель Michael Fromm, Soofi S занимает позицию между широко многоязычными европейскими проектами суверенности, такими как EuroLLM или Teuken, которые охватывают много языков, и наиболее производительными международными моделями с открытыми весами. Согласно сайту проекта, консорциум ищет отраслевых партнеров для следующего этапа, чтобы тестировать модель в приложениях, связанных с техническими документами, генерацией кода и агентными системами.