NoticiasMacroConsorcio alemán de IA lanza Soofi S, un modelo abierto de 30B que lidera los benchmarks en inglés y alemán

Consorcio alemán de IA lanza Soofi S, un modelo abierto de 30B que lidera los benchmarks en inglés y alemán

Autor: The Decoder·

Puntos clave

  • Soofi S fue entrenado con aproximadamente 27 billones de tokens y otorga un énfasis inusual a los datos en idioma alemán, que alcanzaron el 15.3 por ciento de la mezcla de entrenamiento en su segunda fase.
  • La arquitectura híbrida del modelo mantiene el rendimiento de contexto largo casi plano de 4,000 a 256,000 tokens y utiliza muchos menos parámetros activos que su tamaño total.
  • El consorcio descubrió que preguntas reformuladas de las pruebas de GPQA habían ingresado a un conjunto de datos de entrenamiento debido a etiquetas engañosas de los fragmentos de Hugging Face, lo que provocó nuevas verificaciones automáticas contra las preguntas de prueba.
  • Soofi S lidera los modelos totalmente abiertos en los resultados agregados reportados de benchmarks en inglés y alemán, pero queda por detrás de algunos competidores en matemáticas de competición en alemán, NaturalQuestions y una tarea de extracción de palabras de RULER.
  • El proyecto está publicando los pesos, puntos de control seleccionados, el código de entrenamiento y evaluación, y un inventario de datos detallado, al tiempo que señala que aproximadamente el 99 por ciento de la mezcla de entrenamiento puede reconstruirse de forma independiente.
Consorcio alemán de IA lanza Soofi S, un modelo abierto de 30B que lidera los benchmarks en inglés y alemán

Consorcio alemán de IA lanza Soofi S, un modelo abierto de 30B que lidera los benchmarks en inglés y alemán

Un consorcio de investigación alemán coordinado por el KI Bundesverband (Asociación Alemana de IA) ha lanzado Soofi S 30B-A3B, un modelo de lenguaje de código abierto entrenado íntegramente en la nube de IA Industrial de Deutsche Telekom en Múnich. Según su informe de preentrenamiento, el modelo obtiene las puntuaciones más altas en benchmarks de inglés y alemán entre los modelos totalmente abiertos, superando a los anteriores líderes, incluidos OLMo 3 32B del Allen Institute for AI y Apertus 70B de ETH Zúrich y EPFL.

El modelo utiliza una arquitectura híbrida eficiente en recursos que activa solo 3.2 de sus 31.6 mil millones de parámetros por token generado, manteniendo la velocidad de procesamiento casi constante incluso con entradas muy largas. Un enfoque deliberado en los datos de entrenamiento en alemán, que representan hasta el 15.3 por ciento de la mezcla de entrenamiento en su segunda fase, le otorga a Soofi S una fuerte ventaja en tareas en idioma alemán mientras mantiene un rendimiento competitivo en inglés. Esa combinación aborda una brecha recurrente en los proyectos europeos de IA: igualar el rendimiento de los modelos internacionales de pesos abiertos mientras se documentan los métodos de entrenamiento, la infraestructura y las fuentes de datos con el suficiente detalle para un escrutinio externo.

Incidente de contaminación revelado en informe actualizado (24 de julio de 2026)

El 24 de julio de 2026, el consorcio publicó la versión 3.0 de su informe de preentrenamiento y documentó un incidente de contaminación de datos que la comunidad descubrió en los datos de entrenamiento divulgados públicamente tras el lanzamiento inicial. El problema afectó al conjunto de datos QA-base, que debía contener únicamente fragmentos de entrenamiento reformulados de 25 benchmarks estándar: preguntas de práctica diseñadas para enseñar al modelo los formatos de examen, no las preguntas reales del examen.

Sin embargo, el conjunto de datos también incluía preguntas reformuladas del conjunto de prueba del benchmark científico GPQA, incluida la variante GPQA Diamond, tanto en inglés como en alemán traducido automáticamente. El informe rastrea la causa raíz a una particularidad estructural de GPQA en Hugging Face: el benchmark no tiene un conjunto de entrenamiento separado y todo su material de prueba aparece bajo la etiqueta predeterminada "train". Dado que el proceso de selección de datos se basaba en estos nombres de fragmentos, el conjunto de pruebas se mezcló inadvertidamente con las preguntas de práctica.

Una auditoría completa desencadenada por el descubrimiento reveló tres benchmarks adicionales con el mismo patrón de etiquetado: TruthfulQA, BLiMP e Inverse Scaling, aunque ninguno de ellos se utiliza en la evaluación de Soofi-S. En respuesta, el consorcio eliminó GPQA por completo de su suite de evaluación y recalculó los resultados generales de los 16 modelos comparados. Según los autores, el orden de clasificación no cambió.

Cabe destacar que nadie detectó el problema durante el entrenamiento. El modelo sí mejoró de manera constante en las tareas de GPQA afectadas, subiendo de 32.3 a 43.4 puntos, pero esa ganancia se encontraba dentro del rango normal y era indistinguible del progreso en otras pruebas; no hubo ningún pico repentino que sirviera como señal de alerta. De ahora en adelante, el equipo verifica automáticamente todos los datos de entrenamiento contra las preguntas de prueba en lugar de depender de etiquetas de fragmentos potencialmente engañosas.

El participante del proyecto Nicolas Flores Herr, de Fraunhofer IAIS, señaló el incidente como evidencia de que el enfoque abierto funciona, destacando que la comunidad solo pudo haber identificado el problema porque los datos estaban disponibles públicamente. El equipo ha puesto a disposición aproximadamente 152,000 resultados individuales para verificación. Una evaluación separada realizada por el socio del consorcio Ellamind, utilizando sus propios datos de prueba retenidos deliberadamente que se garantizaba que el modelo no había encontrado durante el entrenamiento, confirmó los resultados. El consorcio afirma que la porción afectada representa solo una fracción minúscula del corpus total.

Las variantes ajustadas de instrucción y razonamiento se encuentran actualmente en fase beta y se espera que se publiquen bajo una licencia permisiva en las próximas semanas. El modelo más grande, Soofi L, ya está en entrenamiento.

Respuesta a las acusaciones de sobreentrenamiento (15 de julio de 2026)

Tras el lanzamiento, los críticos argumentaron que Soofi S estaba fuertemente "sobreentrenado" según los estándares de las clásicas leyes de escala de Chinchilla, que Google DeepMind publicó en 2022. Esas leyes describen cómo equilibrar el tamaño del modelo y los datos de entrenamiento para un presupuesto de cómputo fijo, identificando un punto óptimo de aproximadamente 20 tokens por parámetro.

Soofi S supera ampliamente esa proporción. Con aproximadamente 27 billones de tokens y 30 mil millones de parámetros, la proporción se sitúa en varios cientos a uno. Si se consideran solo los 3.2 mil millones de parámetros activos por token, la proporción se eleva a varios miles a uno.

Michael Fromm, parte del liderazgo técnico del proyecto, rechazó esa crítica, argumentando que esas reglas no se aplican directamente a las arquitecturas Mixture-of-Experts (MoE). "Hay nuevas investigaciones que demuestran que las antiguas leyes de escala de los modelos densos ya no se aplican a las arquitecturas MoE", dijo Fromm. Explicó que los expertos individuales se benefician de ver los mismos documentos repetidamente, por lo que los datos duplicados en un conjunto de datos grande y de alta calidad representan un problema menor del que serían en modelos densos. Como comparación, Fromm señaló que Nvidia entrenó sus propios modelos con hasta 25 billones de tokens.

Una arquitectura ligera diseñada para contextos largos

Soofi S es un modelo de mezcla de expertos que contiene 31.6 mil millones de parámetros en total, pero activa solo unos 3.2 mil millones por token generado. Esto sitúa su costo de cómputo más cerca de un modelo de 3B que de un modelo convencional de 30B. El consorcio adoptó sin modificaciones la arquitectura del Nemotron 3 Nano de Nvidia, un diseño híbrido que combina capas Mamba-2 con capas de atención estándar.

La diferencia crítica respecto a los transformers típicos radica en el comportamiento de la memoria. En los modelos convencionales, la caché KV que almacena los tokens anteriores para el cálculo de atención crece linealmente con la longitud del contexto, convirtiéndose en un cuello de botella con entradas largas y muchas solicitudes paralelas. Solo 6 de las 52 capas de Soofi S mantienen dicha caché.

El beneficio práctico es evidente en el rendimiento de generación. Con una longitud de contexto de 40,000 tokens y 32 solicitudes paralelas, Soofi S genera aproximadamente ocho veces más tokens por segundo por GPU que los modelos densos en el rango de 14 a 24 mil millones de parámetros. Mientras que el rendimiento disminuye significativamente en los modelos convencionales a medida que crece el contexto, Soofi S se mantiene casi plano de 4,000 a 256,000 tokens. El único modelo que muestra un comportamiento similar en las mediciones es el Qwen3.5 35B-A3B de Alibaba, que también utiliza una arquitectura híbrida.

Una mezcla de entrenamiento centrada en el alemán

El consorcio procesó aproximadamente 27 billones de tokens en tres fases. En la primera fase, el modelo aprendió los fundamentos del lenguaje a partir de aproximadamente 20 billones de tokens extraídos de una amplia mezcla de textos web, código, matemáticas y contenidos de dominio específico. Una segunda fase continuó con unos 6 billones de tokens de fuentes de mayor calidad, diseñados para perfeccionar los patrones aprendidos anteriormente. Una tercera fase más corta amplió la ventana de contexto mediante el entrenamiento con documentos muy largos de hasta un millón de tokens.

El énfasis deliberado en el alemán es central en el diseño. En la primera fase, el alemán representa el 7.2 por ciento de la mezcla de entrenamiento; en la segunda fase, esa proporción aumenta al 15.3 por ciento. En comparación, en la receta de referencia Nemotron de Nvidia, todos los idiomas no ingleses combinados representan solo alrededor del 5 por ciento. Para las empresas y los usuarios del sector público de habla alemana, ese equilibrio de datos es relevante porque muchos flujos de trabajo técnicos, legales, administrativos y de atención al cliente dependen de un lenguaje de dominio que no está bien representado en corpus centrados en el inglés.

En cuanto a las fuentes de datos, el consorcio combinó texto web en alemán de HPLT, el corpus German Commons de licencia abierta, porciones en alemán de FinePDFs y FineWiki, y el corpus Genios con licencia comercial que contiene 193 millones de artículos periodísticos de 916 publicaciones alemanas. Textos en alemán traducidos automáticamente y generados sintéticamente completaron la mezcla.

Resultados de benchmarks en alemán, inglés y código

En evaluaciones contra otros 16 modelos abiertos, Soofi S lidera todos los modelos totalmente abiertos en las puntuaciones agregadas tanto de alemán como de inglés, según el informe. Frente a todas las líneas base europeas soberanas, el modelo se impone en todos los benchmarks de alemán de la suite, a veces por márgenes de dos dígitos.

En los benchmarks de código, Soofi S obtiene un 73.8 por ciento en HumanEval, 70.2 en MBPP y 84.2 en la variante alemana de MBPP, los mejores resultados entre los modelos de código abierto. En INCLUDE-DE, una prueba de conocimiento regional específico de Alemania, Soofi S empata en el primer lugar con 61.2 puntos con el modelo más grande Qwen3.5 35B-A3B. En comparación con la línea base de Nemotron, la receta de datos alemanes mejoró la competencia lingüística en 15.1 puntos y la prueba científica GPQA-Diamond en 9.6 puntos, sin sacrificar el rendimiento en inglés.

Soofi S tiene un rendimiento inferior en ciertas áreas. En matemáticas de competición en alemán, obtiene 56 puntos en Minerva MATH-DE, muy por detrás de Qwen3.5 35B-A3B (76.5) y Gemma 3 27B (65.6). También queda atrás en la recuperación abierta de hechos en NaturalQuestions, probablemente relacionado con tener solo 3 mil millones de parámetros activos, lo que puede almacenar menos conocimiento mundial que un modelo denso de 27B.

La prueba de contexto largo RULER reveló una debilidad específica: cuando el modelo debe extraer palabras que aparecen con frecuencia de un texto largo, la tasa de aciertos de Soofi S cae a alrededor del 3 por ciento más allá de 32,000 tokens de contexto, mientras que el modelo comparable de Nemotron aún alcanza entre el 60 y el 64 por ciento. Los autores atribuyen esto al hecho de que sus datos de entrenamiento de contexto largo contienen muchos documentos extensos, pero carecen de datos sintéticos diseñados específicamente para tareas de extracción. En las doce tareas restantes de RULER, ambos modelos tienen un rendimiento comparable.

Infraestructura soberana y apertura documentada

El entrenamiento se realizó entre marzo y mayo en hasta 512 GPU Nvidia B200 en la nube de IA Industrial de Deutsche Telekom en Múnich, totalizando aproximadamente 253,000 horas de GPU. Según el informe, la instalación funciona íntegramente con energía renovable, se enfría con agua del canal Eisbach y alimenta el calor residual al vecindario circundante de Tucherpark. Soofi S fue uno de los primeros entrenamientos importantes en esta infraestructura.

El consorcio detrás de Soofi está formado por instituciones y empresas de investigación alemanas, coordinado por la Asociación Alemana de IA y financiado por el Ministerio Federal de Economía y Energía de Alemania como parte del programa europeo IPCEI-CIS. Los participantes incluyen los Institutos Fraunhofer IAIS e IIS, el Centro Alemán de Investigación en Inteligencia Artificial (DFKI), la TU Darmstadt, la Universidad de Würzburg, el Centro de Investigación L3S, la Universidad de Ciencias Aplicadas de Berlín, y las empresas de IA Ellamind y Merantix Momentum. El objetivo del proyecto es construir una familia de modelos de IA europeos abiertos que pueda funcionar en infraestructura soberana y ser probada en aplicaciones industriales.

Los investigadores están publicando los pesos del modelo junto con puntos de control intermedios seleccionados, el código completo de entrenamiento y evaluación, y un inventario de datos detallado que enumera los recuentos de tokens sin procesar, los números de época y las contribuciones efectivas por fuente. Las fuentes que fueron revisadas pero excluidas también están documentadas. Según el equipo, esto significa que Soofi S cumple con la Definición de IA de Código Abierto 1.0 de la Open Source Initiative.

Una propuesta más estricta para una definición europea de datos abiertos, que requeriría que cada token de entrenamiento fuera libremente distribuible, no se cumple debido al 1.3 por ciento de datos de Genios, que tiene una licencia comercial. El informe indica que aproximadamente el 99 por ciento de la mezcla de entrenamiento puede reconstruirse de forma independiente. La licencia exacta para el lanzamiento del modelo aún no se ha finalizado.

Como escribe el líder técnico Michael Fromm, Soofi S se posiciona entre proyectos europeos soberanos multilingües de amplio alcance como EuroLLM o Teuken, que cubren muchos idiomas, y los modelos internacionales de pesos abiertos de mayor rendimiento. Según el sitio web del proyecto, el consorcio busca socios de la industria para la próxima fase con el fin de probar el modelo en aplicaciones que involucren documentos técnicos, generación de código y sistemas basados en agentes.