NoticiasAccionesReflection AI abre el acceso anticipado a Beam antes del lanzamiento de pesos abiertos de octubre

Reflection AI abre el acceso anticipado a Beam antes del lanzamiento de pesos abiertos de octubre

Autor: Cryptopolitan·

Puntos clave

  • •Reflection AI lanzó el acceso anticipado a su primer modelo de pesos abiertos, Beam, el 5 de octubre, con los pesos, el informe técnico y la model card programados para finales de este mes bajo una licencia Apache 2.0 que permite el uso comercial y la modificación.
  • •Beam es un modelo disperso de mezcla de expertos con 501.000 millones de parámetros totales y 23.000 millones activos por token, y Reflection afirma que iguala al GLM-5.2 de Z.ai en pruebas de razonamiento avanzado usando 3-4 veces menos cómputo de inferencia, aunque estas afirmaciones no han sido verificadas.
  • •La ejecución de aprendizaje por refuerzo de Beam utilizó 10.500 GPUs Nvidia GB300 durante cuatro semanas, generó más de 100 millones de rollouts y empleó alrededor de 1.300 millones de sandboxes, lo que Reflection describe como una de las ejecuciones de RL más grandes de cualquier laboratorio abierto.
  • •En las tablas de benchmarks de Reflection, Beam superó a Inkling de Thinking Machines Lab en cuatro benchmarks de programación, con una puntuación de 77.2 frente al 56.9 de Inkling en SWE Bench Pro v2-Hard.
  • •Fundada en 2024 por los exinvestigadores de Google DeepMind Misha Laskin y Ioannis Antonoglou, Reflection ha recaudado alrededor de 4.700 millones de dólares con una valoración pre-money de 25.000 millones de dólares, y el lanzamiento de pesos abiertos permitirá evaluaciones independientes de terceros de Beam.
Reflection AI abre el acceso anticipado a Beam antes del lanzamiento de pesos abiertos de octubre

Reflection AI abrió el acceso anticipado a Beam, su primer modelo de pesos abiertos, el 5 de octubre, según el anuncio oficial de la compañía. El modelo está completando actualmente las pruebas de equipo rojo, un proceso previo al lanzamiento en el que evaluadores adversariales buscan fallas de seguridad en el modelo, y los pesos, un informe técnico y una model card están programados para finales de este mes.

Según Reflection, los pesos se lanzarán bajo una licencia Apache 2.0, junto con el stack completo necesario para ejecutar, evaluar y ajustar el modelo. Apache 2.0 es una licencia permisiva que permite el uso comercial, la modificación y la redistribución, y el lanzamiento de pesos abiertos permitirá a los desarrolladores descargar los parámetros y ejecutar el modelo en su propio hardware.

Paridad con GLM-5.2 usando 3–4× menos cómputo de inferencia

Beam es un modelo disperso de mezcla de expertos con 501.000 millones de parámetros totales y 23.000 millones de parámetros activos por token. En tales arquitecturas, solo un subconjunto de los parámetros del modelo se activa para cada token, lo que reduce el cómputo requerido por token en relación con el número total de parámetros. Fue preentrenado con 23,8 billones de tokens, y su longitud de contexto alcanzó 1 millón de tokens durante el entrenamiento intermedio.

Reflection afirma que Beam iguala al GLM-5.2 de Z.ai en pruebas de razonamiento avanzado mientras usa "3–4× menos cómputo de inferencia". Las afirmaciones de la compañía no han sido verificadas de forma independiente, aunque el lanzamiento abierto permitirá evaluaciones de terceros. GLM-5.2 tiene aproximadamente 744.000 millones de parámetros, de los cuales 40.000 millones son activos. Reflection ubica a Kimi K3 por delante de Beam en capacidad bruta y presenta la ventaja de Beam como eficiencia de inferencia.

Frente a Inkling de Thinking Machines Lab, lanzado en julio, las tablas de benchmarks de Reflection muestran a Beam por delante en cuatro benchmarks de programación, con puntuaciones publicadas para ambos modelos. En SWE Bench Pro v2-Hard, un benchmark que mide el rendimiento en ingeniería de software del mundo real, Beam obtuvo 77.2 frente al 56.9 de Inkling. Inkling es multimodal, mientras que Beam es solo de texto.

10.500 GPUs Nvidia GB300 durante cuatro semanas de RL

La ejecución de aprendizaje por refuerzo de Reflection utilizó10.500 GPUs Nvidia GB300 durante cuatro semanas, produjo más de 100 millones de rollouts y empleó alrededor de 1.300 millones de sandboxes para entrenamiento y calificación. Los rollouts son intentos completos del modelo en una tarea, ejecutados y calificados dentro de entornos sandbox aislados. La compañía lo describe como una de las ejecuciones de RL más grandes de cualquier laboratorio abierto. Según el conteo de Reflection, Inkling se entrenó con 30 millones de rollouts.

Reflection fue fundada en 2024 por Misha Laskin y Ioannis Antonoglou, ambos exinvestigadores de Google DeepMind. La compañía ha recaudado alrededor de 4.700 millones de dólares de inversores que incluyen Nvidia, Sequoia Capital y Lightspeed Venture Partners, más recientemente con una valoración pre-money de 25.000 millones de dólares.

Hace un año, recaudó 2.000 millones de dólares con una valoración de 8.000 millones de dólares, como informó Cryptopolitan. Su acuerdo con SpaceX por sí solo asciende hasta 6.300 millones de dólares, con 150 millones de dólares al mes por capacidad de GPUs Nvidia GB300 en Colossus 2 cerca de Memphis, informó Cryptopolitan en junio.

Beam también respalda la oferta de "fábrica de IA" de Reflection, que permite a las instituciones entrenar sus modelos con sus propios datos y ejecutarlos en su propio cómputo. Shinsegae Group está probando una edición soberana en Corea del Sur.

"Son como naves espaciales", ha dicho Laskin sobre el camino de sus modelos hacia la frontera. "Construir una nave espacial grande toma tiempo".