ActualitésActionsReflection AI ouvre l'accès anticipé à Beam avant une publication en poids ouverts en octobre

Reflection AI ouvre l'accès anticipé à Beam avant une publication en poids ouverts en octobre

Auteur: Cryptopolitan·

Points clés

  • •Reflection AI a lancé l'accès anticipé à son premier modèle à poids ouverts, Beam, le 5 octobre, avec la publication des poids, du rapport technique et de la fiche modèle prévue plus tard ce mois-ci sous licence Apache 2.0, qui autorise l'usage commercial et la modification.
  • •Beam est un modèle creux de type mélange d'experts avec 501 milliards de paramètres au total et 23 milliards actifs par token, et Reflection affirme qu'il égale le GLM-5.2 de Z.ai sur les tests de raisonnement avancé tout en utilisant 3 à 4 fois moins de calcul d'inférence, bien que ces affirmations restent non vérifiées.
  • •La phase d'entraînement par renforcement de Beam a utilisé 10 500 GPU Nvidia GB300 pendant quatre semaines, généré plus de 100 millions de rollouts et employé environ 1,3 milliard de sandbox, ce que Reflection décrit comme l'une des plus grandes phases de RL menées par un laboratoire ouvert.
  • •Sur les tableaux de référence de Reflection, Beam a surpassé Inkling de Thinking Machines Lab sur quatre benchmarks de programmation, avec un score de 77,2 contre 56,9 pour Inkling sur SWE Bench Pro v2-Hard.
  • •Fondée en 2024 par les anciens chercheurs de Google DeepMind Misha Laskin et Ioannis Antonoglou, Reflection a levé environ 4,7 milliards de dollars à une valorisation pré-money de 25 milliards de dollars, et la publication en poids ouverts rendra possibles des évaluations indépendantes de Beam par des tiers.
Reflection AI ouvre l'accès anticipé à Beam avant une publication en poids ouverts en octobre

Reflection AI a ouvert l'accès anticipé à Beam, son premier modèle à poids ouverts, le 5 octobre, selon l'annonce officielle de l'entreprise. Le modèle achève actuellement les tests de red teaming — un processus de pré-publication au cours duquel des testeurs adverses sondent le modèle à la recherche de failles de sécurité — et les poids, un rapport technique et une fiche modèle sont prévus plus tard ce mois-ci.

Selon Reflection, les poids seront publiés sous licence Apache 2.0, avec la pile complète nécessaire pour exécuter, évaluer et affiner le modèle. Apache 2.0 est une licence permissive qui autorise l'usage commercial, la modification et la redistribution, et la publication en poids ouverts permettra aux développeurs de télécharger les paramètres et d'exécuter le modèle sur leur propre matériel.

Une parité avec le GLM-5.2 avec 3 à 4× moins de calcul d'inférence

Beam est un modèle creux de type mélange d'experts avec 501 milliards de paramètres au total et 23 milliards de paramètres actifs par token. Dans de telles architectures, seule une partie des paramètres du modèle est activée pour chaque token, ce qui réduit le calcul requis par token par rapport au nombre total de paramètres. Il a été pré-entraîné sur 23 800 milliards de tokens, et sa longueur de contexte a atteint 1 million de tokens au cours de l'entraînement intermédiaire.

Reflection affirme que Beam égale le GLM-5.2 de Z.ai sur les tests de raisonnement avancé tout en utilisant « 3 à 4× moins de calcul d'inférence ». Les affirmations de l'entreprise n'ont pas été vérifiées de manière indépendante, mais la publication ouverte rendra possibles des évaluations par des tiers. Le GLM-5.2 compte environ 744 milliards de paramètres, dont 40 milliards actifs. Reflection place Kimi K3 devant Beam en capacité brute et présente l'avantage de Beam comme l'efficacité d'inférence.

Face à Inkling de Thinking Machines Lab, sorti en juillet, les tableaux de référence de Reflection montrent Beam en tête sur quatre benchmarks de programmation, avec les scores des deux modèles publiés. Sur SWE Bench Pro v2-Hard, un benchmark qui mesure les performances réelles en ingénierie logicielle, Beam a obtenu 77,2 contre 56,9 pour Inkling. Inkling est multimodal, tandis que Beam est limité au texte.

10 500 GPU Nvidia GB300 ont tourné pendant quatre semaines de RL

La phase d'apprentissage par renforcement de Reflection a utilisé 10 500 GPU Nvidia GB300 pendant quatre semaines, produit plus de 100 millions de rollouts et employé environ 1,3 milliard de sandbox pour l'entraînement et la notation. Les rollouts sont des tentatives complètes du modèle sur une tâche, exécutées et notées dans des environnements sandbox isolés. L'entreprise la décrit comme l'une des plus grandes phases de RL menées par un laboratoire ouvert. Selon les chiffres de Reflection, Inkling a été entraîné sur 30 millions de rollouts.

Reflection a été fondée en 2024 par Misha Lask et Ioannis Antonoglou, tous deux anciens chercheurs de Google DeepMind. L'entreprise a levé environ 4,7 milliards de dollars auprès d'investisseurs dont Nvidia, Sequoia Capital et Lightspeed Venture Partners, plus récemment à une valorisation pré-money de 25 milliards de dollars.

Un an plus tôt, elle avait levé 2 milliards de dollars à une valorisation de 8 milliards de dollars, comme l'a rapporté Cryptopolitan. Son accord avec SpaceX atteint à lui seul 6,3 milliards de dollars, soit 150 millions de dollars par mois pour de la capacité Nvidia GB300 à Colossus 2 près de Memphis, rapportait Cryptopolitan en juin.

Beam soutient également l'offre « AI factory » de Reflection, qui permet aux institutions d'entraîner ses modèles sur leurs propres données et de les exécuter sur leur propre calcul. Shinsegae Group teste une édition souveraine en Corée du Sud.

« Ils ressemblent un peu à des fusées », a déclaré Laskin au sujet du chemin de ses modèles vers la frontière. « Pour construire une grande fusée, il faut du temps. »