NieuwsAandelenReflection AI opent vroegtijdige toegang tot Beam voorafgaand aan open-weights-release in oktober

Reflection AI opent vroegtijdige toegang tot Beam voorafgaand aan open-weights-release in oktober

Auteur: Cryptopolitan·

Belangrijkste punten

  • •Reflection AI lanceerde op 5 oktober vroegtijdige toegang tot zijn eerste open-weight model, Beam, waarbij de gewichten, het technische rapport en de modelkaart later deze maand volgen onder een Apache 2.0-licentie die commercieel gebruik en aanpassing toestaat.
  • •Beam is een sparse mixture-of-experts model met in totaal 501 miljard parameters en 23 miljard actief per token, en Reflection zegt dat het op geavanceerde redeneertests gelijkwaardig is aan GLM-5.2 van Z.ai terwijl het 3-4 keer minder inferentiecompute gebruikt, al blijven deze beweringen ongeverifieerd.
  • •De reinforcement learning-trainingsrun van Beam gebruikte 10.500 Nvidia GB300 GPU's gedurende vier weken, genereerde meer dan 100 miljoen rollouts en gebruikte ongeveer 1,3 miljard sandboxes, wat Reflection beschrijft als een van de grootste RL-runs van een open lab.
  • •Op Reflections benchmarktabellen presteerde Beam beter dan Inkling van Thinking Machines Lab op vier codeerbenchmarks, met 77,2 tegenover Inklings 56,9 op SWE Bench Pro v2-Hard.
  • •Reflection, opgericht in 2024 door voormalige Google DeepMind-onderzoekers Misha Laskin en Ioannis Antonoglou, heeft ongeveer $4,7 miljard opgehaald bij een pre-money waardering van $25 miljard, en de open-weights-release maakt onafhankelijke evaluaties van Beam door derden mogelijk.
Reflection AI opent vroegtijdige toegang tot Beam voorafgaand aan open-weights-release in oktober

Reflection AI opende op 5 oktober vroegtijdige toegang tot Beam, het eerste open-weight model van het bedrijf, volgens de officiële aankondiging van het bedrijf. Het model rondt momenteel de red-team-test af — een proces vóór release waarbij tegenstanders het model doorzoeken op veiligheids- en beveiligingszwaktes — en de gewichten, een technisch rapport en een modelkaart verschijnen later deze maand.

Volgens Reflection worden de gewichten vrijgegeven onder een Apache 2.0-licentie, samen met de volledige stack die nodig is om het model te draaien, te evalueren en te fine-tunen. Apache 2.0 is een permissieve licentie die commercieel gebruik, aanpassing en herdistribution toestaat, en de open-weights-release stelt ontwikkelaars in staat de parameters te downloaden en het model op hun eigen hardware te draaien.

Gelijkwaardigheid met GLM-5.2 met 3–4× minder inferentiecompute

Beam is een sparse mixture-of-experts model met in totaal 501 miljard parameters en 23 miljard actieve parameters per token. Bij dergelijke architecturen wordt per token slechts een subset van de parameters van het model geactiveerd, wat de benodigde compute per token verlaagt ten opzichte van het totale aantal parameters. Het model werd voorgetraind op 23,8 biljoen tokens, en zijn contextlengte bereikte 1 miljoen tokens tijdens de mid-training.

Reflection zegt dat Beam op geavanceerde redeneertests gelijkwaardig is aan GLM-5.2 van Z.ai terwijl het “3–4× minder inferentiecompute” gebruikt. De beweringen van het bedrijf zijn niet onafhankelijk geverifieerd, hoewel de open release evaluaties door derden mogelijk zal maken. GLM-5.2 heeft ongeveer 744 miljard parameters, waarvan 40 miljard actief. Reflection plaatst Kimi K3 wat betreft ruwe capaciteit boven Beam en positioneert Beams voordeel als inferentie-efficiëntie.

Tegenover Inkling van Thinking Machines Lab, dat in werd uitgebracht, tonen Reflections benchmarktabellen Beam als beste op vier codeerbenchmarks, met scores voor beide modellen. Op SWE Bench Pro v2-Hard, een benchmark die prestaties in real-world software-engineering meet, scoorde Beam 77,2 tegenover Inklings 56,9. Inkling is multimodaal, terwijl Beam alleen tekst ondersteunt.

10.500 Nvidia GB300 GPU's draaiden vier weken aan RL

De reinforcement learning-run van Reflection gebruikte 10.500 Nvidia GB300 GPU's gedurende vier weken, produceerde meer dan 100 miljoen rollouts en gebruikte ongeveer 1,3 miljard sandboxes voor training en beoordeling. Rollouts zijn volledige modelpogingen voor een taak, uitgevoerd en beoordeeld in geïsoleerde sandboxomgevingen. Het bedrijf noemt het een van de grootste RL-runs van een open lab. Volgens Reflection is Inkling getraind op 30 miljoen rollouts.

Reflection werd in 2024 opgericht door Misha Laskin en Ioannis Antonoglou, beiden voormalig onderzoekers bij Google DeepMind. Het bedrijf heeft in totaal ongeveer $4,7 miljard opgehaald bij investeerders, waaronder Nvidia, Sequoia Capital en Lightspeed Venture Partners, onlangs nog bij een pre-money waardering van $25 miljard.

Een jaar geleden haalde het bedrijf $2 miljard op bij een waardering van $8 miljard, zoals Cryptopolitan berichtte. Alleen al de SpaceX-deal loopt op tot $6,3 miljard, $150 miljoen per maand voor Nvidia GB300-capaciteit bij Colossus 2 nabij Memphis, berichtte Cryptopolitan in juni.

Beam ondersteunt ook Reflections “AI factory”-aanbod, waarmee instellingen zijn modellen op hun eigen data kunnen trainen en op hun eigen compute kunnen draaien. Shinsegae Group beproeft een souvereine editie in Zuid-Korea.

“Het zijn een soort raketten,” zei Laskin ooit over de weg van zijn modellen naar de frontier. “Om een grote raket te bouwen, heb je tijd nodig.”