Reflection AI eröffnet Early Access zu Beam vor Open-Weights-Release im Oktober
Wichtige Erkenntnisse
- •Reflection AI hat am 5. Oktober den Early Access zu seinem ersten Open-Weights-Modell Beam gestartet; die Gewichte, der technische Bericht und die Modellkarte folgen später in diesem Monat unter einer Apache-2.0-Lizenz, die kommerzielle Nutzung und Modifikation erlaubt.
- •Beam ist ein sparsames Mixture-of-Experts-Modell mit 501 Milliarden Parametern insgesamt und 23 Milliarden aktiven pro Token; Reflection sagt, es halte bei fortgeschrittenen Reasoning-Tests mit Z.ai's GLM-5.2 mit und nutze dabei 3-4 Mal weniger Inferenz-Compute, wobei diese Angaben unbestätigt bleiben.
- •Beams Reinforcement-Learning-Trainingslauf nutzte 10.500 Nvidia-GB300-GPUs über vier Wochen, erzeugte mehr als 100 Millionen Rollouts und verwendete rund 1,3 Milliarden Sandboxes — laut Reflection einer der größten RL-Läufe eines offenen Labors.
- •Laut Reflections Benchmark-Tabellen übertraf Beam Thinking Machines Lab's Inkling auf vier Coding-Benchmarks, mit 77,2 gegenüber Inklings 56,9 bei SWE Bench Pro v2-Hard.
- •Reflection wurde 2024 von den ehemaligen Google-DeepMind-Forschern Misha Laskin und Ioannis Antonoglou gegründet, hat rund 4,7 Milliarden US-Dollar bei einer Pre-Money-Bewertung von 25 Milliarden US-Dollar eingesammelt, und die Open-Weights-Veröffentlichung macht unabhängige Drittbewertungen von Beam möglich.

Reflection AI hat am 5. Oktober den Early Access zu Beam eröffnet, seinem ersten Open-Weights-Modell, wie die offizielle Ankündigung des Unternehmens mitteilt. Das Modell durchläuft derzeit die letzten Phasen der Red-Team-Tests — ein Prozess vor der Veröffentlichung, bei dem adversarielle Tester das Modell auf Sicherheits- und Schutzlücken prüfen — und die Gewichte, ein technischer Bericht sowie eine Modellkarte sollen später in diesem Monat folgen.
Laut Reflection werden die Gewichte unter einer Apache-2.0-Lizenz veröffentlicht, zusammen mit dem vollständigen Stack, der für den Betrieb, die Bewertung und das Fine-Tuning des Modells erforderlich ist. Apache 2.0 ist eine permissive Lizenz, die kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt, und die Open-Weights-Veröffentlichung wird es Entwicklern ermöglichen, die Parameter herunterzuladen und das Modell auf eigener Hardware auszuführen.
GLM-5.2-Parität mit 3–4× weniger Inferenz-Compute
Beam ist ein sparsames Mixture-of-Experts-Modell mit 501 Milliarden Parametern insgesamt und 23 Milliarden aktiven Parametern pro Token. Bei solchen Architekturen wird nur eine Teilmenge der Modellparameter pro Token aktiviert, wodurch der erforderliche Compute pro Token im Verhältnis zur Gesamtzahl der Parameter sinkt. Das Modell wurde auf 23,8 Billionen Token vortrainiert, und seine Kontextlänge erreichte während des Mid-Trainings 1 Million Token.
Reflection sagt, dass Beam bei fortgeschrittenen Reasoning-Tests mit Z.ai's GLM-5.2 mithält und dabei „3–4× weniger Inferenz-Compute“ verwendet. Die Angaben des Unternehmens wurden nicht unabhängig verifiziert, allerdings wird die offene Veröffentlichung Drittbewertungen möglich machen. GLM-5.2 verfügt über rund 744 Milliarden Parameter, davon 40 Milliarden aktiv. Reflection stuft Kimi K3 in puncto roher Leistungsfähigkeit als besser ein und positioniert Beams Vorteil als Inferenzeffizienz.
Im Vergleich zu Thinking Machines Lab's Inkling, das im Juli veröffentlicht wurde, zeigen Reflections Benchmark-Tabellen Beam auf vier Coding-Benchmarks vorn, mit veröffentlichten Punktzahlen für beide Modelle. Bei SWE Bench Pro v2-Hard, Benchmark, der die Leistung in der realen Softwareentwicklung misst, erzielte Beam 77,2 gegenüber Inklings 56,9. Inkling ist multimodal, während Beam nur Text verarbeitet.
10.500 Nvidia-GB300-GPUs liefen vier Wochen lang für RL
Reflections Reinforcement-Learning-Lauf nutzte 10.500 Nvidia-GB300-GPUs über vier Wochen, erzeugte mehr als 100 Millionen Rollouts und verwendete rund 1,3 Milliarden Sandboxes für Training und Bewertung. Rollouts sind vollständige Modellversuche einer Aufgabe, die in isolierten Sandbox-Umgebungen ausgeführt und bewertet werden. Das Unternehmen beschreibt ihn als einen der größten RL-Läufe eines offenen Labors. Nach Reflections Angaben wurde Inkling mit 30 Millionen Rollouts trainiert.
Reflection wurde 2024 von Misha Laskin und Ioannis Antonoglou gegründet, beide ehemalige Google-DeepMind-Forscher. Das Unternehmen hat rund 4,7 Milliarden US-Dollar von Investoren eingesammelt, darunter Nvidia, Sequoia Capital und Lightspeed Venture Partners, zuletzt bei einer Pre-Money-Bewertung von 25 Milliarden US-Dollar.
Vor einem Jahr erhob es 2 Milliarden US-Dollar bei einer Bewertung von 8 Milliarden US-Dollar, wie Cryptopolitan berichtete. Allein sein SpaceX-Deal läuft auf bis zu 6,3 Milliarden US-Dollar hinaus — 150 Millionen US-Dollar pro Monat für Nvidia-GB300-Kapazität bei Colossus 2 nahe Memphis, wie Cryptopolitan im Juni berichtete.
Beam stützt zudem Reflections „AI-Factory“-Angebot, das es Institutionen ermöglicht, seine Modelle mit ihren eigenen Daten zu trainieren und auf ihrer eigenen Recheninfrastruktur auszuführen. Die Shinsegae Group erprobt eine Sovereign Edition in Südkorea.
„Sie sind irgendwie wie Raketen“, sagte Laskin über den Weg seiner Modelle an die Spitze. „Um eine große Rakete zu bauen, braucht es Zeit.“