Reflection AI otwiera wczesny dostęp do modelu Beam przed październikową publikacją wag otwartych
Najważniejsze informacje
- •Reflection AI uruchomił wczesny dostęp do swojego pierwszego modelu open-weight, Beama, 5 października; wagi, raport techniczny i karta modelu pojawią się w tym miesiącu na licencji Apache 2.0, która pozwala na wykorzystanie komercyjne i modyfikacje.
- •Beam to model typu sparse mixture-of-experts o 501 miliardach parametrów całkowitych i 23 miliach aktywnych na token; według Reflection dorównuje GLM-5.2 firmy Z.ai w testach zaawansowanego rozumowania, zużywając 3–4 razy mniej mocy obliczeniowej wnioskowania, choć twierdzenia te pozostają niezweryfikowane.
- •Trening ze wzmocnieniem Beama wykorzystywał 10 500 procesorów Nvidia GB300 przez cztery tygodnie, wygenerował ponad 100 milionów rozegrań i zużył około 1,3 miliarda sandboksów, co Reflection opisuje jako jeden z największych treningów RL wśród otwartych laboratoriów.
- •W tabelach benchmarków Reflection Beam przewyższył model Inkling firmy Thinking Machines Lab w czterech benchmarkach programistycznych, uzyskując 77,2 wobec 56,9 w SWE Bench Pro v2-Hard.
- •Założona w 2024 roku przez byłych badaczy Google DeepMind — Mishę Laskina i Ioannisa Antonoglou — Reflection pozyskała około 4,7 miliarda dolarów przy wycenie pre-money 25 miliardów dolarów, a otwarta publikacja wag umożliwi niezależne oceny Beama przez strony trzecie.

Reflection AI otworzył wczesny dostęp do Beama, swojego pierwszego modelu open-weight, 5 października, jak podano w oficjalnym ogłoszeniu firmy. Model kończy obecnie testy red-team — proces poprzedzający premierę, w którym testerzy adwersaryjni wyszukują w modelu wady dotyczące bezpieczeństwa — a wagi, raport techniczny i karta modelu mają pojawić się w dalszej części miesiąca.
Według Reflection wagi zostaną udostępnione na licencji Apache 2.0, wraz z pełnym stosem narzędzi potrzebnym do uruchamiania, ewaluacji i dostrajania modelu. Apache 2.0 to licencja permisacyjna, która pozwala na wykorzystanie komercyjne, modyfikacje i redystrybucję, a publikacja otwartych wag pozwoli deweloperom pobrać parametry i uruchomić model na własnym sprzęcie.
Równorzędność z GLM-5.2 przy 3–4× mniejszej mocy obliczeniowej wnioskowania
Beam to model typu sparse mixture-of-experts o 501 miliardach parametrów całkowitych i 23 miliardach aktywnych parametrów na token. W takich architekturach dla każdego tokena aktywowana jest tylko część parametrów modelu, co zmniejsza moc obliczeniową wymaganą na token względem łącznej liczby parametrów. Model był pretrenowany na 23,8 biliona tokenów, a jego długość kontekstu osiągnęła 1 milion tokenów w trakcie treningu środkowego.
ług Reflection Beam dorównuje modelowi GLM-5.2 firmy Z.ai w testach zaawansowanego rozumowania, zużywając „3–4× mniej mocy obliczeniowej wnioskowania”. Twierdzenia firmy nie zostały niezależnie zweryfikowane, choć otwarta publikacja umożliwi oceny przez strony trzecie. GLM-5.2 ma około 744 miliardów parametrów, w tym 40 miliardów aktywnych. Reflection uznaje Kimi K3 za lepszy pod względem surowych możliwości i przedstawia przewagę Beama jako efektywność wnioskowania.
W porównaniu z modelem Inkling firmy Thinking Machines Lab, wydanym w lipcu, tabele benchmarków Reflection pokazują Beama na czele w czterech benchmarkach programistycznych, z wynikami opublikowanymi dla obu modeli. W teście SWE Bench Pro v2-Hard, który mierzy wydajność w rzeczywistej inżynierii oprogramowania, Beam uzyskał 77,2 wobec 56,9 modelu Inkling. Inkling jest multimodalny, podczas gdy Beam obsługuje wyłącznie tekst.
10 500 procesorów Nvidia GB300 pracowało przez cztery tygodnie treningu RL
Trening ze wzmocnieniem Reflection wykorzystywał 10 500 procesorów Nvidia GB300 przez cztery tygodnie, wygenerował ponad 100 milionów rozegrań i zużył około 1,3 miliarda sandboksów do treningu i oceny. Rozegrania to pełne próby wykonania zadania przez model, wykonywane i oceniane w izolowanych środowiskach piaskownic. Firma określa to jako jeden z największych treningów RL przeprowadzonych przez otwarte laboratorium. Według wyliczeń Reflection Inkling był trenowany na 30 milionach rozegrań.
Reflection została założona w 2024 roku przez Mishę Laskina i Ioannisa Antonoglou, byłych badaczy Google DeepMind. Firma pozyskała około 4,7 miliarda dolarów od inwestorów, w tym Nvidia, Sequoia Capital i Lightspeed Venture Partners, ostatnio przy wycenie pre-money 25 miliardów dolarów.
Rok wcześniej pozyskała 2 miliardy dolarów przy wycenie 8 miliardów dolarów, jak poinformował Cryptopolitan. Sam kontrakt ze SpaceX opiewa do 6,3 miliarda dolarów — 150 milionów dolarów miesięcznie za moc obliczeniową Nvidia GB300 w Colossus 2 pod Memphis, jak Cryptopolitan informował w czerwcu.
Beam stanowi również podstawę oferty „AI factory” Reflection, która pozwala instytucjom trenować modele firmy na własnych danych i uruchamiać je na własnej mocy obliczeniowej. Shinsegae Group testuje edycję sovereign w Korei Południowej.
„Są trochę jak rakiety” — powiedział Laskin o drodze swoich modeli ku czołówce. „Zbudowanie dużej rakiety wymaga czasu.”