Dane Arena AI: różnica między modelami frontier a otwartymi wzrosła do 29 punktów Elo
Najważniejsze informacje
- •Luka ratingów Elo między najlepszymi zamkniętymi i otwartymi modelami AI wzrosła z zera w styczniu 2025 r. do 29 punktów we wrześniu 2026 r., według danych ewaluacyjnych Arena AI.
- •Analiza Epoch AI pokazuje, że modele otwarte odstają obecnie od zamkniętych o około cztery miesiące w najtrudniejszych zadaniach, wobec trzymiesięcznego opóźnienia obserwowanego do końca 2025 r.
- •Arena, która zaczęła jako projekt badawczy UC Berkeley w 2023 r., osiągnęła 100 milionów dolarów rocznego przychodu w osiem miesięcy po uruchomieniu płatnych usług ewaluacyjnych.
- •Większość frontierowego rozwoju modeli otwartych pochodzi obecnie z chińskich laboratoriów, m.in. Moonshot AI, Zhipu, DeepSeek i Alibaba, podczas gdy amerykańscy i europejscy decydenci debatują nad ograniczaniem wydań modeli otwartych powyżej określonych progów zdolności.
- •Rosnąca luka oznacza, że przedsiębiorstwa i rządy ceniące kontrolę nad danymi oraz zgodność regulacyjną coraz częściej muszą wybierać między suwerennością a surową wydajnością modeli.

W styczniu 2025 r. modele AI o otwartych wagach osiągnęły krótkotrwały parytet z zamkniętymi rywalami — luka ratingów Elo na crowdsourcingowym rankingu Arena spadła do zera. Ten moment już minął. Według danych ewaluacyjnych Arena AI, na wrzesień 2026 r. różnica między najlepszymi zamkniętymi modelami frontier a ich czołowymi konkurentami o otwartych wagach wzrosła do 29 punktów Elo.
Claude Opus 5 Max ma obecnie rating 1505, podczas gdy Kimi K3 Max od Moonshot AI, najmocniejszy zawodnik w kategorii otwartych wag, traci prawie 30 punktów. Peter Gostev, kierownik ds. zdolności AI w Arenie, odegrał kluczową rolę w śledzeniu i wizualizacji tego rozjazdu.
Stawki tej luki wykraczają poza rankingi. Modele o otwartych wagach — których parametry można pobrać i uruchamiać na własnej infrastrukturze klienta — są atrakcyjne dla przedsiębiorstw i rządów przywiązujących wagę do kontroli nad danymi, zgodności regulacyjnej oraz unikania opłat API naliczanych za token. Rosnąca luka wydajności oznacza, że organizacje z takimi wymaganiami coraz częściej muszą wybierać między suwerennością a surową wydajnością. Z drugiej strony, około czteromiesięczne opóźnienie oznacza, że użytkownicy modeli otwartych otrzymują możliwości, które zamknięte modele już oferują — tylko z opóźnieniem.
Co liczby faktycznie oznaczają
Trajektoria mówi więcej niż pojedyncza migawka. Od zera w styczniu 2025 r. do 29 punktów we wrześniu 2026 r. trend oddala się od parytetu dla modeli otwartych. Analiza Epoch AI wzmacnia ten obraz z innej perspektywy: w wydajności na najtrudniejszych zadaniach modele otwarte odstają obecnie od zamkniętych odpowiedników o około cztery miesiące, wobec trzymiesięcznego opóźnienia obserwowanego do końca 2025 r.
Arena przetwarza ponad 10 milionów ewaluacji miesięcznie, opierając się na dużej liczbie rzeczywistych interakcji użytkowników, a nie na syntetycznych benchmarkach. Ma to znaczenie, ponieważ statyczne benchmarki były wielokrotnie krytykowane za kontaminację — wyciek danych testowych do zbiorów treningowych — oraz za to, że nie oddają zachowania modeli wobec złożonych, rzeczywistych promptów. Gdy miliony anonimowych użytkowników konsekwentnie preferują wyniki jednego modelu nad innym, taki sygnał trudno zignorować.
Same punkty Elo również wymagają interpretacji: 29-punktowa luka w skali Areny nie oznacza, że modele zamknięte są kategorycznie lepsze we wszystkim. Modele mogą być zbliżone ogółem, a jednocześnie wykazywać duże różnice w konkretnych typach zadań — dlatego praca Gosteva nad analizami per-kompetencja zwróciła uwagę.
Biznes mierzenia AI
Sama Arena stała się godną uwagi historią biznesową. To, co zaczęło się w 2023 r. jako projekt badawczy UC Berkeley, przekształciło się w przedsiębiorstwo generujące 100 milionów dolarów rocznego przychodu w ujęciu rocznym, osiągając ten poziom w zaledwie osiem miesięcy po uruchomieniu płatnych usług ewaluacyjnych. Jej monetyzacja odzwierciedla szerszy sygnał popytu: skoro firmy przeznaczają na AI coraz większe budżety, są gotowe płacić za niezależne, oparte na ludzkich preferencjach pomiary tego, które modele faktycznie działają.
Wkład Gosteva koncentrował się na tym, by słabości modeli były czytelne. Jego praca uwydatnia napięcie między tym, jak modele wypadają w ocenie ekspertów dziedzinowych a zwykłych użytkowników — rozróżnienie istotne dla wdrożeń w przedsiębiorstwach: faworyt rankingu zwykłych użytkowników niekoniecznie jest najlepszym modelem do pracy prawniczej czy medycznej.
Geopolityka modeli otwartych
Najaktywniejszy rozwój modeli o otwartych wagach przesunął się zdecydowanie w stronę chińskich laboratoriów. Seria Kimi od Moonshot AI, GLM od Zhipu, DeepSeek oraz Qwen od Alibaba reprezentują frontier tego, co dostępne publicznie. Ma to wagę polityczną: w Stanach Zjednoczonych i Europie publikacje modeli otwartych są przedmiotem debat w ramach proponowanych regulacji AI, a część decydentów opowiada się za ograniczaniem otwartych wag powyżej określonych progów zdolności. Tymczasem większość frontierowych wydań modeli otwartych pochodzi obecnie z Chin, co oznacza, że publicznie dostępną granicę AI coraz bardziej kształtują chińskie decyzje inżynieryjne i warunki licencyjne. Luka jednak trwa, ponieważ Anthropic, OpenAI i Google DeepMind dalej rozwijają swoje zamknięte modele szybciej i dalej.
Otwartym pytaniem na przyszłość jest to, czy czteromiesięczne opóźnienie się utrzyma, zwiększy, czy zmniejszy — odpowiedź ukształtuje decyzje zakupowe organizacji, które postawiły na otwartą infrastrukturę, oraz to, jaką siłę negocjacyjną w kwestii cen zachowają dostawcy modeli zamkniętych.