Arena AI-gegevens tonen dat kloof tussen frontier- en open-weight AI-modellen is opgelopen tot 29 Elo-punten
Belangrijkste punten
- •De kloof in Elo-rating tussen de beste gesloten en open-weight AI-modellen is volgens Arena AI-evaluatiegegevens opgelopen van nul in januari 2025 tot 29 punten per september 2026.
- •Analyse van Epoch AI toont aan dat open-weight modellen op de meest veeleisende taken nu ruwweg vier maanden achterlopen op gesloten modellen, tegenover drie maanden eind 2025.
- •Arena, dat in 2023 begon als onderzoeksproject aan UC Berkeley, bereikte binnen acht maanden na de lancering van betaalde evaluatiediensten 100 miljoen dollar aan jaaromzet.
- •Het merendeel van de frontier-ontwikkeling van open-weight modellen komt inmiddels uit Chinese labs zoals Moonshot AI, Zhipu, DeepSeek en Alibaba, terwijl Amerikaanse en Europese beleidsmakers debatteren over beperkingen op open-weight-releases boven bepaalde capaciteitsdrempels.
- •De groeiende kloof betekent dat bedrijven en overheden die prioriteit geven aan gegevenscontrole en regelgevingsnaleving steeds meer een afweging moeten maken tussen soevereiniteit en pure modelprestaties.

In januari 2025 bereikten open-weight AI-modellen kortstondig gelijkwaardigheid met hun gesloten rivalen, waarbij het verschil in Elo-rating op Arena's crowdsourced leaderboard tot nul daalde. Dat moment is voorbij. Per september 2026 is de kloof tussen de beste gesloten frontier-modellen en hun sterkste open-weight concurrenten volgens evaluatiegegevens van Arena AI opgelopen tot 29 Elo-punten.
Claude Opus 5 Max heeft momenteel een rating van 1505, terwijl Kimi K3 Max van Moonshot AI, de sterkste open-weight uitdager, bijna 30 punten achterblijft. Peter Gostev, AI Capability Lead bij Arena, speelt een centrale rol bij het volgen en visualiseren van deze divergence.
De inzet van deze kloof reikt verder dan leaderboards. Open-weight modellen — waarvan de parameters gedownload en op de eigen infrastructuur van een klant kunnen worden gedraaid — zijn aantrekkelijk voor bedrijven en overheden die prioriteit geven aan gegevenscontrole, regelgevingsnaleving en het vermijden van API-kosten per token. Een groeiende capaciteitskloof betekent dat organisaties met deze eisen steeds vaker een afweging moeten maken tussen soevereiniteit en pure prestaties. Omgekeerd betekent het achterblijven van ruwweg vier maanden dat open-weight-gebruikers capaciteiten krijgen die gesloten modellen al aanbieden, alleen met vertraging.
Wat de cijfers werkelijk betekenen
Het traject is veelzeggender dan een momentopname. Van nul in januari 2025 tot 29 punten in september 2026 beweegt de trend zich af van gelijkwaardigheid voor open-weight modellen. De analyse van Epoch AI onderstreept dit beeld vanuit een andere hoek: open-weight modellen lopen op de meest veeleisende taken nu ruwweg vier maanden achter op hun gesloten tegenhangers, tegenover drie maanden eind 2025.
Arena verwerkt maandelijks meer dan 10 miljoen evaluaties, gebaseerd op een grote verzameling echte gebruikersinteracties in plaats van synthetische benchmarks. Dit is relevant omdat statische benchmarks herhaaldelijk zijn bekritiseerd wegens contaminatie — testdata die in trainingssets lekt — en omdat ze niet tonen hoe modellen presteren op rommelige, realistische prompts. Wanneer miljoenen anonieme gebruikers consequent de output van het ene model verkiezen boven die van een ander, is dat signaal moeilijk terzijde te schuiven.
Ook Elo-punten zelf vragen om interpretatie: een kloof van 29 punten op Arena's schaal betekent niet dat gesloten modellen over de hele linie beter zijn. Modellen kunnen in totaal dicht bij elkaar liggen en tegelijk grote verschillen vertonen op specifieke taaktypes, waardoor het werk van Gostev aan uitsplitsingen per capaciteit aandacht heeft getrokken.
De business van AI-meting
Arena zelf is een opvallend bedrijfsverhaal geworden. Wat in 2023 begon als een onderzoeksproject aan UC Berkeley, groeide uit tot een onderneming met 100 miljoen dollar aan jaaromzet, een run-rate die binnen slechts acht maanden na de lancering van betaalde evaluatiediensten werd bereikt. Deze verdienmodel weerspiegelt een bredere vraag: nu bedrijven budgetten in AI storten, zijn ze bereid te betalen voor onafhankelijke, op menselijke voorkeuren gebaseerde meting van welke modellen daadwerkelijk presteren.
Gostevs bijdrage heeft zich toegespitst op het inzichtelijk maken van modelzwaktes. Zijn werk belicht de spanning tussen hoe modellen presteren bij beoordeling door domeinexperts versus gewone gebruikers, een onderscheid dat veel betekent voor zakelijke inzet — de favoriet op een leaderboard van gewone gebruikers is niet per se het beste model voor bijvoorbeeld juridisch of medisch werk.
De geopolitiek van open modellen
De actiefste ontwikkeling van open-weight modellen is sterk verschoven naar Chinese labs. De Kimi-serie van Moonshot AI, GLM van Zhipu, DeepSeek en Qwen van Alibaba vormen de frontier van wat publiek beschikbaar is. Dit heeft politiek gewicht: in de Verenigde Staten en Europa worden open-weight-releases besproken in het kader van voorgestelde AI-regelgeving, waarbij sommige beleidsmakers pleiten voor beperkingen op open weights boven bepaalde capaciteitsdrempels. Intussen komt het merendeel van de frontier-releases op open-weight-gebied nu uit China, wat betekent dat de publiek inspecteerbare frontier van AI in toenemende mate wordt vormgegeven door Chinese technische beslissingen en licentievoorwaarden. Toch blijft de kloof bestaan, aangezien Anthropic, OpenAI en Google DeepMind hun gesloten modellen steeds verder en sneller blijven ontwikkelen.
De open vraag voor de toekomst is of het achterblijven van vier maanden standhoudt, verder oploopt of juist afneemt — het antwoord bepaalt inkoopbeslissingen van organisaties die op open infrastructuur hebben ingezet, en hoeveel prijshefbomen aanbieders van gesloten modellen behouden.