НовостиМакроДанные Arena AI показывают: разрыв между закрытыми и открытыми ИИ-моделями достиг 29 пунктов Эло

Данные Arena AI показывают: разрыв между закрытыми и открытыми ИИ-моделями достиг 29 пунктов Эло

Автор: CryptoBriefing·

Ключевые выводы

  • По данным оценки Arena AI, разрыв в рейтинге Эло между лучшими закрытыми и открытыми ИИ-моделями вырос с нуля в январе 2025 года до 29 пунктов на сентябрь 2026 года.
  • Анализ Epoch AI показывает, что открытые модели теперь отстают от закрытых примерно на четыре месяца по самым сложным задачам, тогда как до конца 2025 года отставание составляло три месяца.
  • Arena, начавшая в 2023 году как исследовательский проект Калифорнийского университета в Беркли, достигла годовой выручки в $100 миллионов за восемь месяцев после запуска платных услуг оценки.
  • Большинство разработок передовых открытых моделей теперь ведётся китайскими лабораториями, включая Moonshot AI, Zhipu, DeepSeek и Alibaba, тогда как в США и Европе политики обсуждают ограничение выпуска открытых моделей выше определённых порогов возможностей.
  • Расширение разрыва означает, что предприятия и правительства, для которых приоритетны контроль над данными и регуляторное соответствие, всё больше сталкиваются с выбором между суверенитетом и чистой производительностью моделей.
Данные Arena AI показывают: разрыв между закрытыми и открытыми ИИ-моделями достиг 29 пунктов Эло

В январе 2025 года открытые ИИ-модели ненадолго достигли паритета с закрытыми конкурентами: разрыв в рейтинге Эло на краудсорсинговом лидерборде Arena упал до нуля. Этот момент остался в прошлом. По данным оценки Arena AI, на сентябрь 2026 года разрыв между лучшими закрытыми моделями переднего края и их сильнейшими открытыми конкурентами вырос до 29 пунктов Эло.

Claude Opus 5 Max в настоящее время имеет рейтинг 1505, тогда как Kimi K3 Max от Moonshot AI — сильнейший открытый конкурент — отстаёт почти на 30 пунктов. Питер Гостев (Peter Gostev), руководитель направления AI Capability в Arena, сыграл ключевую роль в отслеживании и визуализации этого расхождения.

Значение этого разрыва выходит за пределы лидербордов. Открытые модели, параметры которых можно загрузить и запустить на собственной инфраструктуре клиента, привлекательны для предприятий и правительств, для которых приоритетны контроль над данными, регуляторное соответствие и отказ от оплаты API за каждый токен. Расширение разрыва в возможностях означает, что организации с такими требованиями всё чаще сталкиваются с выбором между суверенитетом и чистой производительностью. С другой стороны, отставание примерно в четыре месяца означает, что пользователи открытых моделей получают возможности, которые закрытые модели уже предлагают, но с задержкой.

Что на самом деле означают эти цифры

Динамика говорит больше, чем любой отдельный снимок данных. С нуля в январе 2025 года до 29 пунктов в сентябре 2026 года тренд движется в сторону от паритета для открытых моделей. Анализ Epoch AI подтверждает эту картину с другой стороны: открытые модели теперь отстают от закрытых примерно на четыре месяца по производительности на самых сложных задачах, тогда как до конца 2025 года отставание составляло три месяца.

Arena ежемесячно обрабатывает более 10 миллионов оценок, опираясь на большой объём реальных взаимодействий пользователей, а не на синтетические бенчмарки. Это важно, поскольку статические бенчмарки неоднократно критиковали за загрязнение данных — утечку тестовых данных в обучающие выборки — и за неспособность отразить поведение моделей на сложных реальных запросах. Когда миллионы анонимных пользователей стабильно предпочитают выводы одной модели выводам другой, этот сигнал трудно игнорировать.

Сами пункты Эло также требуют интерпретации: разрыв в 29 пунктов на шкале Arena не означает, что закрытые модели категорически лучше во всём. Модели могут быть близки в целом, демонстрируя при этом большие различия на отдельных типах задач — именно поэтому внимание привлекла работа Гостева над разбивкой по отдельным способностям.

Бизнес измерения ИИ

Сама Arena стала заметной бизнес-историей. Начав в 2023 году как исследовательский проект Калифорнийского университета в Беркли, она выросла в компанию с годовой выручкой в размере $100 миллионов, достигнув этого показателя всего за восемь месяцев после запуска платных услуг оценки. Её монетизация отражает более широкий рыночный спрос: по мере того как компании вкладывают бюджеты в ИИ, они готовы платить за независимое измерение моделей на основе человеческих предпочтений.

Вклад Гостева был сосредоточен на том, чтобы сделать слабые места моделей наглядными. Его работа подчёркивает противоречие между тем, как модели показывают себя при оценке экспертами в конкретной области и обычными пользователями — различие, которое имеет большое значение для корпоративных внедрений: фаворит лидерборда по оценке обычных пользователей может не быть лучшей моделью, например, для юридической или медицинской работы.

Геополитика открытых моделей

Наиболее активная разработка открытых моделей сместилась в сторону китайских лабораторий. Серия Kimi от Moonshot AI, GLM от Zhipu, DeepSeek и Qwen от Alibaba представляют собой передний край того, что доступно публично. Это имеет политический вес: в США и Европе выпуск открытых моделей обсуждается в рамках предлагаемого регулирования ИИ, при этом некоторые политики выступают за ограничение открытых весов выше определённых порогов возможностей. Между тем большинство выпусков передовых открытых моделей теперь происходит из Китая, а значит, публично доступный передний край ИИ всё больше формируется китайскими инженерными решениями и условиями лицензирования. Однако разрыв сохраняется: Anthropic, OpenAI и Google DeepMind продолжают развивать свои закрытые модели дальше и быстрее.

Открытый вопрос заключается в том, сохранится ли четырёхмесячное отставание, увеличится или сократится — ответ определит решения о закупках для организаций, сделавших ставку на открытую инфраструктуру, и то, насколько сильными останутся позиции поставщиков закрытых моделей в ценообразовании.