НовостиМакроClaude Sonnet 5.5 занимает третье место в рейтинге Agent Arena

Claude Sonnet 5.5 занимает третье место в рейтинге Agent Arena

Автор: CryptoBriefing·

Ключевые выводы

  • •Claude Sonnet 5.5 вошёл в Agent Arena от Arena.ai на третьем месте с показателем чистого улучшения 12,52%, уступив двум другим моделям Anthropic: Claude Fable 5.1 (Max) с 14,31% и Claude Opus 5.5 (High) с 13,82%.
  • •Модель незначительно обошла GPT-6 Astra (Max) от OpenAI, который находится на четвёртом месте с 12,27%, однако разрыв в 0,25 пункта меньше погрешности Sonnet 5.5 (плюс-минус 3,09%), поэтому расстановка может измениться.
  • •На Terminal-Bench 4.0 Sonnet 5.5 набрал 70,6% — значительный рост по сравнению с примерно 10–14% его предшественника Sonnet 5 — и также превзошёл результат Opus 5.5 в 66,4%.
  • •Sonnet 5.5 работает более чем на 30% быстрее Sonnet 5 при сохранении прежних цен — $2 за миллион входных токенов и $10 за миллион выходных токенов — и контекстном окне в 1 миллион токенов.
  • •Arena оценивает стоимость Sonnet 5.5 в $2,74 за задачу, и более высокое потребление токенов по сравнению с большинством аналогов может определять фактические расходы на одну задачу в производственных внедрениях.
Claude Sonnet 5.5 занимает третье место в рейтинге Agent Arena

Новейшая модель среднего уровня от Anthropic заняла третье место в рейтинге Agent Arena от Arena.ai. Claude Sonnet 5.5, выпущенный 28 сентября 2026 года, показал результат чистого улучшения 12,5% — этого хватило, чтобы обойти лучшую модель OpenAI. Выше него находятся только две модели, и обе также созданы Anthropic.

Как выглядит рейтинг

Всего через несколько дней после релиза Sonnet 5.5 поднялся на третье место в Agent Arena. Его точный показатель чистого улучшения составляет 12,52% с погрешностью плюс-минус 3,09%.

Две модели впереди него — Claude Fable 5.1 (Max) с результатом 14,31% и Claude Opus 5.5 (High) с 13,82%. Сразу за ним следует GPT-6 Astra (Max) от OpenAI с 12,27%. С этими результатами Anthropic занимает три из четырёх первых позиций в рейтинге.

Agent Arena оценивает модели на миллионах реальных агентных задач, где ИИ должен использовать инструменты, выполнять многоэтапную работу и удовлетворять реальных пользователей. При оценке учитываются надёжность работы с инструментами, выполнение задач и обратная связь пользователей. Этот акцент отражает более широкий сдвиг в отрасли: поскольку внедрения всё больше полагаются на модели для вызова инструментов и многоэтапной работы, позиции моделей всё чаще оспариваются в сквозном выполнении задач, а не только в статичных вопросах и ответах.

Стоимость — вторая ключевая цифра. Arena указывает стоимость Sonnet 5.5 в размере $2,74 за задачу, а снимки данных за начало октября оценивают медианную стоимость примерно в $2,78 за задачу. Модель также потребляет больше токенов, чем большинство аналогов.

Бенчмарки за пределами Arena

Сильный результат Sonnet 5.5 распространяется и на другие бенчмарки. На Artificial Analysis Intelligence Index он набрал 56 баллов — второе место после Opus 5.5 (Max).

На Terminal-Bench 4.0 Sonnet 5.5 набрал 70,6% — значительный скачок по сравнению с предшественником Sonnet 5, который показал примерно 10–14% на том же тесте. Новая модель также обошла Opus 5.5, набравшего 66,4% на Terminal-Bench 4.0.

Скорость тоже выросла: Sonnet 5.5 работает более чем на 30% быстрее, чем Sonnet 5. Цены, однако, не изменились. Модель по-прежнему стоит $2 за миллион входных токенов и $10 за миллион выходных токенов, как и раньше. Sonnet 5.5 предлагает контекстное окно в 1 миллион токенов и максимальный вывод 128 000 токенов. При неизменных ценах за токен, но выросших скорости и результатах обновление меняет соотношение возможностей и затрат — хотя повышенный аппетит модели к токенам, заметный в её показателях Arena, остаётся переменной, определяющей реальную стоимость одной задачи.

Что это значит для гонки ИИ-моделей

Первое, за чем стоит следить, — это погрешность. Результат Sonnet 5.5 имеет погрешность плюс-минус 3,09%, а общий разброс между четырьмя ведущими моделями меньше этой величины. GPT-6 Astra (Max) отстаёт от Sonnet 5.5 всего на 0,25 процентного пункта. При столь узких разрывах порядок может измениться по мере агрегации Arena новых задач, поэтому текущую расстановку лучше воспринимать как моментальный снимок, а не устоявшуюся иерархию.

Здесь имеет значение и потребление токенов. Более высокое использование токенов может свести на нет ценовое преимущество в зависимости от нагрузки — модель, дешёвая за токен, но многословная, не всегда будет дешёвой за задачу. Для команд, запускающих агентов в продакшене, эти два показателя — результат и стоимость за задачу — оказываются в одной таблице, поэтому любой релиз, меняющий верх подобных Agent Arena рейтингов, оценивается по обоим измерениям.