НовостиМакроClaude Opus 5 лидирует в ряде бенчмарков и обходится дешевле Fable 5

Claude Opus 5 лидирует в ряде бенчмарков и обходится дешевле Fable 5

Автор: The Decoder·

Ключевые выводы

  • Claude Opus 5 набрала 61 балл в Artificial Analysis Intelligence Index, немного опередив Claude Fable 5, GPT-5.6 Sol, Kimi K3 и Claude Opus 4.8.
  • В тестах по программированию Opus 5 разделила первое место в Artificial Analysis Coding Index и сравнялась с GPT-5.6 Sol, набрав 89 percent в Terminal-Bench v2.1 на уровне max.
  • Фактическая точность остается более слабой областью: Opus 5 уступает Fable 5 в AA-Omniscience, а ее уровень галлюцинаций вырос на 14 пунктов до 50 percent.
  • Epoch AI оценила Opus 5 немного ниже Fable 5 в целом, тогда как GPT-5.6 Sol лидировала и в общем Epoch Capability Index, и в категории программной инженерии.
  • Vals.ai обнаружила, что уровень рассуждения high у Opus 5 показал лучший результат в Vibe Code Bench, превзойдя более дорогие уровни xhigh и max.
Claude Opus 5 лидирует в ряде бенчмарков и обходится дешевле Fable 5

Claude Opus 5 от Anthropic, согласно результатам нескольких бенчмарков, является самой мощной из доступных сейчас моделей ИИ, особенно сильно показывая себя в качестве аналитики, программировании и задачах, связанных с интеллектуальной работой. Во многих тестах модель соответствует Claude Fable 5 или превосходит ее, при этом в целом обходится дешевле, хотя оценки также показывают более высокий уровень галлюцинаций, когда модель отвечает несмотря на неопределенность.

В индексе Intelligence Index от Artificial Analysis Claude Opus 5 набрала 61 балл. Индекс объединяет девять тестов, охватывающих интеллектуальную работу, программирование, научное рассуждение и фактическую точность. Этот результат ставит Opus 5 немного выше Claude Fable 5 с 60 баллами, GPT-5.6 Sol с 59, Kimi K3 с 57 и Claude Opus 4.8 с 56. Artificial Analysis работала с Anthropic над тестированием модели до ее публичного релиза.

В бенчмарках по программированию Claude Opus 5 на уровне рассуждения "xhigh" при использовании с Claude Code делит первое место в Artificial Analysis Coding Index. Этот индекс измеряет, насколько хорошо модели ИИ могут самостоятельно выполнять задачи программирования, включая выявление и исправление ошибок. В Terminal-Bench v2.1, который оценивает агентов, действующих как автономные инженеры в реальных терминальных средах, Opus 5 набрала 89 percent на уровне "max", сравнявшись с прежним лидером GPT-5.6 Sol.

В научном рассуждении Opus 5 набрала 53 percent в Humanity's Last Exam, сложном академическом тесте знаний по нескольким областям, сравнявшись с Claude Fable 5. В CritPt, бенчмарке по физике, разработанном исследователями Argonne National Laboratory и UIUC, Opus 5 снова сравнялась с Fable 5, но осталась позади GPT-5.6 Sol, GPT-5.5 Pro и GPT-5.6 Terra.

Фактическая точность по-прежнему остается более слабой стороной. В AA-Omniscience, который проверяет точность утверждений модели о знаниях, Opus 5 улучшила результат на 7 пунктов по сравнению с Opus 4.8, но продолжила уступать Fable 5. Модель также чаще отвечает, когда не уверена, из-за чего ее уровень галлюцинаций вырос на 14 пунктов до 50 percent. Этот компромисс важен для внедрений, где пользователи хотят, чтобы модели выполняли длинные и сложные задачи, но при этом нуждаются в надежном отказе или корректной обработке неопределенности, когда ответ не подкреплен данными.

Результаты Epoch AI показывают плотную гонку среди frontier-моделей

Epoch AI также оценила Claude Opus 5. Исследовательский институт присвоил модели общий балл Epoch Capability Index 159, немного ниже Fable 5 с 161. В подмножестве по программной инженерии, известном как SWE-ECI, Opus 5 сравнялась с Fable 5 на уровне 161 и превзошла GPT-5.6 Terra и Claude Opus 4.8. GPT-5.6 Sol лидирует как в общем индексе, так и в категории программной инженерии.

Результаты указывают на небольшой разрыв в производительности между frontier-моделями. Ни одна модель не демонстрирует явного лидерства во всех категориях. Этот вывод соответствует аргументу о том, что модели ИИ могут все больше становиться коммодитизированными; такая точка зрения также обсуждалась в связи с комментариями CEO Microsoft Сатьи Наделлы. Это также показывает, почему покупатели и разработчики все чаще сравнивают модели по типу нагрузки, задержке, надежности и стоимости, а не по одному заголовочному показателю.

Более низкие уровни рассуждения могут давать лучшую ценность в программировании

Средняя задача в Intelligence Index стоит $2.03 при использовании Opus 5. Это ниже, чем Claude Fable 5 с fallback за $2.75, но выше, чем Opus 4.8 за $1.80 и Sonnet 5 за $1.53. Однако на уровнях рассуждения "high" и "xhigh" Opus 5 превосходит как Opus 4.8, так и Sonnet 5, при этом обходясь дешевле.

Vals.ai протестировала Claude Opus 5 на всех пяти уровнях рассуждения с помощью Vibe Code Bench, бенчмарка для задач программирования. Результаты выросли с 76.7 percent на уровне "low" до 82 percent на "medium" и 89.8 percent на "high". Затем на двух самых высоких уровнях производительность снизилась: "xhigh" набрал 88.3 percent, а "max" — 88.4 percent, несмотря на существенно более высокие затраты.

Vals.ai обнаружила, что самые высокие уровни чаще генерируют более сложные решения, которые чаще содержат ошибки. Уровень "high" давал более простые решения, надежнее соответствовавшие требованиям.

Terminal-Bench 2.1 показывает похожую картину. Уровень "high" превзошел "max", потому что на самом высоком уровне модель тратит больше времени на каждую попытку, оставляя меньше попыток в пределах временного лимита бенчмарка. Это согласуется с рекомендациями Anthropic, где "high" установлен как уровень по умолчанию и в API, и в Claude Code.

Цены на токены остаются на уровне $5 за миллион входных токенов и $25 за миллион выходных токенов. Запись в кэш стоит $6.25 за миллион токенов при времени жизни пять минут, а попадания в кэш стоят $0.50 за миллион токенов. Эти цены делают длину вывода, поведение при повторных попытках и кэширование промптов важными составляющими эффективной стоимости для агентного программирования и рабочих процессов с большим объемом документов.

Opus 5 лидирует в оценках интеллектуальной работы

Opus 5 особенно сильно выступает в бенчмарке AA-Briefcase, который измеряет, насколько хорошо модели ИИ справляются с типичными офисными задачами, такими как написание исследовательских отчетов, создание презентаций и анализ электронных таблиц на основе тысяч входных файлов. Бенчмарк оценивает производительность по корректности, качеству аналитики и качеству презентации, а затем переводит эти результаты в рейтинг Elo, похожий на шахматные рейтинги.

При максимальном рассуждении Opus 5 достигла рейтинга Elo 1720, что на 146 пунктов выше Claude Fable 5 с 1574. Три ее самых высоких уровня — max, xhigh и high — заняли первые три позиции. Вместе с Fable 5, Sonnet 5 и Opus 4.8 модели Anthropic теперь занимают значительное большинство позиций в топ-10.

Стоимость одной задачи снизилась на 20 percent до $17.79 по сравнению с $22.30 для Fable 5. Версия "xhigh" стоит $14.26 за задачу, а "high" — $10.41, менее половины стоимости Fable 5. Оба уровня при этом все еще оказались выше Fable 5 по Elo. На среднем уровне производительности Opus 5 показала Elo 1470, лишь немного уступив GPT-5.6 Sol на max с 1505. На низком уровне производительности Opus 5 набрала 1223 Elo, немного ниже GLM-5.2 на max с 1254.

Наибольший прирост Opus 5 показывает в качестве аналитики. На уровне "max" модель достигла Analytical Quality Elo 2016, почти на 300 пунктов выше Fable 5. Ее Rubric Pass Rate, который измеряет, как часто модель удовлетворяет заранее заданным стандартам качества, составил 58 percent на "max", 57.2 percent на "xhigh" и 56 percent на "high".

Качество презентации оказалось менее доминирующим. Opus 5 получила Presentation Elo 1628, примерно на 40 пунктов ниже GPT-5.6 Sol на "max", где результат составил 1666.

Более высокая производительность также требует больше времени. На уровне "max" Opus 5 тратит более 36 минут на задачу и в среднем делает 103 прохода, примерно на 50 percent дольше, чем Opus 4.8, которой требуется 24 минуты и в среднем 55 проходов. Для команд, оценивающих модель, результаты бенчмарков показывают, что лучший уровень может зависеть от того, что важнее для задачи: максимальный анализ, более быстрый результат или более низкая стоимость на задачу.