Anthropic Claude Opus 5 возглавил бенчмарк ARC-AGI-3 с результатом 30.2%
Ключевые выводы
- •Claude Opus 5 набрала 30.2% в ARC-AGI-3 по сравнению с предыдущим рекордом OpenAI GPT-5.6 Sol (Max) в 7.8%.
- •ARC Prize сообщил, что Opus 5 решила пять ранее нерешенных сред, включая четыре на уровне человека или выше.
- •ARC-AGI-3 оценивает самостоятельную способность модели выводить правила, планировать действия и решать незнакомые интерактивные среды без помощи внешнего программного обеспечения.
- •Opus 5 также повторила прежние лучшие результаты в ARC-AGI-2 и ARC-AGI-1, достигнув 90.4% и 97.5% соответственно, хотя и при несколько более высоких затратах.
- •На закрытом бенчмарке Witness Opus 5 набрала 43.4 и показала более ограниченный прирост, статистически сравнявшись с Kimi K3 и Fable 5.

Claude Opus 5 от Anthropic стала самой результативной моделью в ARC-AGI-3 — бенчмарке, предназначенном для проверки того, могут ли ИИ-системы решать незнакомые задачи, а не полагаться на сохраненные знания или шаблоны, встречавшиеся во время обучения.
По данным ARC Prize, Claude Opus 5 набрала 30.2 percent в ARC-AGI-3 — почти в четыре раза больше предыдущего рекорда в 7.8 percent, установленного OpenAI GPT-5.6 Sol (Max). Этот результат также ставит Opus 5 выше моделей Anthropic "Fable-class", которые, по данным ARC Prize, достигали около 20 percent.
Opus 5 решила пять сред, которые ранее не были решены, включая четыре на уровне человека или выше. Теперь решены шесть из 25 публичных демонстрационных сред. ARC Prize опубликовала полные результаты, карточку оценки и код для бенчмаркинга.
Анализ ARC Prize связывает лидерство Opus 5 с более сильным логическим рассуждением, "which enables more autonomous exploration, planning, and execution across unfamiliar environments." Во время тестирования исследователи также наблюдали поведение, которое, по их словам, ранее не проявлялось у ИИ-моделей, включая перевод задач в алгебраическую нотацию и самостоятельную формулировку уравнений отражения.
На более старых версиях бенчмарка Opus 5 достигла 90.4 percent в ARC-AGI-2 и 97.5 percent в ARC-AGI-1. ARC Prize заявила, что оба результата соответствуют прежним лучшим показателям, хотя и при несколько более высоких затратах.
ARC-AGI-3 сосредоточен на незнакомых интерактивных задачах
ARC-AGI-3 измеряет, насколько хорошо ИИ-модели справляются с новыми задачами, с которыми они не сталкивались во время обучения, включая задачи, которые люди обычно решают без особых трудностей. Текущая версия устроена как игра: модель должна вывести правила интерактивной среды, спланировать действия и выполнить их шаг за шагом.
Бенчмарк предназначен для проверки общего рассуждения, а не запомненных знаний. ARC Prize различает самостоятельную производительность модели и системы, использующие дополнительное программное обеспечение, известное как harness. Некоторые ИИ-системы, возможно, уже прошли бенчмарк с такой внешней помощью, но официальные оценки учитывают только собственную производительность языковой модели. ARC Prize утверждает, что будущим AGI-системам не должна требоваться внешняя помощь для решения новых задач. В статье отмечается, что Opus 5, вероятно, получила бы более высокий результат при использовании внутри Claude Code.
Это различие важно для сравнения заявлений о бенчмарках, поскольку система с поддержкой может объединять языковую модель с инструментами, вспомогательными структурами или другой поддержкой выполнения, тогда как официальный рейтинг ARC-AGI-3 призван изолировать собственную способность модели исследовать и решать новые среды.
Независимые тесты указывают на более ограниченный прирост
Anthropic не объяснила это улучшение. В исходной статье говорится, что целевая разметка данных и обучение с подкреплением являются вероятными факторами, при этом отмечается, что Opus 5 была разработана после того, как ARC-AGI-3 и его формат стали публичными. Эти сроки могли позволить Anthropic сосредоточиться на навыках и форматах головоломок бенчмарка, хотя это не доказывает, что компания обучала модель на точных задачах.
Разметчики могли помечать цепочки рассуждений, полезные действия, неудачные попытки и шаги восстановления из похожих головоломок. Затем обучение с подкреплением могло вознаграждать исследование, планирование, выявление правил и самокоррекцию.
Тесты на Witness, закрытом бенчмарке Guanghan Ning для интерактивных игр-головоломок, указывают на более ограниченные улучшения. Opus 5 набрала 43.4, статистически сравнявшись с Kimi K3 и Fable 5, при этом улучшение относительно Opus 4.8 было намного меньше, чем в ARC-AGI-3. В этих тестах Opus 5 выявила скрытые правила обычной головоломки до совершения каких-либо действий, но уступила Opus 4.8 в игре с менее знакомой механикой.
Ning сказал, что такая картина согласуется с обучением на данных, специфичных для жанра, хотя Witness не может определить, какие данные использовала Anthropic. Его комментарии были опубликованы в X по адресу https://x.com/quietnning/status/2080786711861407883.
Greg Kamradt, один из исследователей, стоящих за ARC-AGI-3, сказал, что результаты не исключают более широких улучшений в рассуждении. Игра, построенная на знакомых механиках, не проверяет адаптацию к новизне, а один слабый результат не перевешивает общее улучшение модели без подробных оценок по этой задаче. Комментарии Kamradt были опубликованы в X по адресу https://x.com/GregKamradt/status/2081031602596200614.
Witness также был разработан вокруг головоломок в стиле ARC-AGI-3, поэтому более высокая производительность может отражать реальный перенос навыков, а не запоминание. Позднее Ning уточнил, что Opus 5 действительно обобщалась на Witness, но значительно слабее, чем на ARC-AGI-3. Он сравнил этот процесс с эволюцией бенчмарков для программирования, заявив, что как важная цель для интерактивного рассуждения ARC-AGI-3, вероятно, первым привлечет наибольшие усилия по обучению.
Ning сказал, что охват большего числа граничных случаев затем может помочь моделям обобщаться на более широкий спектр задач абстрактного рассуждения. Он сравнил эту закономерность с программированием, где развитие прошло путь от насыщенных бенчмарков, таких как HumanEval, к часто обновляемым соревнованиям и современным агентам для написания кода. Его последующее уточнение было опубликовано по адресу https://x.com/quietnning/status/2081073990614061084.