Anthropic выпустила Claude Opus 5 с контекстом 1M токенов и прежними ценами Opus
Ключевые выводы
- •Claude Opus 5 заменяет Claude Opus 4.8 при той же цене API: $5 за миллион входных токенов и $25 за миллион выходных токенов.
- •Разработчикам может потребоваться обновить приложения, поскольку thinking включено по умолчанию, а max_tokens теперь охватывает как токены рассуждения, так и текст вывода.
- •Opus 5 показала более сильные результаты, чем Opus 4.8, в нескольких бенчмарках по программированию и агентным задачам, включая FrontierBench, OSWorld 2.0 и Zapier AutomationBench.
- •Anthropic заявила, что Opus 5 обладает улучшенными кибервозможностями, но остается под теми же защитами ASL-3, которые применялись к Opus 4.8.
- •Показатели успешности prompt-injection атак снизились по сравнению с Opus 4.8 в тестах Gray Swan и браузерных средах Claude Cowork.

Сегодня Anthropic выпустила Claude Opus 5, заменив Claude Opus 4.8 в качестве флагманской модели в линейке Opus. Цены остались без изменений: $5 за миллион входных токенов и $25 за миллион выходных токенов, поэтому новый флагман сохраняет ту же ставку API, что и модель, которую он заменяет.
Anthropic описывает Opus 5 как модель, приближающуюся по уровню интеллекта к Claude Fable 5 при вдвое меньшей цене. Теперь эта модель используется по умолчанию в Claude Max и является самой мощной моделью, доступной в Claude Pro.
Изменения на уровне API
Anthropic внесла в Opus 5 несколько изменений на уровне API, которые разработчикам может потребоваться учесть перед оценкой результатов бенчмарков или переносом существующих приложений на новую модель.
Во-первых, thinking включено по умолчанию. В Opus 4.8 запросы выполнялись без thinking, если разработчики не задавали thinking: {"type": "adaptive"}. В Opus 5 тот же запрос по умолчанию использует thinking, а параметр effort управляет глубиной. Поскольку max_tokens теперь ограничивает как токены thinking, так и текст ответа, существующие лимиты токенов могут потребовать пересмотра.
Во-вторых, Anthropic внесла критическое изменение, нарушающее обратную совместимость. Запросы, в которых задано thinking: {"type": "disabled"} при effort, установленном на xhigh или max, теперь возвращают ошибку 400. Ограничение применяется к каждому запросу отдельно. Разработчикам нужно либо ограничить effort уровнем high, либо удалить поле thinking.
В-третьих, Anthropic рекомендует разработчикам убрать подсказки для проверки. Инструкции вроде “include a final verification step” теперь могут приводить к избыточной проверке, поскольку модель уже проверяет собственную работу. В руководстве Anthropic по промптингу Opus 5 описаны соответствующие схемы настройки.
Идентификатор модели — claude-opus-5. Ее контекстное окно составляет 1M токенов как по умолчанию, так и в качестве максимума; версии с меньшим контекстом нет. Максимальный вывод в синхронном Messages API составляет 128k токенов. Message Batches API поддерживает до 300k выходных токенов с beta-заголовком output-300k-2026-03-24. Минимальная длина кэшируемого промпта снижена с 1,024 до 512 токенов.
Результаты бенчмарков по программированию и агентным задачам
В FrontierBench v0.1, преемнике Terminal-Bench 2.1 с 74 задачами, Opus 5 набрала 43.3% при max effort. Opus 4.8 набрала 18.7%, тогда как Fable 5 достигла 33.7%, а GPT-5.6 Sol — 37.5%. При effort xhigh Opus 5 показала лучший результат, достигнув среднего вознаграждения 44.4%.
Одна примечательная деталь этого запуска связана с отказами по соображениям безопасности. Классификаторы безопасности Opus 5 пометили и отклонили 5% API-вызовов в 4% испытаний. Классификаторы Fable 5 пометили 42% вызовов в 26% испытаний.
Opus 5 набрала 96.0% в SWE-bench Verified и 79.2% в SWE-bench Pro. Fable 5 сохранила небольшое преимущество в SWE-bench Pro с результатом 80.0%. В SWE-bench Multimodal Opus 5 улучшила показатель с 38.4% до 59.4%.
Наиболее заметные улучшения проявились в агентных оценках, где модели должны работать в программных средах, а не отвечать на один статический запрос. Opus 5 достигла 70.57% в OSWorld 2.0 по сравнению с 55.7% у Opus 4.8. В Zapier AutomationBench она набрала 26.0% против 17.0% у Opus 4.8 и 17.4% у Fable 5. При medium effort Opus 5 по-прежнему набрала 24% при стоимости $0.89 за задачу.
В Artificial Analysis GDPval-AA v2 Opus 5 заняла две верхние позиции в таблице лидеров с ELO 1861 и 1827. Конфигурация xhigh превзошла все остальные модели, используя при этом на 25% меньше выходных токенов, чем max.
Результаты по рассуждению и ARC-AGI-3
Anthropic протестировала Opus 5 на всех шести задачах IMO 2026 без инструментов и без агентной обвязки. Судейская панель из трех моделей оценила все 24 сгенерированных решения как правильные. Люди-эксперты отдельно оценили по одному заранее выбранному решению для каждой задачи на 7/7. Итоговый результат 42/42 соответствует уровню золотой медали и превышает порог 29/42.
ARC Prize Foundation сообщила о подтвержденном результате Opus 5 в 30.16% на ARC-AGI-3 при high effort. Это примерно в четыре раза выше лучшего ранее опубликованного результата в таблице лидеров. GPT-5.6 Sol достигла 7.78%, а Opus 4.8 — 1.52%. Результаты Opus 5 при max effort на момент релиза были недоступны.
В Humanity’s Last Exam Opus 5 набрала 56.3% без инструментов и 64.7% с инструментами.
Использование инструментов в мультимодальных задачах
Мультимодальные результаты Anthropic указывают, что агентное использование инструментов масштабирует вычисления на этапе тестирования экономически эффективнее, чем одно лишь adaptive thinking.
В Chartography Opus 5 набрала 29.6% без инструментов и 83.0% при использовании контейнера и инструмента для обрезки изображений. В BenchCAD Vision2Code voxel IoU вырос с 0.366 до 0.821. С инструментами Opus 5 превзошла Claude Mythos 5, которая набрала 0.678 по той же метрике.
Кибервозможности и меры безопасности
Anthropic заявила, что не обучала Opus 5 на задачах кибербезопасности. Тем не менее кибервозможности модели выросли как побочный результат более широкого улучшения способностей.
В ExploitBench Opus 5 получила среднее значение 10.14 capability flags в ветке AutoNudge и сгенерировала 99 полных эксплойтов с произвольным выполнением кода. Mythos 5 сгенерировала 132. В OSS-Fuzz Opus 5 показала ненулевой результат на 79.4% целей, тогда как Mythos 5 достигла примерно 80%. Однако Opus 5 завершила 4 полных эксплойта против 13 у Mythos 5.
Этот разрыв повлиял на дизайн защитных мер Anthropic. Opus 5 почти так же сильна, как Mythos 5, в поиске уязвимостей, но значительно слабее в их эксплуатации. В результате Anthropic разблокировала поиск уязвимостей в исходном коде. Сканирование бинарных файлов, тестирование на проникновение и генерация эксплойтов остаются заблокированными. Anthropic ожидает, что классификаторы будут вмешиваться примерно на 85% реже, чем в Fable 5. Защитники могут подать заявку в Cyber Verification Program.
UK AISI протестировал ранние контрольные точки на трех киберполигонах при 100M токенов на попытку. Opus 5 решила “The Last Ones” от начала до конца в 8 из 10 попыток. Более сложный полигон “Doing Life” она не решила, но дошла до шага 22 из 23, дальше любой протестированной модели.
В рамках Responsible Scaling Policy Anthropic рассматривает Opus 5 как модель с возможностями CB-1, но не CB-2. Anthropic применяет те же защиты ASL-3, которые использовались для Opus 4.8. Порог AI R&D не был пересечен.
Результаты по prompt injection
В бенчмарке Gray Swan по косвенным prompt injection успешность атак в пределах 15 попыток снизилась с 5.5% на Opus 4.8 до 2.0% на Opus 5. Mythos 5 показала 2.6%, а GPT-5.6 Sol — 20.0%.
В браузерных средах, запускаемых через Claude Cowork, успешность атак снизилась с 31.5% на Opus 4.8 до 3.70% на Opus 5. Этот результат измерялся без применения защитных мер. При включенном auto mode успешность атак достигла 0% во всех 129 средах.
Источники, приведенные в оригинальном отчете, включают публикацию Anthropic о запуске, Claude Opus 5 System Card, Что нового в Claude Opus 5, TechCrunch, а также независимый обзор CodeRabbit.