НовостиМакроAnthropic заявляет, что Claude Opus 5 приближается к производительности Fable 5 при вдвое меньшей цене токенов

Anthropic заявляет, что Claude Opus 5 приближается к производительности Fable 5 при вдвое меньшей цене токенов

Автор: The Decoder·

Ключевые выводы

  • Claude Opus 5 сохраняет те же тарифы на токены, что и ее предшественница: $5 за миллион входных токенов и $25 за миллион выходных токенов, при этом становится моделью по умолчанию в Claude Max и самой мощной опцией в Claude Pro.
  • Opus 5 лидирует в нескольких бенчмарках, включая Frontier-Bench v0.1 для агентного кодирования в терминале с результатом 43.3% и ARC-AGI-3 с 30.2%, но уступает GPT-5.6 Sol в DeepSWE и отстает от Mythos 5 в задачах кибербезопасности.
  • Модель может самокорректироваться через итеративные шаги и писать код для создания собственных инструментов, что было продемонстрировано, когда она самостоятельно создала конвейер компьютерного зрения для реконструкции 3D-детали машины по чертежу.
  • Киберклассификаторы безопасности Opus 5 срабатывают примерно на 85% реже, чем используемые в Fable 5, что отвечает на критику разработчиков о том, что частые вмешательства Fable 5 мешали легитимному кодированию и исследованиям безопасности.
  • Настройка max показывает немного худшие результаты, чем вторая по величине настройка, на двух бенчмарках, несмотря на более высокую стоимость, что указывает: большее вычислительное усилие не гарантирует улучшения результатов модели.
Anthropic заявляет, что Claude Opus 5 приближается к производительности Fable 5 при вдвое меньшей цене токенов

Anthropic позиционирует свою новую флагманскую модель Claude Opus 5 как более дешевую альтернативу Claude Fable 5, заявляя, что модель приближается к производительности Fable 5 и превосходит ее в нескольких бенчмарках. Релиз выходит на фоне интенсивной конкуренции ИИ-лабораторий как по возможностям, так и по стоимости, а корпоративные клиенты все чаще оценивают соотношение цены и производительности при выборе моделей для производственных нагрузок.

Компания заявляет, что Opus 5 лидирует в тестах на агентное кодирование и работу со знаниями — двух направлениях, где бизнес наиболее активно внедряет ИИ. В ARC-AGI-3, бенчмарке, предназначенном для оценки способности решать новые задачи, Opus 5 набирает 30.2 percent, почти в четыре раза больше результата GPT-5.6 Sol.

Anthropic также утверждает, что Opus 5 может проверять и улучшать собственную работу через итеративные шаги, а также писать код для создания нужных ей инструментов. Эти возможности важны для рабочих процессов автономных агентов, где модели должны выполнять многоэтапные задачи при минимальном вмешательстве человека.

Opus 5 сохраняет цены Opus 4.8

Anthropic представляет Opus 5 на фоне растущего ценового давления со стороны GPT-5.6 Sol и китайских конкурентов. Новая модель призвана сократить разрыв по соотношению цены и производительности с более дорогой Fable 5. Opus 5 становится моделью по умолчанию в Claude Max и самой мощной моделью, предлагаемой в Claude Pro.

Модель сохраняет контекстное окно на 1 million-token и те же тарифы на токены, что и ее предшественница Opus 4.8. Anthropic взимает за Opus 5 $5 за миллион входных токенов и $25 за миллион выходных токенов. Новый Fast Mode повышает скорость в 2.5x, но удваивает цену.

Базовые тарифы на токены не полностью отражают итоговую стоимость задач, поскольку эффективность использования токенов может различаться между моделями. Opus 4.7 обходилась на 30 to 40 percent дороже за задачу, чем Opus 4.6, несмотря на то что обе модели использовали одинаковые базовые тарифы. Похожая картина недавно проявилась с Claude Sonnet 5. Это различие важно для организаций с крупномасштабными внедрениями, где разница в стоимости одной задачи накапливается на миллионах API-вызовов.

Более высокие настройки усилия могут стоить дороже без улучшения результатов

Пользователи могут балансировать производительность и расход токенов с помощью пяти настроек усилия: low, medium, high, xhigh и max. Anthropic заявляет, что Opus 5 обеспечивает лучшую ценность, чем предшественница, на каждом уровне усилия.

В своем руководстве по промптингу Anthropic рекомендует широко использовать настройки "low" и "medium". Компания утверждает, что эти настройки дают хорошие результаты при значительно меньшем расходе токенов и задержке, одновременно превосходя те же настройки в более ранних моделях Opus. Для задач кодирования и агентных задач Anthropic по-прежнему рекомендует начинать с "xhigh."

На двух бенчмарках Opus 5 показывает немного худшие результаты при настройке max, чем при второй по величине настройке, хотя max стоит дороже. Снижение наблюдается в Frontier-Bench v0.1 и Artificial Analysis Coding Agent Index. Этот результат подчеркивает, что более высокие вычислительные затраты не гарантируют более качественные ответы, что важно для команд, оптимизирующих баланс стоимости и качества.

Бенчмарки Anthropic показывают преимущество Opus 5 в агентном кодировании

Согласно собственным результатам бенчмарков Anthropic, Opus 5 устанавливает рекорды в нескольких оценках. В Frontier-Bench v0.1 она достигает 43.3 percent в агентном кодировании в терминале, опережая Fable 5 с 33.7 percent, GPT-5.6 Sol с 34.4 percent и Opus 4.8 с 21.1 percent.

В бенчмарке работы со знаниями GDPval-AA v2 Opus 5 лидирует с рейтингом Elo 1,861. Fable 5 набирает 1,747, а GPT-5.6 Sol — 1,736.

Opus 5 лидирует не во всех тестах. В DeepSWE v1.1, который измеряет агентное кодирование, GPT-5.6 Sol занимает первое место с 72.7 percent, за ним следуют Fable 5 с 69.7 percent и Opus 5 с 68.8 percent. В медицинских задачах и юридических бенчмарках Fable 5 и Mythos 5 соответственно превосходят Opus 5. Смешанные результаты показывают, что лидерство моделей зависит от домена, поэтому выбор модели для корпоративных покупателей определяется конкретной задачей.

Результат ARC-AGI-3 является одним из крупнейших выбросов в наборе бенчмарков Anthropic. ARC-AGI-3 оценивает решение новых задач без опоры на запомненные шаблоны. Opus 5 набирает 30.2 percent против 1.5 percent у Opus 4.8 и 7.8 percent у GPT-5.6 Sol. Это ставит Opus 5 почти в четыре раза выше следующей лучшей модели в приведенных результатах. Anthropic не указывает результат Fable 5 для этого бенчмарка, и пока неясно, перейдет ли такое значительное преимущество в бенчмарке в реальное использование.

Opus 5 уступает Mythos 5 в задачах кибербезопасности. Anthropic заявляет, что намеренно не обучала Opus 5 на киберзадачах, как и в случае с ее предшественницей. Модель приближается к Mythos 5 в поиске уязвимостей, но показывает значительно более слабые результаты, когда ее просят их эксплуатировать.

Anthropic также утверждает, что Opus 5 улучшила генерацию визуальных результатов и анализ визуального контента, включая графики и диаграммы.

Anthropic заявляет, что Opus 5 может создавать собственные инструменты

Anthropic описывает Opus 5 как существенно более сильную в проверке собственной работы и ее улучшении через итерации. Такой тип самокоррекции становится все более важным направлением для ИИ-лабораторий, создающих автономных агентов, поскольку способность обнаруживать и исправлять ошибки без указаний человека определяет, сможет ли модель справляться со сложными задачами открытого типа.

В одной из задач Frontier-Bench Opus 5 получила чертеж детали машины и должна была создать 3D-модель в FreeCAD. Модель намеренно не получила прямого способа просмотреть чертеж.

По словам Anthropic, Opus 5 написала собственный конвейер компьютерного зрения для извлечения геометрии из сырых пикселей, а затем реконструировала полную деталь машины. Компания заявляет, что ни одна другая модель не решила эту задачу после пяти попыток.

Opus 5 также работала над реальным багом в популярном пакетном менеджере с открытым исходным кодом. Anthropic утверждает, что модель определила первопричину и исправила пограничный случай, который пропустил патч сообщества. Конкурирующая модель исправила только поверхностный симптом, прежде чем отметить баг как устраненный.

Anthropic также сообщает, что инженер трейдинговой компании использовал Opus 5, чтобы за одну сессию создать поток рыночных данных для новой биржи. Более ранние модели не могли завершить задачу даже при наличии подробных планов.

Киберфильтры срабатывают реже, чем в Fable 5

Anthropic заявляет, что система безопасности Opus 5 разрешает исследование уязвимостей исходного кода, но блокирует сканирование уязвимостей на основе бинарных файлов, тестирование на проникновение и генерацию эксплойтов. Ее киберклассификаторы срабатывают примерно на 85 percent реже, чем используемые в Fable 5. Частые вмешательства Fable 5 вызвали резкую критику со стороны разработчиков, которые сообщали о прерываниях рабочих процессов при легитимных задачах кодирования и исследований безопасности.

Заблокированные запросы в Claude.ai, Claude Code и Claude Cowork по умолчанию перенаправляются на Opus 4.8 — тот же подход Anthropic использовала с Fable 5.

Anthropic называет Opus 5 самой мощной общедоступной моделью для научных исследований. Компания заявляет, что модель превосходит Opus 4.8 во всех оценках по наукам о жизни, с заметным прогрессом в органической химии и задачах, связанных с белками. В органической химии Opus 5 улучшает результат на 10.2 процентного пункта в выводе молекулярных структур по данным спектроскопии. В задачах, связанных с белками, улучшение составляет 7.7 процентного пункта.

Вместе с Opus 5 Anthropic также выпускает две бета-функции. Mid-Conversation Tool Changes на Claude Platform позволяют разработчикам менять доступные инструменты в ходе разговора без аннулирования кэша промпта. Automatic Fallbacks в API автоматически перенаправляет заблокированные запросы на другую модель. Обе функции отражают усилия Anthropic по снижению проблем разработчиков, связанных с непрерывностью и надежностью рабочих процессов.