НовостиАкцииAnthropic выпустила Claude Opus 5.5, сравнимый с флагманом Fable 5.1 и на 60% дешевле

Anthropic выпустила Claude Opus 5.5, сравнимый с флагманом Fable 5.1 и на 60% дешевле

Автор: Decrypt·

Ключевые выводы

  • •Цены Opus 5.5 — $4 за входные и $20 за выходные токены за миллион — на 20% ниже, чем у предшественницы, и на 60% ниже, чем у флагмана Fable 5.1; стоимость чтений из кэша снизилась на 60% до $0,20 за миллион токенов.
  • •По бенчмаркам Anthropic, Opus 5.5 опережает как Fable 5.1, так и Opus 5 в тестах по программированию и когнитивной работе, включая уровень выполнения 66,4% в Terminal-Bench 4.0 и рейтинг Elo 1846 в GDPval-AA v2.1.
  • •GPT-6 A по-прежнему опережает Opus 5.5 в AutomationBench — 41,4% против 40,0% — и в Terminal-Bench-Science 0.1 — 64,6% против 58,7%.
  • •Модель выпущена с теми же мерами защиты в области кибербезопасности и биологии, что и Fable 5.1; большинство задач по кибербезопасности по-прежнему автоматически перенаправляются на более старую Opus 4.8.
  • •Opus 5.5 — третья флагманская модель, выпущенная Anthropic с лета, вышедшая после публикации генеральным директором Дарио Амодеи эссе с призывом к отрасли замедлить темпы роста возможностей ИИ.
Anthropic выпустила Claude Opus 5.5, сравнимый с флагманом Fable 5.1 и на 60% дешевле

Anthropic выпустила Claude Opus 5.5 во вторник — первую модель того, что компания называет линейкой Claude 5.5. Модель стоит $4 и $20 за миллион входных и выходных токенов — на 40% дешевле Opus 5 при настройках по умолчанию — и, по словам Anthropic, не уступает Claude Fable 5.1, самому дорогому флагману компании, в большинстве задач.

По собственным данным Anthropic, Opus 5.5 опережает как Fable 5.1, так и предшественника Opus 5 в тестах по программированию и когнитивной работе, хотя GPT-6 Astra всё ещё превосходит её в AutomationBench и Terminal-Bench-Science 0.1. Новая модель запускается с теми же мерами защиты в области кибербезопасности и биологии, что и Fable 5.1.

Релиз оказывается дешевле как заменяемой модели, так и флагмана, которого она догоняет: работа Opus 5.5 обходится на 20% дешевле, чем Opus 5, и на 60% дешевле, чем Fable 5.1 — передовое предложение компании.

Модель — самая продвинутая у Anthropic как по версии (5.5 против 5.1 у Fable), так и по уровню линейки: Opus — крупнейшая публично доступная модель, за ней следует Sonnet, а Haiku — самая маленькая. Anthropic признаёт, что реальный разрыв между Fable и Opus меньше, чем показывают бенчмарки, однако публичная доступность Opus по платным подпискам и более низкая стоимость за токен делают её очевидным выбором для большинства пользователей Claude.

В этом году две продуктовые линии поочерёдно занимали лидирующие позиции. Opus 5 вышла в июле, предлагая более низкие цены и лучшие результаты, чем Fable 5, в большинстве бенчмарков. Fable 5.1 появилась в начале сентября и переломила ситуацию, обойдя Opus 5 во всех опубликованных Anthropic бенчмарках. Opus 5.5 снова сокращает разрыв — на этот раз за счёт цены, а не показателей.

Lovable, платформа для разработчиков, протестировавшая Opus 5 в собственных тестах по программированию в июле, заявила в комментарии, распространённом Anthropic, что прежняя модель быластабильнее, с гораздо меньшими колебаниями между запусками», чем её предшественники — тот же аргумент об эффективности, который Anthropic выдвигает и сейчас.

Opus 5.5 — также первая модель, выпущенная Anthropic с тех пор, как генеральный директор Дарио Амодеи опубликовал эссе с призывом к отрасли замедлиться, утверждая, что рост возможностей ИИ опережает тестирование безопасности, призванное их сдерживать. «Мы должны замедлить темпы, с которыми мы улучшаем возможности моделей ИИ», — написал Амодеи в начале этого месяца. С лета Anthropic выпустила три флагманские модели — Opus 5 в июле, Fable 5.1 в начале сентября и Opus 5.5 во вторник — именно тот темп, который эссе предлагает замедлить.

Большую часть этого прогресса Anthropic измеряет через агентное программирование — работу, выполняемую ИИ-агентом, моделью, которая самостоятельно предпринимает многошаговые действия, а не просто отвечает на один запрос.

В Terminal-Bench 4.0, который проверяет, способен ли агент выполнить сложные профессиональные задачи в интерфейсе командной строки и оценивает результат как процент выполненных задач, Opus 5.5 показала 66,4%, опередив Fable 5.1 с 55,8% и GPT-6 Astra с 57,9%. FrontierCode, который проверяет, будут ли изменения кода агента действительно приняты в реальный инженерный пайплайн по той же системе оценки прохождения, поставил Opus 5.5 на 54,4% против 50,3% у Fable 5.1.

В GDPval-AA v2.1, который оценивает реальную профессиональную работу в 44 профессиях с помощью Elo — шахматной системы ранжирования, измеряющей относительный уровень мастерства, а не просто процент, — Opus 5.5 набрала 1846 против 1735 у Fable 5.1 и 1708 у Opus 5.

Opus 5.5 лидирует не везде. В AutomationBench — бенчмарке, созданном Zapier, который проверяет, может ли агент провести полный бизнес-процесс от начала до конца без помощи человека, — GPT-6 Astra с 41,4% немного опережает Opus 5.5 с 40,0%. В Terminal-Bench-Science 0.1, который проверяет агентные научные исследования в среде командной строки по той же методике оценки прохождения, Astra с 64,6% обходит Opus 5.5 с 58,7% с большим отрывом.

Главное преимущество — стоимость. Входные токены — фрагменты текста, которые модель читает и записывает, с ценой за миллион, — теперь стоят $4 для Opus 5.5 против $5 у Opus 5, а выходные токены подешевели с $25 до $20. Чтения из кэша — повторное использование уже обработанного моделью контекста вместо повторной обработки с нуля, формирующие большую часть затрат при длительных агентных сессиях программирования, — снизились на 60% до $0,20 за миллион токенов. Такая структура делает скидку составной там, где это важнее всего: длительные агентные сессии тарифицируются в основном по чтениям из кэша, поэтому максимальное снижение приходится на крупнейшую статью расходов.

Поскольку Opus 5.5 по этим двум возможностям соответствует моделям класса Mythos — самому ограниченному уровню Anthropic, зарезервированному для проверенных исследователей в области кибербезопасности биологии, — она запускается с теми же мерами защиты, что и Fable 5.1. Большинство задач по кибербезопасности по-прежнему автоматически перенаправляются на более старую Opus 4.8 — практика, на которую многие разработчики и пользователи ранее жаловались. Остаётся неизвестным, изменит ли выход Opus 5.5 такое перенаправление.

Opus 5.5 уже доступна на платформах Anthropic, включая Amazon Web Services, Google Cloud и Microsoft Azure. В ближайшие недели, по словам Anthropic, последуют Sonnet 5.5 и Haiku 5.5 с таким же снижением цен по всей линейке.