НовостиАкцииAnthropic выпустила Claude Fable 5.1, более чем удвоив результат предшественника по ключевому бенчмарку

Anthropic выпустила Claude Fable 5.1, более чем удвоив результат предшественника по ключевому бенчмарку

Автор: Decrypt·

Ключевые выводы

  • Fable 5.1 набрал 52,6% на Terminal-Bench-Science 0.1 — более чем вдвое больше, чем 24,7% у Fable 5, и 55,8% на Terminal-Bench 4.0, опередив Opus 5 с 52,3%.
  • Стоимость чтения кэша снизилась на 75%, что сокращает типичные затраты на рабочие нагрузки примерно на 25%, а высокоагентные — до 45%, при базовой цене $10 за входные и $50 за выходные токены на миллион.
  • Fable 5.1 не входит в тарифы Pro и стандартные места Team, работающие на кредитах оплаты по факту; тарифы Max и премиальные места Team или Enterprise включают его в пределах до 50% недельных лимитов использования.
  • Mythos 5.1 использует ту же базовую модель, что и Fable 5.1, но с другими фильтрами безопасности; доступ ограничен проверенными специалистами по кибербезопасности и наукам о жизни через программы верификации Anthropic.
  • Fable 5.1 обходит Opus 5 по всем опубликованным бенчмаркам, но стоит вдвое дороже за токен: $10/$50 против $5/$25 у Opus 5 за миллион токенов.
Anthropic выпустила Claude Fable 5.1, более чем удвоив результат предшественника по ключевому бенчмарку

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 1 сентября — это первое обновление линейки моделей Mythos-класса с момента запуска Fable 5 9 июня. Новая модель набрала 52,6% на Terminal-Bench-Science 0.1 против 24,7% у Fable 5 и 55,8% на Terminal-Bench 4.0 против прежних 42,0%. Релиз продолжает тенденцию на рынке передовых моделей, где OpenAI, Google и Anthropic в этом году по очереди выпускали обновления флагманских моделей, используя разницу в заголовочных бенчмарках как главный инструмент конкуренции.

Чтение кэша теперь стоит на 75% дешевле, что сокращает типичные затраты на рабочие нагрузки примерно на 25%, а высокоагентные нагрузки — до 45%. Базовая цена не изменилась: $10 за входные и $50 за выходные токены на миллион. Кэширование промптов — повторное использование ранее обработанного ввода вместо его повторной обработки при каждом запросе — стало стандартным инструментом снижения расходов у крупных провайдеров моделей, поскольку агентные рабочие нагрузки, многократно повторяющие длинный контекст, существенно увеличивают счета.

Fable 5.1 не входит в тарифы Pro и стандартные места Team, которые работают с ним на основе кредитов использования. Тарифы Max и премиальные места Team или Enterprise включают его в пределах до 50% недельных лимитов. Это разделение важно для разработчиков, выбирающих, куда направлять рабочие нагрузки: фактическая стоимость модели зависит не только от заявленных цен за токен, но и от того, в рамках какого тарифа она работает.

Anthropic утверждает, что новые модели — «самые продвинутые в мире для программирования и интеллектуальной работы». Релиз вышел через три месяца после начала цикла запусков, который уже включал 18-дневное отключение из-за экспортного контроля, летний ценовой спор вокруг доступа по подписке и июльский выпуск Claude Opus 5, обошедшего Fable 5 по цене.

По данным Anthropic, Fable 5.1 и Mythos 5.1 — одна и та же базовая модель с разными фильтрами безопасности. Fable 5.1 общедоступен любому владельцу аккаунта Claude. Mythos 5.1 по-прежнему ограничен проверенными специалистами по кибербезопасности и наукам о жизни через программы Anthropic Cyber Verification Program и Life Sciences Verification Program — преемники трека доступа Project Glasswing, который ограничивал доступ к Mythos 5.

Что на самом деле измеряют бенчмарки

Заголовочный показатель Anthropic получен на Terminal-Bench-Science 0.1 — бенчмарке, проверяющем, может ли ИИ-агент выполнять задачи научных исследований в среде командной строки; результат оценивается как доля успешных прохождений. Fable 5.1 набрал 52,6% против 24,7% у Fable 5 и 29,0% у Opus 5 — более чем вдвое больше предшественника.

Terminal-Bench 4.0 тестирует агентное программирование через терминал — написание, запуск и отладку кода в многошаговых сессиях командной строки; результат измеряется как доля корректно выполненных задач. Fable 5.1 набрал 55,8% против 42,0% у Fable 5 и опередил Opus 5 с его 52,3%. Акцент на терминальных многошаговых задачах отражает смещение отраслевого фокуса от одноходовых диалоговых ответов к агентам, способным поддерживать длительные автономные рабочие процессы — сдвиг, сделавший агентные бенчмарки распространённой мерой в недавних релизах передовых моделей.

Mythos 5.1, работающий с более лёгкими фильтрами кибербезопасности, набрал 60,9% на том же тесте. Anthropic поясняет, что разница отражает задачи, которые её системы безопасности перехватили и перенаправили на Opus 4.8.

На Humanity's Last Exam — междисциплинарном тесте на рассуждение, составленном из вопросов экспертного уровня по десяткам академических областей и оцениваемом как доля успешных прохождений — Fable 5.1 достиг 60,9% без внешних инструментов и 65,0% с ними, в обоих случаях опередив Opus 5, что делает его самой продвинутой моделью Anthropic для академических целей.

Где он обходит Opus 5, а где расчёты становятся сложнее

Opus 5 вышел в июле по цене вдвое ниже цены Fable 5 за токен, при этом превзойдя Fable 5 по большинству основных бенчмарков, что фактически сделало флагманскую модель избыточной для большинства платных пользователей. Fable 5.1 меняет ситуацию: теперь он обходит Opus 5 по всем опубликованным Anthropic бенчмаркам, включая те, где Opus 5 ранее опережал Fable 5.

Однако Fable 5.1 по-прежнему стоит вдвое дороже за токен, чем Opus 5: $10 за входные и $50 за выходные против $5 и $25 у Opus 5. Токен — базовый объём информации, с которым может работать модель (обычно около двух третей среднего английского слова); компании платят за использование, поскольку интенсивные рабочие нагрузки быстро исчерпывают квоты в тарифах подписки. Вопрос цены против производительности — достаточно ли меньшей и дешёвой модели — покупатели теперь routinely сталкиваются в линейках всех крупных провайдеров, а не только Anthropic.

Аргументация Anthropic в пользу модели опирается на уровни усилий, а не на абсолютные показатели: компания утверждает, что запуск Fable 5.1 на низкой или средней глубине рассуждения соответствует или превосходит прежние результаты Fable 5 при значительно меньших затратах, а верхние уровни усилий стоит приберечь для задач, которые ставят в тупик всё остальное. Для рутинной работы довод в пользу полного отказа от Opus 5 слабеет по мере уменьшения уровня усилий.

Доступ следует той же схеме, что действовала для Fable 5 после месяцев корректировки условий Anthropic. На тарифах Pro и стандартных местах Team или Enterprise Fable 5.1 полностью списывается из кредитов оплаты по факту использования по тарифу API, поскольку не входит в недельные лимиты этих тарифов. На тарифах Max и премиальных местах Team или Enterprise он входит в стандартную подписку в пределах до 50% недельного использования.

Claude Fable 5.1 уже доступен на Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry под идентификатором модели "claude-fable-5-1" (Anthropic). Доступность на нескольких облачных платформах повторяет исторический подход Anthropic к распространению моделей, позволяя корпоративным клиентам запускать их в рамках существующих облачных контрактов, а не только через собственный API Anthropic.