НовостиМакроxAI выпускает Grok 4.7 с новыми механизмами защиты и более высокими результатами в многочасовых задачах

xAI выпускает Grok 4.7 с новыми механизмами защиты и более высокими результатами в многочасовых задачах

Автор: Metaverse Post·

Ключевые выводы

  • •Grok 4.7 построена на новой, более крупной базовой модели и обучена с помощью расширенного цикла обучения с подкреплением на более сложных задачах, что, по словам xAI, улучшает генерацию кода, работу с длинным контекстом и самопроверку.
  • •Наибольший прирост показателей модели пришёлся на длительные задачи программирования и терминальной работы: Terminal-Bench 4.0 вырос до 38,0% с 20,3%, а CursorBench 4.0 — до 46,3% с40,4%.
  • •Grok 4.7 оснащена совершенно новым стеком безопасности, который xAI описала как самый сильный из протестированных в части отказов и устойчивости к джейлбрейкам; модель лидирует в тесте на биобезопасность LatchBio с результатом 62,4%.
  • •Цены остаются на уровне Grok 4.6 — 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов, что ниже ставок GPT-5.6 Sol и Fable 5.1.
  • •Artificial Analysis оценила Grok 4.7 в 46 баллов в Intelligence Index — на два балла выше, что ставит SpaceXAI в число четырёх ведущих ИИ-лабораторий, но установила, что модель использует около 81 000 выходных токенов на задачу, более чем вдвое больше, чем 36 000 у Grok 4.6, что повышает фактическую стоимость.
xAI выпускает Grok 4.7 с новыми механизмами защиты и более высокими результатами в многочасовых задачах

xAI выпустила Grok 4.7, описывая её как свою самую способную модель на сегодняшний день для программирования и работы со знаниями. Компания позиционировала модель как решение передового уровня по конкурентной цене, при этом цены остались на уровне предшественника, Grok 4.6.

Grok 4.7 построена на новой, более крупной базовой модели и обучена с помощью расширенного цикла обучения с подкреплением на более сложном наборе задач с упором на проблемы, требующие многих часов на выполнение. По словам xAI, изменения в обучении улучшили генерацию кода, работу с длинным контекстом и самопроверку. Модель также изначально понимает окружение Grok Bot, что, как сообщила компания, делает её более эффективной в диалоговых задачах и общей работе со знаниями.

Наибольший заявленный прирост сосредоточен в более длительных задачах программирования и терминальной работы. На CursorBench 4.0 Grok 4.7 набрала 46,3% против 40,4% у Grok 4.6. Её результат превысил 41,7% у GPT-5.6 Sol, но остался ниже 51,8% у Fable 5.1. В режиме высокой нагрузки на DeepSWE v1.1 Grok 4.7 набрала 71,0%, уступая GPT-5.6 Sol с 72,7% и незначительно опережая Fable 5.1 с 70,0%.

Модель также превзошла Grok 4.6 на GDPval и AA Briefcase, где оцениваются многочасовые офисные задачи, выполняемые специалистами, включая юристов, медсестёр и финансовых аналитиков. На AA Briefcase Grok 4.7 набрала 1 657, что близко к 1 678 у Fable 5.1. Наиболее заметный рост показателей пришёлся на Terminal-Bench 4.0, измеряющий многочасовую терминальную работу: результат Grok 4.7 вырос с ,3% у Grok 4.6 до 38,0%.

На HackerBench v0.3, охватывающем рискованные киберзадачи, модель пропустила лишь 3,3% опасных запросов двойного назначения, при этом редко блокируя легитимную работу по безопасности.

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026

https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw

Новый стек безопасности и неизменные цены

Центральной особенностью релиза является стек безопасности Grok 4.7, который xAI описала как полностью новый и самый сильный из протестированных компанией в части отказов и устойчивости к джейлбрейкам. Модель лидирует в тесте на биобезопасность LatchBio с результатом 62,4%, сочетая эффективность на безопасных задачах с отказами на опасных запросах в областях двойного назначения, таких как кибербезопасность и биологические исследования. xAI также начала предоставлять избранным партнёрам в области кибербезопасности доступ по приглашению к возможностям red-team модели для оборонных исследований.

Grok 4.7 доступна по тем же тарифам, что и Grok 4.6: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов. Эти ставки ниже цен GPT-5.6 Sol — 4 и 20 долларов соответственно — и цен Fable 5.1 — 10 и 50 долларов. Быстрая версия с удвоенной скоростью вывода доступна по двойной цене. Плоские тарифы за токен упрощают сравнение по прайсу, хотя общая стоимость длительной работы также зависит от количества токенов, которые модель потребляет для завершения задачи.

На границе цена-производительность CursorBench такой прайсинг помещает Grok 4.7 в число наиболее экономически эффективных вариантов для продолжительных рабочих нагрузок программирования. Модель сразу доступна в Cursor и Grok Build, а также через Grok API, сторонние среды программирования, маршрутизаторы моделей и облачные платформы.

Релиз усиливает конкуренцию среди поставщиков моделей переднего края, которые всё чаще сравнивают системы по длительным агентным задачам, калибровке безопасности и стоимости за выполненную задачу, а не только по итогам бенчмарков. Для разработчиков и предприятий, оценивающих модели, ориентированные на программирование, Grok 4.7 сочетает стабильные цены с более высокими результатами в многочасовых задачах и новыми механизмами защиты.

Artificial Analysis подтверждает улучшения, но указывает на потребление токенов

Независимая бенчмарк-фирма Artificial Analysis также оценила Grok 4.7, присвоив ей 46 баллов в Intelligence Index. Это на два балла выше, чем у Grok 4.6, и, по данным фирмы, ставит SpaceXAI в число четырёх ведущих ИИ-лабораторий. Внешняя оценка согласуется с позицией xAI, представляющей релиз как шаг вперёд в программировании и работе со знаниями.

Оценкаилась при уровне рассуждений xhigh и выявила наиболее явный прогресс в долгосрочной агентной работе со знаниями. На частном бенчмарке AA-Briefcase от Artificial Analysis Grok 4.7 прибавила 111 очков Elo к результату предшественницы, достигнув 1 657, что ставит её в один ряд с Claude Opus 5 и Claude Fable 5.1 на переднем крае. Рост был обусловлен главным образом аналитическим качеством, которое выросло с 1 690 до 1 994 Elo. Качество представления осталось примерно на том же уровне.

На GDPval-AA, измеряющем практические рабочие продукты, такие как документы, таблицы и слайды, Grok 4.7 набрала 1 695 Elo, прибавив 90 очков.

Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026

https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw

Artificial Analysis установила, что улучшения производительности потребовали значительно больше вычислений. При уровне xhigh Grok 4.7 использовала около 81 000 выходных токенов на задачу Intelligence Index — более чем вдвое больше, чем 36 000 токенов у Grok 4.6, и почти втрое больше, чем 27 000 токенов, потреблённых GPT-6 Astra при максимальной нагрузке. Поскольку тарифы за токен не изменились, такой повышенный расход увеличивает фактическую стоимость сопоставимой задачи, даже несмотря на то, что заявленные цены остались прежними.

Фирма также сообщила о скромных дополнительных улучшениях на Terminal-Bench 4.0 и GDP.pdf, а также о небольших регрессиях на AA-LCR и AutomationBench-AA. Надёжность умеренно улучшилась: уровень галлюцинаций в AA-Omniscience снизился с 34% до 29%, при этом точность осталась практически неизменной — 47%.

Остальные технические характеристики остались такими же, как у предыдущего поколения, включая неизменное контекстное окно в 500 000 токенов. Тарифы на попадания в кэш снижены до $0,50 за миллион токенов. С запуском модели в Cursor, Grok Build, Grok API, сторонних средах, маршрутизаторах моделей и облачных платформах разработчики теперь могут сами сопоставить прирост показателей с более высоким потреблением токенов на своих рабочих нагрузках. Оригинальный отчёт доступен на Metaverse Post.