SpaceXAI Илона Маска выпускает Grok 4.7 с результатом 71% в бенчмарке DeepSWE
Ключевые выводы
- •SpaceXAI выпустила Grok 4.7 21 сентября, описав его как самую мощную модель компании для программирования и работы со знаниями, с обучением, ориентированным на задачи, занимающие несколько часов.
- •Модель запускается по $2 за миллион входных и $6 за миллион выходных токенов — как Grok 4.6 и значительно ниже GPT-5.6 Sol ($4/$20) и Fable 5.1 ($10/$50).
- •По опубликованным SpaceXAI бенчмаркам Grok 4.7 набрал 71,0% в DeepSWE v1.1, поднял результат в Terminal-Bench 4.0 с 20,3% до 38,0%, лидирует в EEBench и бенчмарке Harvey, уступая Fable 5.1 в CursorBench 4.0 и HealthBench Professional.
- •Переранный стек безопасности заблокировал все, кроме 3,3% высокорисковых двусторонних запросов в HackerBench v0.3, с редкими ложными отказами; избранные партнеры по кибербезопасности получили доступ к ред-тимингу по приглашениям.
- •За несколько часов до релиза три конфигурации Grok 4.6 проиграли всем конфигурациям Codex и Claude в Brood War Bench Бена Сврдлоу с лучшим результатом 2 победы из 18 матчей; Grok 4.7 пока не ранжирован.

Grok 4.7 ориентирован на многочасовые задачи
SpaceXAI, подразделение искусственного интеллекта Илона Маска, выпустила Grok 4.7 21 сентября, описав его как самую мощную на сегодняшний день модель компании для программирования и работы со знаниями. Согласно официальному анонсу, новая система построена на более крупной базовой модели, чем Grok 4.6, и прошла более длительные циклы обучения с подкреплением на более сложных наборах задач с осознанным акцентом на проблемы, решение которых занимает несколько часов.
Компания выстроила презентацию релиза вокруг выносливости. Если предыдущие модели отвечали за считанные минуты, то Grok 4.7 настроен на выполнение задач, которые заняли бы у инженера или аналитика несколько часов. SpaceXAI заявила, что модель заметно лучше проверяет собственные результаты на длинных прогонах, работает с очень длинными контекстными окнами (объем текста, который модель может удерживать в рабочем поле одновременно) и нативно управляет агентским фреймворком Grok Bot — многошаговой конфигурацией, в которой модель планирует, вызывает инструменты и выполняет работу самостоятельно, а не отвечает на единичный запрос. Эти улучшения, по словам компании, проявляются в диалогах, задачах общих знаний и создании профессиональных документов и презентаций.
По опубликованным бенчмаркам конфигурация xhigh находится на уровне переднего края. В DeepSWE v1.1, наборе тестов по программной инженерии, Grok 4.7 набрал 71,0%, оперив Fable 5.1 max с 70,0% и уступив только GPT-5.6 Sol max с 727%. В Terminal-Bench 4.0, оценивающем многочасовую работу в терминале, модель улучшила результат с 20,3% у предшественницы до 38,0%. В наборах, моделирующих многочасовую профессиональную работу юристов, медсестер и финансовых аналитиков — среди них AA Briefcase и HealthBench — SpaceXAI заявила, что Grok 4.7 теперь находится на уровне лучших в отрасли.
Второе ключевое заявление касается безопасности. Переработанный стек безопасности делает эту версию самой устойчивой в истории компании к отказам в неправомерных запросах и попыткам обхода защиты (jailbreak) — попыткам убедить модель преступить ее защитные механизмы. В HackerBench v0.3, тестирующем вредоносные киберзадачи, лишь 3,3% высокорисковых двусторонних запросов — запросов, имеющих как легитимное, так и вредоносное применение, — прошли фильтр при незначительном числе ложных отказов в легитимной оборонительной работе по безопасности. Избранные партнеры по кибербезопасности получили доступ по приглашениям к ред-тимингу — состязательному тестированию, в котором исследователи безопасности ищут уязвимости системы, — в поддержку исследований в области обороны.
Модель уже доступна через Cursor, Grok Build, API Grok, крупные облачные платформы и маршрутизаторы моделей — сервисы, передающие запрос разработчика выбранной им ИИ-модели через единый интерфейс.
Цены на уровне $2 сохранены, пока Brood War Bench позорит Grok 4.6
Цены остались неизменными: Grok 4.7 запускается по $2 за миллион входных токенов и $6 за миллион выходных токенов — как и Grok 4.6 — плюс быстрая вариация, удваивающая скорость генерации по удвоенной цене. Токены — это единицы текста, которые языковые модели считывают и генерируют, и по ним тарифицируется API: входные — то, что отправляет разработчик, выходные — то, что модель возвращает. Тарифы ощутимо подрывают конкурентов: GPT-5.6 Sol оценивается в $4/$20 за миллион токенов, а Fable 5.1 — в $10/$50, что делает цены Grok примерно третью-половиной от уровня соперников при более быстрой генерации.
Собственная сравнительная таблица SpaceXAI показывает лидерство Grok 4.7 в электротехнике (EEBench: 64,0% против 39,4% у GPT-5.6 Sol и 56,4% у Fable 5.1) и в бенчмарке юридических агентов Harvey (19,6% против 2,5% и 6,7%), при этом модель уступает Fable 5.1 в программной инженерии (CursorBench 4.0: 46,3% против 51,8%) и в клинических рассуждениях (HealthBench Professional: 56,7% против 62,1%). Все приведенные цифры взяты из опубликованных SpaceXAI данных.
Корпоративный контекст имеет значение: SpaceXAI приобрела нынешний вид в феврале, xAI слилась со SpaceX, за чем последовало июньское приобретение Cursor — редактора кода на базе ИИ, который одновременно служит одним из каналов запуска Grok 4.7 — частью империи Маска, охватывающей Tesla (TSLA) и, согласно более ранним сообщениям, усилия по консолидации подписок на ИИ-сервисы в ближайшие недели.
Однако за несколько часов до релиза краудсорсинговый бенчмарк подпортил репутацию предшественницы. Brood War Bench разработчика Бена Сврдлоу, в котором ИИ-агенты играют в StarCraft: Brood War, распространился в X 20 сентября: 19 конфигураций от Codex, Claude и Grok провели 171 матч друг против друга, и Codex Astra выиграла все 18 своих матчей на максимальном уровне рассуждений. Три конфигурации Grok 4.6 проиграли всем конфигурациям Codex и Claude, с лучшим результатом 2 победы из 18. Стратегия в реальном времени — сложный тест для агентов, поскольку решения об экономике, производстве и бое поступают непрерывно — нет хода, на котором можно остановиться и спланировать.
Сврдлоу зафиксировал матч, в котором конфигурация Grok с максимальным рассуждением израсходовала 11 138 токенов рассуждения за 43 минуты, но выдала лишь шесть пакетов команд — и не выставила ни одной боевой единицы. Он написал, что Grok пока недостаточно умен для этой игры, а старые модели воспринимают стратегию в реальном времени как пошаговую, и добавил, что ни один участник не превысил уровень новичка. Grok 4.7 пока не ранжирован.
Мнение COINOTAG: ценовое давление — вот настоящий сигнал
Вместе цифры запуска и результаты Brood War складываются в одну историю: лаборатории переднего края теперь продают рассуждение по товарным ценам, и решает исход не статичный бенчмарк, а надежность агентов. По оценке COINOTAG, тариф $2/$6 дает Grok 4.7 токеномику, которую конкуренты вынуждены повторить — подобно тому, как фьючерсное ценообразование заставляет рынки переориентировать ожидания, — тогда как лаборатории без сопоставимых вычислительных мощностей рискуют стать выходной ликвидностью в этой ценовой войне. Издание добавило, что новости о вычислительных мощностях Маска исторически влияли на настроение в связанных с ним активах, таких как Dogecoin (DOGE), и посоветовало следить за результатами агентов Grok 4.7, а не за заявлениями о запуске.