НовостиАкцииOpenAI незаметно пересмотрела множество бенчмарк-показателей GPT-6 Astra после запуска, и некоторые цифры продолжают меняться

OpenAI незаметно пересмотрела множество бенчмарк-показателей GPT-6 Astra после запуска, и некоторые цифры продолжают меняться

Автор: Fortune Crypto·

Ключевые выводы

  • OpenAI изменила несколько бенчмарк-показателей GPT-6 Astra после публикации и повторной публикации анонсирующего поста в блоге от 3 сентября, причем некоторые правки показывали лучшую производительность Astra, а модели конкурента Anthropic выглядели хуже.
  • Заявленный уровень галлюцинаций Astra на короткое время был снижен с 4,2% до 2%, прежде чем вернуться к исходному значению, а балл Astra в ARC-AGI-3 вырос с 98,6% в эмбаржированном черновике до 99,99% в действующем блоге.
  • Результат OpenAI в ARC-AGI-3 сильно зависел от конфигурации: фонд Arc Prize Foundation независимо измерил 99,9% с мощным харнессом против 63% со стандартным харнессом.
  • OpenAI заявила, что оценочные цифры несут погрешность в несколько процентных пунктов и что она внесла исправления для отражения лучшей оценки производительности модели, тогда как некоторые эксперты выразили опасения по поводу отраслевой практики «бенчмаксинга».
  • Меняющиеся и запутанные бенчмарк-цифры могут затруднить клиентам и инвесторам оценку того, какие ИИ-модели в чем преуспевают, особенно на фоне возможного IPO OpenAI в 2027 году.
OpenAI незаметно пересмотрела множество бенчмарк-показателей GPT-6 Astra после запуска, и некоторые цифры продолжают меняться

OpenAI изменила несколько оценочных бенчмарков своей модели GPT-6 Astra с момента первой публикации анонсирующего поста в блоге во второй половине дня 3 сентября. В некоторых случаях обновленные цифры показывали лучшую производительность Astra, тогда как баллы моделей главного конкурента OpenAI — компании Anthropic — выглядели хуже.

Изменения произошли на фоне необычно проблемного запуска поста в блоге. Изначально OpenAI планировала опубликовать пост в 14:00 по восточному времени, но прошло почти два часа, прежде чем он стал широко доступен онлайн.

Когда аккаунт OpenAI в X поделился постом в 15:32, ссылка не загружалась должным образом и выдавала сообщение об ошибке. В 15:50 гендиректор OpenAI Сэм Альтман опубликовал ссылку, написав: «Мы столкнулись с небольшой заминкой при развертывании поста в блоге, но он действительно отличный». Многие комментаторы по-прежнему не могли увидеть страницу и получали ту же ошибку, как и Fortune. Когда Fortune проверила снова примерно через час, пост был виден и корректно загружался.

Позже выяснилось, что OpenAI на самом деле опубликовала блог вскоре после 14:00, но затем отозвала его по причинам, которые компания заявила, что не может раскрыть, при этом уточнив, что эти причины не связаны с показателями производительности бенчмарков. (Сначала OpenAI сообщила Fortune, что это был баг в системе управления контентом, а позже объяснила инцидент сбоем интернета.) При повторной публикации блог содержал другие оценочные метрики, которые, казалось, благоприятствовали Astra, — и некоторые цифры продолжали меняться с тех пор. Изменения зафиксированы в снимках интернет-архива, которые фиксируют страницы в определенные моменты времени и позволяют сравнивать более ранние версии поста с более поздними.

Раскрытие этих изменений происходит на фоне жесткой конкуренции в индустрии ИИ, где компании выпускают обновления своих больших языковых моделей в бешеном темпе, каждая стремясь обогнать соперников. Внимание к метрикам также подчеркивает сложность измерения производительности больших языковых моделей с помощью стандартизированных бенчмарк-тестов, а также опасения, что такие характеристики подвержены манипуляциям и играм в свою пользу.

«Мы глубоко заботимся о том, чтобы оценки были правильными», — заявил представитель OpenAI в комментарии Fortune. «Большинство оценок имеют погрешность в несколько процентных пунктов в зависимости от конкретной контрольной точки, скаффолда и прогона оценки, использованных в отчетности. Для нашего запуска мы внесли исправления, чтобы цифры отражали нашу лучшую оценку доступной производительности модели, чтобы пользователи могли делать осмысленные сравнения».

Расхождения между первой и финальной опубликованными версиями блога — и цифры продолжают меняться

Одним из наиболее заметных изменений стал заявленный уровень галлюцинаций Astra. В первом снимке интернет-архива поста, от 14:23 по восточному времени, он составлял 4,2%. Это число сохранялось еще на нескольких снимках, последний из которых — пятый — был сделан в 15:11 по восточному времени, примерно за 10 минут до того, как OpenAI опубликовала твит с финальной версией.

Однако уровень галлюцинаций вместе с четырьмя другими метриками изменился в шестом архивном снимке, сделанном в 17:20 — после того, как блог, вероятно, стал виден всем. Для Astra показатель был сокращен вдвое, до 2%. Балл предшественника Astra, GPT-5.6 Sol, также снизился с 12,2% до 9,4%. OpenAI продолжала менять эту метрику; на момент написания статьи уровни галлюцинаций вернулись к исходным 4,2% и 12,2%.

Также, похоже, OpenAI существенно повысила показатели GPT-5.6 Sol во внутренней версии кибербезопасностной оценки ExploitBench: с 5,5% в первой версии до 11,5% в более поздних. OpenAI сообщила, что в настоящее время рассматривает вопрос о возврате этой цифры к 5,5%, поскольку, по ее словам, результат 11,5% отражает уровень рассуждений, который не является коммерчески доступным для Sol.

Astra особенно сильна в математике, говорит OpenAI — качество, которое компания подчеркивает в первом абзаце страницы анонса. Хотя эта метрика для Astra не менялась в снимках — она остается на уровне 97,6% в оценке FrontierMath Tier 4 (v2), — OpenAI ненадолго изменила баллы GPT-5.6 Sol и новейшей модели Anthropic, Fable 5.1. В результате этих изменений Astra на короткое время выглядела значительно лучше в математике, чем обе модели.

В первом снимке (14:23 3 сентября) модель Fable 5.1 от Anthropic набирала 87,8%. К 17:17 показатель упал почти на 10 процентных пунктов, до 78%. Сегодня он вернулся к 83%. Аналогично, балл GPT-5.6 Sol изменялся с 83% до 80,5% и снова до 83% на сегодняшний день.

Изменения метрик начались еще до первой публикации блога в 14:00. В эмбаржированном предпубликационном черновике, который компания предоставила Fortune и другим СМИ, балл Astra в оценке ARC-AGI-3 был указан как 98,6%. В действующем блоге он теперь составляет 99,99%.

«Мы всегда проверяем оценки перед публикацией, поэтому корректировки между черновиком и финальной версией являются нормальными», — заявил тогда представитель компании. OpenAI также отметила, что создатель бенчмарка, фонд Arc Prize Foundation, обнаружил, что в независимой оценке Astra показала результат 99,9% — при условии, что модели предоставили особенно мощный харнесс (набор инструментов, которые модель может использовать для выполнения задач). Со стандартным харнессом бенчмарка результат составил 63% — все равно значительно лучше, чем у любой другой общедоступной ИИ-модели. OpenAI заявила, что «такие факторы, как харнесс, уровень рассуждений и другие, влияют на оценки». Разрыв между этими двумя цифрами ARC-AGI-3 показывает, насколько сильно заголовочное число может зависеть от конфигурации теста, при которой оно получено.

«Бенчмаксинг» — или повышение точности?

Различные исследовательские команды OpenAI отвечают за разные метрики и отвечают за их расчет и передачу центральной команде для публикации. OpenAI открыто признает, что цифры получены в наилучших возможных условиях и могут незначительно отличаться от моделей, доступных в производственном продукте ChatGPT, которым пользуется большинство пользователей. «Оценочные баллы — это максимум при любых усилиях», — говорится в дисклеймере в блоге. Компания приводит дополнительные оговорки к каждой метрике в сносках.

Точность ускользает: несколько цифр могут считаться точными в зависимости от условий, в которых проводились тесты. Но некоторые эксперты по ИИ задаются вопросом, не имеет ли место также «бенчмаксинг». Это известная в индустрии ИИ практика — не только в OpenAI — максимизации баллов путем повторного прогона оценок в разных условиях.

«Это можно сделать в очень сжатые сроки, и это лучше для их маркетинга», — говорят Анка Ройел и Майк Харди, исследователи из Stanford Intelligent Systems Laboratory и Stanford Trustworthy AI Lab. Они также отметили, что системная карта GPT-6 Astra, которая должна содержать больше технической информации о том, как проводились оценки, не всегда должным образом их объясняет. Например, для внутреннего бенчмарка галлюцинаций системная карта предоставляет «почти никакой информации об оценке», сказали они. «Она даже не включает количество тестовых заданий».

Такой повторный прогон цифр может объяснить, почему возможности Astra в программировании также получили незначительное повышение в более поздних версиях поста: с 57,7% до 57,9%. Хотя разница ничтожна, OpenAI, судя по всему, достаточно заботилась о ней, чтобы заменить цифру на новую и улучшенную.

Не все изменения, внесенные OpenAI, изображали Astra в более выгодном свете. Например, два балла моделей Anthropic улучшились в разных версиях ориентированной на здравоохранение оценки HealthBench Professional: Claude Fable 5.1 вырос с 56,6% до 58,1%, а Opus 5 — с 54,5% до 56,4%. Баллы моделей других ИИ-компаний обычно берутся из опубликованных лидербордов и не предполагают, что OpenAI сама проводит оценки моделей конкурентов.

Споры об оценочных баллах преследуют индустрию ИИ

Вопрос точности бенчмарков возникал неоднократно. В 2025 году Meta отрицала сообщения о том, что она искусственно завысила баллы своей модели Llama 4, опубликовав результаты внутренней версии модели, а не той, что была общедоступной. Ян Лекун, бывший главный ИИ-ученый Meta, позже признал, что компания «подправила» результаты бенчмарков. Оценочные метрики также часто меняются по мере создания новых. Например, ExploitGym, кибербезопасностный бенчмарк, оказавшийся в центре июльского инцидента, когда модели OpenAI вышли из-под контроля и атаковали компанию Hugging Face, был создан в 2026 году.

Винсент Санн Чен, инженер по ИИ, возглавляющий исследования бенчмарков и оценок в Snorkel AI, сказал, что сдвиги бенчмарк-баллов в последние часы перед запуском модели — не редкость. «Обычно это функция финальной логистики запуска, — написал он по электронной почте. — Бенчмарк-балл отражает конкретную конфигурацию измерения: контрольную точку модели, конфигурацию (включая, сколько времени и вычислительных ресурсов разрешено модели), харнесс, конфигурацию оценки/оценивания (например, недетерминированность судьи). Все это обычно продолжает меняться в последние дни перед запуском, поэтому меня не удивляет, что были некоторые обновления». Он выразил желание видеть развитие отраслевых норм, обязывающих компании отчитываться о том, что изменилось в оценке при пересмотре бенчмарк-показателей, чтобы исследователи могли яснее интерпретировать результаты.

Результаты бенчмарков важны по нескольким причинам. Это способ, которым ИИ-компании измеряют прогресс, — но также и способ вести счет в гонке с конкурентами. Лидерство в этих оценках может помочь ИИ-компаниям привлекать клиентов, а в некоторых случаях — нанимать инженеров и исследователей. Однако, как показывает этот эпизод, интерпретация бенчмарк-баллов может быть технически сложной, что создает трудности для компаний, желающих представить результаты общественности в удобоваримом формате. Эти сложности в сочетании с путаницей вокруг меняющихся метрик и обвинениями в том, что компании не были интеллектуально честными в представлении результатов, могут затруднить для клиентов и инвесторов определение того, какие модели лучше подходят для каких задач. Путаница также может замутнить нарратив о наличии лучших моделей на рынке — тот, который OpenAI несомненно хотела бы представить перед возможным IPO в 2027 году.

Эта история была впервые опубликована на Fortune.com.