Игровые бенчмарки Epoch AI показали, что лучшие ИИ-модели не дотягивают до 60%, выявив пробелы в рассуждениях
Ключевые выводы
- •Epoch AI представил два бенчмарка, каждый из которых включает 100 программно сгенерированных головоломок и предназначен для исключения запоминания; при этом не допускаются агентные надстройки, chain-of-thought prompting и внешние инструменты.
- •В Mystery Game Puzzles лучшая модель набрала только 59%, а open-weight модели остановились на 38%, что показывает значительный разрыв между закрытыми и open-weight системами в задачах, требующих рассуждений.
- •Результаты Chess Puzzles улучшились с 37% у GPT-5 на старте в декабре 2025 года до 54% у последующих версий моделей, что указывает на измеримый, но неполный прогресс.
- •Связанный бенчмарк EBR-bench показал ограниченный прогресс ИИ в обучении на повторяющихся взаимодействиях по состоянию на July 2026, подтверждая, что интерактивное рассуждение остается сложной задачей.
- •Разница в результатах между open-weight и закрытыми моделями поднимает вопрос о том, смогут ли одни лишь архитектурные улучшения закрыть разрыв в рассуждениях или ключевую роль играют проприетарные методы обучения.

Epoch AI, некоммерческий исследовательский институт, представил два игровых инструмента оценки — Mystery Game Puzzles и Chess Puzzles — чтобы строго проверить способности ведущих моделей искусственного интеллекта к рассуждению. Первые результаты показывают существенные ограничения в том, насколько хорошо современные ИИ-системы справляются с новыми задачами на решение проблем, и это происходит на фоне того, что несколько передовых лабораторий все активнее продвигают свои последние модели как особенно сильные в рассуждениях и планировании.
Главный результат: на бенчмарке Mystery Game Puzzles самый высокий показатель составляет лишь 59%, тогда как open-weight модели достигают не более 38%.
Что именно измеряют бенчмарки
Каждый бенчмарк включает 100 программно сгенерированных головоломок. Chess Puzzles устроены сравнительно традиционно: при заданной позиции на доске модель должна определить лучший ход.
Mystery Game Puzzles используют принципиально иной подход. В этой версии ИИ не сообщают, в какую игру он играет. Идентичность игры намеренно скрыта, поэтому модель не может опереться на запомненные шаблоны или упрощения из обучающих данных. Такой дизайн напрямую отвечает на то, что Epoch AI называет проблемой загрязнения традиционных ИИ-бенчмарков, где модели часто обучаются на интернет-датасетах, включающих сами тесты, по которым их затем оценивают.
Это опасение становится все более актуальным, поскольку широко используемые бенчмарки, такие как MMLU и GSM8K, демонстрируют концентрацию лучших результатов у потолка шкалы, что снижает их способность различать ведущие модели. Тестов, устойчивых к запоминанию, становится все меньше, поэтому программно генерируемые испытания приобретают все большую ценность для объективной оценки возможностей.
За счет программной генерации головоломок и сокрытия формата игры Epoch AI убирает опору на распознавание шаблонов, заставляя модели демонстрировать подлинные способности к пространственному мышлению и планированию.
Ответы оцениваются по нормализованной записи ходов в сравнении с эталонным ключом ответов. Бенчмарки не допускают использование агентных надстроек, техник chain-of-thought prompting или внешних инструментов.
Текущие результаты
В Mystery Game Puzzles ни одна модель не превысила 59%. Open-weight модели застопорились на уровне 38%, что подчеркивает заметный разрыв в эффективности между передовыми закрытыми системами и их open-weight аналогами.
Chess Puzzles дают несколько более обнадеживающую картину. GPT-5 набрала 37% при запуске бенчмарка в декабре 2025 года. Более поздние версии моделей подняли этот показатель до 54%, что говорит о заметном прогрессе за сравнительно короткий период.
Однако даже результат 54% в chess puzzles подчеркивает важное различие: умение играть в шахматы с доступом к поисковым инструментам принципиально отличается от самостоятельного рассуждения в незнакомых позициях. Традиционные шахматные движки, такие как Stockfish, достигают сверхчеловеческой игры за счет полного перебора деревьев поиска и оценочных функций, а не за счет того типа обобщенного рассуждения, который ожидается от языковых моделей. Модель, показывающая 54% без инструментов, оценивается по совершенно иным критериям, чем игра с помощью движка.
Ни один из бенчмарков, по-видимому, не близок к насыщению — что особенно заметно в момент, когда многие устоявшиеся ИИ-оценки уже не могут существенно различать ведущие модели.
Почему это важно не только для ИИ-исследований
Epoch AI поддерживает более широкий центр бенчмарков, включающий Epoch Capabilities Index (ECI), который агрегирует оценки по математике, программированию и игровым задачам. ECI создан для быстрого приблизительного определения возможностей модели без опоры на какой-либо один тест.
Связанный бенчмарк EBR-bench, основанный на игре Earthborne Rangers, по состоянию на July 2026 показал ограниченный прогресс ИИ в обучении на повторяющихся взаимодействиях, что подтверждает: интерактивное рассуждение остается упорным рубежом.
Рост с 37% до 54% в шахматных задачах за несколько месяцев показывает, что прогресс не остановился. Но результаты Mystery Game указывают, что обобщенное рассуждение развивается медленнее, чем можно подумать по маркетинговым материалам.
Разрыв 38% против 59% между open-weight и закрытыми моделями в задачах, требующих интенсивных рассуждений, означает ощутимое конкурентное отставание. Для децентрализованных ИИ-проектов, которые опираются на open models, такой разрыв — это реальный структурный недостаток, который нельзя устранить лишь добавлением большего числа GPU в сеть.