Induction Labs заявляет, что модель воображения Photon-1 превосходит Gemini 3.1 Flash-Lite при в 30 раз меньших вычислениях
Ключевые выводы
- •Photon-1 прошла предварительное обучение примерно на 575 млн кадров записей компьютерного экрана без меток действий, что эквивалентно 18 годам видео с частотой один кадр в секунду.
- •Induction Labs сообщает, что Photon-1 превзошла Gemini 3.1 Flash-Lite во внутренних бенчмарках использования компьютера, потребовав как минимум в 30 раз меньше вычислительных ресурсов для обучения.
- •Компания заявляет, что взвешенная стоимость инференса Photon-1 составляет $0.11 за миллион токенов против $0.36 у Gemini, хотя сравнение опирается на внутренние оценки.
- •Чтобы стать агентом, выполняющим действия, Photon-1 все же потребовались менее 35,000 размеченных траекторий использования компьютера и онлайн-обучение с подкреплением.
- •Статья рассматривает Photon-1 как часть более широкого сдвига к мировым моделям, которые изучают динамику среды через наблюдение, а не полагаются только на прогнозирование текста или размеченные действия.

Induction Labs опубликовала исследовательский результат, который ставит под сомнение давнее предположение в области искусственного интеллекта: что машины необходимо обучать на тщательно размеченных примерах каждого действия, которое от них ожидается. Компания представила Photon-1 — первую модель в новом классе фундаментальных архитектур, который она называет “imagination models” («модели воображения»), предназначенную для обучения на интернет-масштабных видеоданных без использования меток действий на этапе предварительного обучения.
Photon-1 — это разреженный transformer mixture-of-experts со 106 млрд параметров и 5 млрд активных параметров. Он был обучен примерно на 575 млн кадров записей компьютерного экрана, что, по словам Induction Labs, эквивалентно 18 годам видео, дискретизированного с частотой один кадр в секунду. Обучающие данные были получены из исходного индекса двух миллиардов общедоступных видео, затем сужены примерно до двух миллионов записей экрана и очищены от избыточных кадров с помощью внутренней модели обнаружения ключевых кадров. Модель была предварительно обучена с нуля в течение одной эпохи, что потребовало приблизительно 30,000 NVIDIA H200 GPU-hours и 4.4 × 10²² FLOPs.
Главное утверждение Induction Labs заключается в том, что Photon-1 превосходит Google Gemini 3.1 Flash-Lite во внутренних бенчмарках компании для использования компьютера, несмотря на обучение с как минимум в 30 раз меньшими вычислительными затратами. Компания также заявляет, что обслуживание Photon-1 обходится примерно в три раза дешевле на миллион токенов: взвешенная стоимость инференса составляет $0.11 за миллион токенов против $0.36 у Gemini. У этих показателей есть важные ограничения: бенчмарк является внутренним и не опубликован, поэтому результаты нельзя независимо воспроизвести, а оценка вычислительных затрат Gemini представляет собой собственный консервативный прогноз Induction Labs, а не внешне подтвержденные данные.
Это заявление примечательно, поскольку агенты для использования компьютера остаются одной из областей, где ИИ-системы по-прежнему существенно зависят от контролируемых демонстраций, рабочих процессов, привязанных к конкретным инструментам, и оценки в конкретных средах. Если модели смогут изучать полезную динамику интерфейсов по немаркированным записям экрана, объем человеческой разметки, необходимой для создания агентов, выполняющих задачи, может сократиться, хотя заявленные результаты Photon-1 все же зависят от меньшего этапа дообучения на размеченных данных и обучения с подкреплением после предварительного обучения.
We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si — Induction Labs (@induction_labs) July 23, 2026
We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si
Как работают модели воображения
Photon-1 отличается от традиционных подходов не только масштабом, но и архитектурой. Вместо прогнозирования следующего слова или генерации необработанных пикселей модели воображения авторегрессионно предсказывают будущие кадры внутри выученного пространства представлений, используя цель next-latent-token. Каждый видеокадр сжимается до 960 дискретных токенов с помощью конечного скалярного квантования и занимает всего 2.2 килобайта. По данным Induction Labs, это примерно в 100 раз меньше существующих OCR- и мультимодальных представлений, при этом сохраняются текст, компоновка и изменения состояния.
Дифференциальный латентный энкодер обрабатывает кадры парами, кодируя различия между последовательными состояниями, а не представляя каждый кадр только как абсолютное визуальное содержимое. Такое сжатие делает авторегрессионное прогнозирование будущих состояний вычислительно практичным в большом масштабе. На этапе предварительного обучения модель осваивает то, что компания называет “implicit policy” («неявной политикой»): прогнозируя, как будет выглядеть экран дальше, она усваивает причинную структуру компьютерных интерфейсов без указаний, какие щелчки мыши или нажатия клавиш вызвали наблюдаемые переходы.
Чтобы превратить эти знания, полученные через наблюдение, в работающего агента, потребовался второй этап. Induction Labs дообучила Photon-1 менее чем на 35,000 размеченных траекториях использования компьютера, чтобы научить модель правильному формату действий. Компания добавила специальные токены, позволяющие Photon-1 выдавать команды клавиатуры и мыши. Во время инференса система работает в два шага: сначала она воображает следующее состояние, которое продвинет выполнение задачи, а затем генерирует действие, предназначенное для достижения этого состояния.
Затем Induction Labs использовала онлайн-обучение с подкреплением с развертываниями в реальном времени на виртуальных машинах Linux в пяти настольных средах. Результаты проверялись программно, а сигналы вознаграждения применялись для дальнейшего улучшения модели. Такая схема оценки удерживает заявленную работу в рамках программных сред, где состояния и результаты можно инструментировать, а не в открытых физических условиях, где проверку и ограничения безопасности сложнее автоматизировать.
Компания также сообщает, что возможности Photon-1 выходят за пределы домена записей экрана, который модель наблюдала во время предварительного обучения. После дообучения на 20,000 турнирных партиях в шашки Photon-1 превзошла как базовую модель с vision-encoder, так и сопоставимую по размеру базовую языковую модель по качеству симуляции мира и ходов. На 10,000 синтетически сгенерированных играх в бильярд она достигла средней абсолютной ошибки 0.47 при прогнозировании положения шаров, по сравнению с 1.15 у базовой LLM и 1.44 у базовой визуальной модели.
По словам Induction Labs, модель также усвоила человеческие поведенческие паттерны из данных предварительного обучения. Она научилась формулировать запросы к клону ChatGPT внутри виртуальной машины, оценивать его ответы и направлять диалог до завершения задачи, что напоминает то, как люди используют ИИ-инструменты в практических рабочих процессах.
Расширяющийся фронтир мировых моделей
Photon-1 представляется в период, когда индустрия ИИ все больше сосредоточена на том, что исследователи в широком смысле называют “world models” («мировые модели»). Эти системы предназначены для построения внутренних представлений того, как среды эволюционируют в ответ на действия, а не только для прогнозирования текста или создания отдельных видеоклипов.
В 2026 году разработки в этой области ускорились. В мае Google DeepMind выпустила Genie 3 — интерактивную мировую модель реального времени, способную генерировать устойчивые 3D-среды со скоростью 24 кадра в секунду на основе текста или изображений, используя самостоятельно выученную физику вместо жестко заданных правил. Платформа NVIDIA Cosmos, предлагающая мировые фундаментальные модели с открытыми весами, обученные на 20 млн часов реальных данных, превысила два миллиона загрузок и используется робототехническими компаниями, включая 1X, Figure AI и Agility, для генерации синтетических обучающих данных.
World Labs Фэй-Фэй Ли запустила Marble — коммерческую систему для создания редактируемых 3D-миров из текста, изображений или видео. AMI Labs Яна Лекуна, по сообщениям оцененная в €3 млрд еще до выпуска продукта, привлекла €500 млн для развития архитектур в стиле JEPA, которые учат абстрактные представления, прогнозируя в латентном пространстве, а не в пикселях.
Среди других разработок — Runway Gen-4.5, которую компания прямо описывает как “world model” с реалистичной физикой, и DreamZero, мировая модель действий с 14 млрд параметров, продемонстрировавшая сильный перенос между разными воплощениями — от человеческого видео к управлению роботом — с использованием только визуальной информации и без меток действий.
В совокупности эти усилия указывают на более широкий архитектурный сдвиг в исследованиях ИИ. Если большие языковые модели стали эффективны в сопоставлении паттернов в тексте, то следующее поколение ИИ-систем все больше нацелено на понимание причинности, физики и процедур через прямое наблюдение. Метод Induction Labs, который учится на немаркированном видео через прогнозирование состояний, соответствует этому направлению и одновременно затрагивает ключевое узкое место: необходимость того, чтобы люди преобразовывали наблюдения в размеченные действия перед обучением.
Следующими проверками для этого подхода станут внешняя воспроизводимость, более широкий охват бенчмарков и доказательства того, что тот же рецепт обучения работает в менее контролируемых средах. Остается нерешенным вопрос, смогут ли модели воображения масштабироваться за пределы записей экрана — к физическому труду, социальному взаимодействию и сложной динамике реального мира. На данный момент Photon-1 представляется как доказательство концепции того, что машины могут учиться действовать, по крайней мере частично, просто наблюдая.