Induction Labs заявляет, что Photon-1 учится пользоваться компьютером по видео без разметки
Ключевые выводы
- •Photon-1 учится на предсказании будущих кадров в латентном представлении, а не на размеченных кликах, нажатиях клавиш или инструкциях во время предобучения.
- •Induction Labs сообщает, что Photon-1 была предобучена на 552 миллиардах токенов из 575 миллионов кадров с использованием около 30,000 H200 GPU-hours.
- •Модель сжимает каждый видеокадр в 960 дискретных токенов, формируя представление объемом около 2.2 KB на кадр.
- •После предобучения Photon-1 была дообучена менее чем на 35,000 траекторий использования компьютера и дополнительно обучалась с помощью онлайн-обучения с подкреплением в виртуальных машинах Linux.
- •Induction Labs заявляет, что Photon-1 обобщалась на тестах по шашкам и бильярду, но ее основной бенчмарк по использованию компьютера не опубликован для независимой проверки.

Induction Labs заявляет, что метки действий являются серьезным ограничением для агентов, обучающихся по видео. Компания выпустила то, что она называет моделями воображения, — архитектуру фундаментальной модели, предназначенную для предобучения на необработанном видео без меток, указывающих, какое действие породило каждый кадр.
Ее тестовая система Photon-1 — это разреженный трансформер 106B-A5B mixture-of-experts, или MoE, обученный на том, что Induction Labs описывает как 18 лет видео с демонстрациями работы за компьютером. Во внутреннем бенчмарке по использованию компьютера компания сообщает, что Photon-1 превосходит Gemini 3.1 Flash-Lite, при этом требует существенно меньше вычислений на предобучение и обходится примерно в 3× дешевле при обслуживании. Работа нацелена на ключевую проблему агентов для использования компьютера: существует большой объем экранного видео, но большая его часть не сопровождается структурированными записями кликов, нажатий клавиш и инструкций, которые привели к каждому состоянию.
Как работает модель воображения
Модель воображения авторегрессионно предсказывает будущие кадры с помощью цели next-latent-token-prediction. Во время предобучения она не генерирует пиксели напрямую. Вместо этого система моделирует видео в выученном пространстве представлений.
Главное утверждение Induction Labs состоит в том, что предсказание будущих состояний может научить модель выполнять задачи, даже если во время предобучения она никогда не наблюдает явные метки действий. Компания описывает это выученное поведение как неявную политику. Вместо того чтобы учить метку для каждого клика мышью, модель должна усваивать более высокоуровневые представления о том, что человек делает на компьютере.
Сжатие и представление
Архитектура Photon-1 опирается на визуальный энкодер, использующий finite scalar quantization, или FSQ. Каждый кадр сжимается в 960 дискретных токенов. Каждый токен представляет собой 8-мерный вектор, и каждое измерение может принимать одно из пяти значений: −1, −1/2, 0, 1/2 или 1. Это дает кодовую книгу с 5⁸ возможными кодами.
Получающееся представление составляет примерно 2.2 KB на кадр. Induction Labs сообщает, что это обеспечивает более чем 100× лучшее сжатие по сравнению с существующими OCR- и мультимодальными представлениями моделей, сохраняя текст, макет и изменения состояния. Это сжатие является центральным для заявления компании, поскольку предобучение на видео ограничено не только размером модели, но и числом кадровых токенов, которые можно уместить в практичный бюджет обучения и контекстное окно.
Чтобы достичь такого уровня сжатия, Photon-1 использует дифференциальный латентный энкодер. Вместо того чтобы кодировать каждый кадр только как отдельное изображение, он кодирует видеокадры парами, поэтому латентные представления описывают различия между кадрами, а не только содержимое кадра.
Набор данных и вычисления для предобучения
Обучающий корпус начался с внутреннего индекса из 2 миллиардов общедоступных видео. Фильтрация сократила эту коллекцию примерно до 2 миллионов записей экрана компьютера. Затем Induction Labs использовала внутреннюю модель обнаружения ключевых кадров для удаления избыточных кадров.
Финальный набор данных содержал 575 миллионов кадров, отобранных с частотой 1 кадр в секунду. По словам компании, это соответствует 552 миллиардам токенов, или примерно 18 годам видео. Photon-1 была предобучена с нуля в течение одной эпохи.
Обучение модели 106B-A5B MoE с длиной контекста 32K заняло около 30,000 H200 GPU-hours, или 4.4×10²² обучающих FLOPs. Исследовательская команда реализовала стек обучения в PyTorch и использовала пользовательские fused kernels для визуального энкодера и MoE-слоев, поддерживая 40% end-to-end MFU. Заявленные показатели согласуются друг с другом: 30,000 H200-hours при 40% MFU близки к 4.3×10²² FLOPs.
Переход от предсказания к действию
После предобучения Induction Labs дообучила Photon-1 менее чем на 35,000 траекторий использования компьютера, чтобы обучить форматам действий и инструкций. Специальные токены использования компьютера позволяют модели выдавать действия. Во время инференса Photon-1 сначала предсказывает состояние следующего кадра, а затем выдает действие, необходимое для достижения этого состояния.
Затем компания применяет онлайн-обучение с подкреплением. Rollout-запуски выполняются в реальном времени на виртуальных машинах в масштабе, а результаты программно проверяются для формирования награды. Виртуальные машины Linux включают пять сред рабочего стола: LXQt, Xfce, MATE, GNOME и Plasma. У каждой VM есть аккаунт Google для веб-приложений, требующих входа, а также внутренний клон ChatGPT без лимитов частоты. Такая схема предназначена для проверки поведения в замкнутом контуре, а не только офлайн-предсказания, поскольку модель использования компьютера должна восстанавливаться после собственных действий и работать с меняющимися интерфейсами.
Сравнение вычислений и стоимости
Induction Labs заявляет, что ее сравнения вычислений и стоимости взвешены при соотношении входных и выходных токенов 10:1, которое, по словам компании, соответствует ее тестам использования компьютера.
К этим данным применимы две оговорки. Во-первых, сравнение с Gemini является собственной консервативной оценкой Induction Labs, предполагающей 8B активных параметров и 25T токенов предобучения. При таких допущениях соотношение составляет около 27×, а не заявленные в заголовке 30×. Induction Labs говорит «как минимум 30×», поскольку считает, что реальный показатель Gemini, вероятно, выше, а модель, вероятно, была дистиллирована. Во-вторых, бенчмарк является внутренним и не был опубликован, поэтому на данный момент результат нельзя независимо воспроизвести.
Собственная безубыточная стоимость Photon-1 на аппаратном обеспечении Induction Labs заявлена на уровне $0.06 за 1 миллион входных токенов и $0.60 за 1 миллион выходных токенов, без speculative decoding.
Тесты за пределами видео с рабочего стола
Induction Labs также оценила, может ли Photon-1 обобщать за пределы видео использования настольного компьютера — единственного типа видео, который модель видела во время предобучения. Исследовательская команда дообучила модель на доменах, отсутствовавших в предобучении, и сравнила ее с двумя базовыми моделями: базовой моделью визуального энкодера с той же архитектурой и размером, но без предобучения воображения, и базовой LLM, Ling-flash-2.0 от Inclusion AI, которая была предобучена на 20T токенов.
На 20,000 турнирных партий в шашки из Open Checkers Archive 2.0 Photon-1 превзошла обе базовые модели по симуляции мира и качеству ходов. На 10,000 синтетически сгенерированных партий в бильярд, смоделированных с частотой 5 fps, Photon-1 показала среднюю абсолютную ошибку 0.47 относительно эталонного физического движка, по сравнению с 1.15 у LLM-базовой модели и 1.44 у базовой модели визуального энкодера. Эти тесты не заменяют публичную оценку использования компьютера, но предназначены для проверки того, выучила ли цель предобучения переносимую динамику состояний, а не только визуальные паттерны, специфичные для рабочего стола.
Induction Labs также заявляет, что Photon-1 усвоила человеческие априорные представления из видео предобучения. После обучения с подкреплением модель научилась использовать клон ChatGPT внутри VM для подготовки артефактов и ответов на вопросы о знаниях, направляя LLM способом, сопоставимым с действиями пользователя-человека.
Компания не выпустила веса модели, API или лицензию для Photon-1. Результат остается исследовательской демонстрацией, а не развертываемой публичной моделью. Induction Labs также опубликовала тред с анонсом в X.