Induction Labs afirma que Photon-1 aprende a usar computadoras a partir de video sin etiquetar
Puntos clave
- •Photon-1 aprende a partir de la predicción de fotogramas futuros en una representación latente, en lugar de clics, pulsaciones de teclas o instrucciones etiquetadas durante el preentrenamiento.
- •Induction Labs informa que Photon-1 fue preentrenado con 552 mil millones de tokens a partir de 575 millones de fotogramas, usando alrededor de 30,000 horas-GPU H200.
- •El modelo comprime cada fotograma de video en 960 tokens discretos, produciendo una representación de aproximadamente 2.2 KB por fotograma.
- •Después del preentrenamiento, Photon-1 fue ajustado finamente con menos de 35,000 trayectorias de uso de computadora y entrenado adicionalmente con aprendizaje por refuerzo en línea en máquinas virtuales Linux.
- •Induction Labs afirma que Photon-1 generalizó a pruebas de damas y física de billar, pero su principal benchmark de uso de computadoras no ha sido publicado para verificación independiente.

Induction Labs afirma que las etiquetas de acción son una restricción importante para los agentes que aprenden a partir de video. La compañía lanzó lo que denomina modelos de imaginación, una arquitectura de modelo fundacional diseñada para preentrenarse con video en bruto sin etiquetas que identifiquen la acción que produjo cada fotograma.
Su sistema de prueba, Photon-1, es un transformador disperso de mezcla de expertos, o MoE, 106B-A5B, entrenado con lo que Induction Labs describe como 18 años de video de demostraciones de uso de computadoras. En un benchmark interno de uso de computadoras, la compañía informa que Photon-1 supera a Gemini 3.1 Flash-Lite, utilizando sustancialmente menos cómputo de preentrenamiento y con un costo de servicio de aproximadamente 3× menos. El trabajo aborda un problema central para los agentes de uso de computadoras: existe una gran cantidad de video de pantalla, pero la mayor parte no viene acompañada de registros estructurados de los clics, pulsaciones de teclas e instrucciones que produjeron cada estado.
Cómo funciona el modelo de imaginación
Un modelo de imaginación predice fotogramas futuros de forma autorregresiva mediante un objetivo de predicción del siguiente token latente. Durante el preentrenamiento, no genera píxeles directamente. En cambio, el sistema modela el video en un espacio de representación aprendido.
La afirmación central de Induction Labs es que predecir estados futuros puede enseñar a un modelo a completar tareas incluso cuando nunca observa etiquetas de acción explícitas durante el preentrenamiento. La compañía describe este comportamiento aprendido como una política implícita. En lugar de aprender una etiqueta para cada clic del mouse, el modelo busca aprender conceptos de nivel más alto sobre lo que una persona está haciendo en una computadora.
Compresión y representación
La arquitectura de Photon-1 se basa en un codificador de visión que utiliza cuantización escalar finita, o FSQ. Cada fotograma se comprime en 960 tokens discretos. Cada token es un vector de 8 dimensiones, y cada dimensión puede tomar uno de cinco valores: −1, −1/2, 0, 1/2 o 1. Eso produce un libro de códigos con 5⁸ códigos posibles.
La representación resultante es de aproximadamente 2.2 KB por fotograma. Induction Labs informa que esto ofrece una compresión más de 100× mejor que las representaciones existentes basadas en OCR y modelos multimodales, al tiempo que conserva texto, diseño y cambios de estado. Esa compresión es central para la afirmación porque el preentrenamiento con video está limitado no solo por el tamaño del modelo, sino también por la cantidad de tokens de fotogramas que pueden caber en un presupuesto de entrenamiento y una ventana de contexto prácticos.
Para alcanzar esa tasa de compresión, Photon-1 utiliza un codificador latente diferencial. En lugar de codificar cada fotograma solo como una imagen independiente, codifica los fotogramas de video en pares, de modo que los latentes describen diferencias entre fotogramas y no solo el contenido de cada fotograma.
Conjunto de datos y cómputo de preentrenamiento
El corpus de entrenamiento comenzó con un índice interno de 2 mil millones de videos disponibles públicamente. El filtrado redujo esa colección a cerca de 2 millones de grabaciones de pantalla de computadora. Luego, Induction Labs usó un modelo interno de detección de fotogramas clave para eliminar fotogramas redundantes.
El conjunto de datos final contenía 575 millones de fotogramas muestreados a 1 fotograma por segundo. La compañía afirma que esto corresponde a 552 mil millones de tokens, o alrededor de 18 años de video. Photon-1 fue preentrenado desde cero durante una sola época.
Entrenar el modelo MoE 106B-A5B con una longitud de contexto de 32K tomó alrededor de 30,000 horas-GPU H200, o 4.4×10²² FLOPs de entrenamiento. El equipo de investigación implementó la pila de entrenamiento en PyTorch y utilizó kernels fusionados personalizados para el codificador de visión y las capas MoE, manteniendo un MFU de extremo a extremo del 40%. Las cifras reportadas son consistentes entre sí: 30,000 horas H200 al 40% de MFU se acercan a 4.3×10²² FLOPs.
Pasar de la predicción a la acción
Después del preentrenamiento, Induction Labs ajustó finamente Photon-1 con menos de 35,000 trayectorias de uso de computadora para enseñarle el formato de acciones e instrucciones. Tokens especiales de uso de computadora permiten que el modelo emita acciones. Durante la inferencia, Photon-1 primero predice el estado del siguiente fotograma y luego genera la acción necesaria para alcanzar ese estado.
Luego, la compañía aplica aprendizaje por refuerzo en línea. Los despliegues se ejecutan en tiempo real en máquinas virtuales a escala, y los resultados se verifican programáticamente para generar recompensas. Las máquinas virtuales Linux incluyen cinco entornos de escritorio: LXQt, Xfce, MATE, GNOME y Plasma. Cada VM tiene una cuenta de Google para aplicaciones web que requieren acceso con inicio de sesión, así como un clon interno de ChatGPT sin límites de tasa. Esta configuración busca probar el comportamiento en bucle cerrado, y no solo la predicción fuera de línea, ya que un modelo de uso de computadoras debe recuperarse de sus propias acciones y operar en interfaces cambiantes.
Comparación de cómputo y costos
Induction Labs afirma que sus comparaciones de cómputo y costos están ponderadas con una proporción de tokens de entrada a salida de 10:1, que según la compañía coincide con sus pruebas de uso de computadoras.
Dos salvedades aplican a esas cifras. Primero, la comparación con Gemini es una estimación conservadora propia de Induction Labs, que asume 8B parámetros activos y 25T tokens de preentrenamiento. Bajo esos supuestos, la proporción es de aproximadamente 27× en lugar de la cifra principal de 30×. Induction Labs dice “al menos 30×” porque cree que la cifra real de Gemini probablemente sea más alta y que el modelo probablemente fue destilado. Segundo, el benchmark es interno y no ha sido publicado, por lo que el resultado no es reproducible de forma independiente en este momento.
El costo de equilibrio propio de Photon-1 en el hardware de Induction Labs se reporta en $0.06 por 1 millón de tokens de entrada y $0.60 por 1 millón de tokens de salida, sin decodificación especulativa.
Pruebas más allá del video de escritorio
Induction Labs también evaluó si Photon-1 podía generalizar más allá del video de uso de computadoras de escritorio, el único tipo de video que vio durante el preentrenamiento. El equipo de investigación ajustó finamente el modelo en dominios ausentes del preentrenamiento y lo comparó con dos líneas base: una línea base de codificador de visión con la misma arquitectura y tamaño, pero sin preentrenamiento de imaginación, y una línea base LLM, Ling-flash-2.0 de Inclusion AI, que fue preentrenada con 20T tokens.
En 20,000 partidas de damas de torneo del Open Checkers Archive 2.0, Photon-1 superó a ambas líneas base en simulación del mundo y calidad de movimiento. En 10,000 partidas de billar generadas sintéticamente y simuladas a 5 fps, Photon-1 produjo un error absoluto medio de 0.47 frente al motor de física de referencia, en comparación con 1.15 para la línea base LLM y 1.44 para la línea base de codificador de visión. Estas pruebas no sustituyen una evaluación pública de uso de computadoras, pero buscan examinar si el objetivo de preentrenamiento aprendió dinámicas de estado transferibles y no solo patrones visuales específicos del escritorio.
Induction Labs también afirma que Photon-1 adquirió priors humanos a partir del video de preentrenamiento. Después del aprendizaje por refuerzo, el modelo aprendió a usar el clon de ChatGPT dentro de la VM para redactar artefactos y responder preguntas de conocimiento, dirigiendo al LLM de una manera comparable a la de un usuario humano.
La compañía no ha publicado los pesos del modelo, una API ni una licencia para Photon-1. El resultado sigue siendo una demostración de investigación y no un modelo público desplegable. Induction Labs también publicó un hilo de anuncio en X.