Induction Labs称Photon-1可从未标注视频中学习计算机使用
要点速览
- •Photon-1在预训练期间并不依赖带标签的点击、键盘输入或指令,而是通过潜在表示中的未来帧预测进行学习。
- •Induction Labs报告称,Photon-1使用来自5.75亿帧的5520亿个令牌进行预训练,耗费约30,000个H200 GPU小时。
- •该模型将每个视频帧压缩为960个离散令牌,形成约2.2 KB每帧的表示。
- •预训练之后,Photon-1在少于35,000条计算机使用轨迹上进行微调,并在Linux虚拟机中通过在线强化学习进一步训练。
- •Induction Labs表示Photon-1可泛化到跳棋和台球测试,但其主要计算机使用基准尚未发布,无法独立验证。

Induction Labs表示,动作标签是从视频中学习的智能体面临的一项主要限制。该公司发布了其称为想象模型的基础模型架构,旨在无需标注每一帧由何种动作产生的标签的情况下,对原始视频进行预训练。
其测试系统Photon-1是一个稀疏的106B-A5B混合专家模型(mixture-of-experts,MoE)Transformer,训练数据来自Induction Labs所称相当于18年的计算机演示视频。在一项内部计算机使用基准测试中,该公司报告称,Photon-1的表现优于Gemini 3.1 Flash-Lite,同时预训练计算量大幅减少,服务成本约低3×。这项工作针对的是计算机使用智能体的一项核心问题:大量屏幕视频已经存在,但其中大多数并不附带产生每个状态的点击、键盘输入和指令等结构化记录。
想象模型如何工作
想象模型通过下一潜在令牌预测目标,以自回归方式预测未来帧。在预训练期间,它不直接生成像素。相反,系统在学习得到的表示空间中对视频进行建模。
Induction Labs的核心主张是,预测未来状态可以教会模型完成任务,即使它在预训练期间从未观察到显式动作标签。该公司将这种学习到的行为称为隐式策略。该模型并不是为每一次鼠标点击学习一个标签,而是旨在学习人在计算机上操作时更高层次的概念。
压缩与表示
Photon-1的架构依赖一个使用有限标量量化(finite scalar quantization,FSQ)的视觉编码器。每一帧被压缩为960个离散令牌。每个令牌是一个8维向量,每个维度可以取五个值之一:−1、−1/2、0、1/2或1。这形成了一个包含5⁸种可能编码的码本。
生成的表示约为每帧2.2 KB。Induction Labs报告称,在保留文本、布局和状态变化的同时,这种方法的压缩效率比现有OCR和多模态模型表示高出100×以上。这种压缩是其主张的关键,因为视频预训练不仅受模型规模限制,也受可纳入实际训练预算和上下文窗口的帧令牌数量限制。
为达到这一压缩率,Photon-1使用了差分潜在编码器。它不是仅将每一帧编码为独立图像,而是将视频帧成对编码,因此潜在表示描述的是帧之间的差异,而不只是帧内容。
数据集与预训练计算量
训练语料最初来自一个包含20亿个公开可用视频的内部索引。经过筛选后,该集合缩减至约200万个计算机屏幕录制视频。随后,Induction Labs使用内部关键帧检测模型移除冗余帧。
最终数据集包含5.75亿帧,以每秒1帧采样。该公司表示,这相当于5520亿个令牌,或约18年的视频。Photon-1从零开始进行了一个epoch的预训练。
在32K上下文长度下训练106B-A5B MoE模型耗费约30,000个H200 GPU小时,即4.4×10²²训练FLOPs。研究团队在PyTorch中实现了训练栈,并为视觉编码器和MoE层使用自定义融合内核,实现了40%的端到端MFU。报告中的这些数字彼此一致:30,000个H200小时、40% MFU对应的计算量接近4.3×10²² FLOPs。
从预测走向行动
预训练之后,Induction Labs在少于35,000条计算机使用轨迹上对Photon-1进行微调,以教授动作和指令格式。特殊的计算机使用令牌使模型能够输出动作。在推理期间,Photon-1首先预测下一帧的状态,然后输出达到该状态所需的动作。
随后,该公司应用在线强化学习。Rollout在大规模虚拟机上实时运行,结果通过程序化方式验证以生成奖励。Linux虚拟机包含五种桌面环境:LXQt、Xfce、MATE、GNOME和Plasma。每台VM都配有一个Google账号,用于需要登录访问的Web应用,并配有一个没有速率限制的内部ChatGPT克隆。该设置旨在测试闭环行为,而不仅是离线预测,因为计算机使用模型必须从自身动作中恢复,并在不断变化的界面中运行。
计算量与成本比较
Induction Labs表示,其计算量和成本比较按10:1的输入与输出令牌比例加权,该公司称这一比例与其计算机使用测试相匹配。
这些数字有两个注意事项。首先,Gemini比较是Induction Labs自己的保守估计,假设其有8B活跃参数和25T预训练令牌。在这些假设下,该比例约为27×,而不是标题中的30×。Induction Labs称“至少30×”,理由是其认为Gemini的真实数字可能更高,并且该模型很可能经过蒸馏。其次,该基准测试是内部测试且尚未发布,因此目前无法独立复现该结果。
据报告,在Induction Labs自有硬件上,Photon-1的盈亏平衡成本为每100万个输入令牌$0.06、每100万个输出令牌$0.60,且未使用推测解码。
桌面视频之外的测试
Induction Labs还评估了Photon-1能否泛化到桌面计算机使用视频之外的场景,而桌面视频是它在预训练期间见过的唯一视频类型。研究团队在预训练中未出现的领域对模型进行微调,并将其与两个基线进行比较:一个架构和规模相同但没有想象预训练的视觉编码器基线,以及来自Inclusion AI、在20T令牌上预训练的LLM基线 Ling-flash-2.0。
在来自Open Checkers Archive 2.0的20,000场锦标赛跳棋对局中,Photon-1在世界模拟和走法质量方面均优于两个基线。在以5 fps模拟的10,000场合成生成台球游戏中,相对于真实物理引擎,Photon-1产生的平均绝对误差为0.47,而LLM基线为1.15,视觉编码器基线为1.44。这些测试不能替代公开的计算机使用评估,但其目的在于考察预训练目标是否学习到了可迁移的状态动态,而不仅仅是桌面特定的视觉模式。
Induction Labs还表示,Photon-1从预训练视频中获得了人类先验。经过强化学习后,该模型学会使用VM内的ChatGPT克隆来起草成果物并回答知识问题,以类似人类用户的方式引导LLM。
该公司尚未发布Photon-1的模型权重、API或许可证。该结果仍是研究演示,而不是可部署的公开模型。Induction Labs还发布了X上的公告帖串。