新闻股票Induction Labs称Photon-1想象模型以30倍更少算力击败Gemini 3.1 Flash-Lite

Induction Labs称Photon-1想象模型以30倍更少算力击败Gemini 3.1 Flash-Lite

作者: Metaverse Post·

要点速览

  • Photon-1在约5.75亿帧计算机屏幕录制画面上进行预训练,未使用动作标签,相当于以每秒一帧采样的18年视频。
  • Induction Labs报告称,Photon-1在内部计算机使用基准测试中优于Gemini 3.1 Flash-Lite,同时所需训练算力至少少30倍。
  • 该公司表示,Photon-1的加权推理成本为每百万token $0.11,而Gemini为$0.36,不过这一比较依赖内部估算。
  • Photon-1仍需要少于35,000条标注的计算机使用轨迹和在线强化学习,才能成为可执行动作的智能体。
  • 文章将Photon-1置于向世界模型转变的更广泛趋势中:这类模型从观察中学习环境动态,而不只是依赖文本预测或标注动作。
Induction Labs称Photon-1想象模型以30倍更少算力击败Gemini 3.1 Flash-Lite

Induction Labs发布了一项研究结果,挑战了人工智能领域一项长期假设:机器必须通过每个预期执行动作的精心标注样本来训练。该公司推出了Photon-1,这是其所称“想象模型”这一新型基础架构类别中的首个模型,旨在从互联网规模的视频中学习,而在预训练期间不接触动作标签。

Photon-1是一种稀疏的1060亿参数混合专家Transformer,拥有50亿活跃参数。它使用约5.75亿帧计算机屏幕录制画面进行训练,Induction Labs称这相当于以每秒一帧采样的18年视频。训练数据来自最初包含20亿个公开视频的索引,随后缩减至约200万段屏幕录制,并通过内部关键帧检测模型去除冗余帧。该模型从零开始预训练了一个epoch,需要约30,000个NVIDIA H200 GPU小时和4.4 × 10²² FLOPs。

Induction Labs的主要说法是,Photon-1在该公司的内部计算机使用基准测试中表现优于Google的Gemini 3.1 Flash-Lite,尽管其训练所用算力至少少30倍。该公司还表示,Photon-1每百万token的服务成本约低三倍,并报告其加权推理成本为每百万token $0.11,而Gemini为$0.36。不过,这些数字存在重要限制:该基准测试为内部测试且尚未发布,因此结果无法独立复现;Gemini的算力估算也是Induction Labs自己的保守预测,而非外部验证数据。

这一说法值得关注,因为计算机使用智能体仍是AI系统高度依赖监督示范、特定工具工作流和特定环境评估的领域之一。如果模型能够从未标注的屏幕录制中学习有用的界面动态,构建可执行任务的智能体所需的人类标注量可能会减少,不过Photon-1所报告的结果仍依赖于预训练之后规模较小的标注微调阶段和强化学习。

We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si — Induction Labs (@induction_labs) July 23, 2026

We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si

想象模型如何运作

Photon-1与传统方法的差异不仅在于规模,也在于架构。想象模型并不是预测下一个词或生成原始像素,而是在一个已学习的表示空间中,使用next-latent-token目标以自回归方式预测未来帧。每个视频帧通过有限标量量化被压缩为960个离散token,仅占2.2千字节。Induction Labs表示,这比现有OCR和多模态表示小约100倍,同时仍能保留文本、布局和状态变化。

差分潜在编码器以成对方式处理帧,编码连续状态之间的差异,而不是仅将每一帧表示为绝对视觉内容。这种压缩使得在大规模条件下以自回归方式预测未来状态在计算上变得可行。在预训练期间,该模型学习到公司所称的“隐式策略”:通过预测屏幕接下来会呈现什么样子,它在没有被告知哪些鼠标点击或键盘输入导致了观察到的状态转换的情况下,内化了计算机界面的因果结构。

将这种观察性知识转化为可工作的智能体需要第二阶段。Induction Labs使用少于35,000条标注的计算机使用轨迹对Photon-1进行微调,以教会模型正确的动作格式。该公司添加了特殊token,使Photon-1能够输出键盘和鼠标命令。在推理时,系统分两步运行:它首先想象能够推进任务的下一个状态,然后生成旨在到达该状态的动作。

随后,Induction Labs使用了在线强化学习,并在五种桌面环境中的Linux虚拟机上进行实时rollout。结果通过程序化方式验证,奖励信号则用于进一步改进模型。这一评估设置使报告中的工作聚焦于状态和结果可以被仪器化的软件环境,而不是开放式物理场景;在后者中,验证和安全约束更难自动化。

该公司还报告称,Photon-1的能力超出了其在预训练期间观察到的屏幕录制领域。在使用20,000局锦标赛跳棋对局进行微调后,Photon-1在世界模拟和走子质量方面均优于视觉编码器基线以及规模相近的语言模型基线。在10,000局合成生成的台球游戏中,它在球位置预测上的平均绝对误差为0.47,相比之下,LLM基线为1.15,视觉基线为1.44。

据Induction Labs称,该模型还从预训练数据中学习了人类行为模式。它学会了向虚拟机内的ChatGPT克隆体发出提示、评估其输出,并引导对话直至任务完成,这类似于人们在实际工作流中使用AI工具的方式。

世界模型不断扩展的前沿

Photon-1发布之际,AI行业正越来越关注研究人员广义上所称的“世界模型”。这些系统旨在构建关于环境如何响应动作而演化的内部表示,而不仅仅是预测文本或生成孤立的视频片段。

2026年,这一领域的发展已经加速。5月,Google DeepMind发布了Genie 3,这是一种实时交互式世界模型,能够根据文本或图像以每秒24帧生成持久的3D环境,并使用自学习物理而非硬编码规则。NVIDIA的Cosmos平台提供基于2000万小时真实世界数据训练的开放权重世界基础模型,下载量已超过200万次,并正被包括1X、Figure AI和Agility在内的机器人公司用于生成合成训练数据。

Fei-Fei Li的World Labs推出了Marble,这是一套用于根据文本、图像或视频创建可编辑3D世界的商业系统。Yann LeCun的AMI Labs据称在发布产品前估值已达€3 billion,并筹集了€500 million,以推进JEPA式架构;这类架构通过在潜在空间而非像素空间中预测来学习抽象表示。

其他进展包括Runway的Gen-4.5,该公司明确将其描述为具备真实物理效果的“世界模型”;以及DreamZero,这是一种140亿参数的世界动作模型,展示了从人类视频到机器人控制的强跨具身迁移能力,仅使用视觉信息且不需要动作标签。

总体来看,这些努力指向AI研究中更广泛的架构转变。虽然大型语言模型已在文本模式匹配方面变得有效,但下一代AI系统正越来越多地瞄准通过直接观察理解因果关系、物理规律和流程。Induction Labs的方法通过状态预测从未标注视频中学习,符合这一方向,同时也试图解决一个关键瓶颈:在训练之前需要人类先将观察转换为标注动作。

这一方法接下来需要经受的检验包括外部可复现性、更广泛的基准覆盖,以及证明同样的训练方案可在控制程度较低的环境中奏效。想象模型能否从屏幕录制扩展到体力劳动、社交互动和复杂现实世界动态,目前仍未有定论。就目前而言,Photon-1被呈现为一个概念验证:机器至少在一定程度上可以通过观看来学习行动。