Induction Labs 稱 Photon-1「想像模型」以少 30 倍運算量擊敗 Gemini 3.1 Flash-Lite
重點速覽
- •Photon-1 以約 5.75 億幀未含動作標籤的電腦螢幕錄影進行預訓練,相當於以每秒一幀取樣的 18 年影片。
- •Induction Labs 報告稱,Photon-1 在內部電腦使用基準測試中優於 Gemini 3.1 Flash-Lite,同時所需訓練運算量至少少 30 倍。
- •該公司表示 Photon-1 的加權推論成本為每百萬 token $0.11,而 Gemini 為 $0.36,但這項比較依賴內部估算。
- •Photon-1 仍需要少於 35,000 條標註電腦使用軌跡與線上強化學習,才能成為可執行動作的代理。
- •本文將 Photon-1 視為邁向世界模型的更廣泛轉變的一部分,這類模型透過觀察學習環境動態,而不只依賴文字預測或標註動作。

Induction Labs 發布了一項研究結果,挑戰人工智慧領域一個長期存在的假設:機器必須透過對其預期執行的每個動作進行精心標註的範例來訓練。該公司推出 Photon-1,這是其所稱一種新型基礎架構類別「想像模型」中的首個模型,旨在從網際網路規模的影片中學習,而在預訓練期間不需要看到動作標籤。
Photon-1 是一個稀疏的 1060 億參數混合專家 Transformer,具有 50 億個活躍參數。它以約 5.75 億幀電腦螢幕錄影進行訓練,Induction Labs 稱這相當於以每秒一幀取樣的 18 年影片。訓練資料來自最初由 20 億部公開可取得影片組成的索引,之後縮減至約 200 萬段螢幕錄影,並使用內部關鍵幀偵測模型移除冗餘幀。該模型從零開始預訓練一個 epoch,約需 30,000 個 NVIDIA H200 GPU 小時與 4.4 × 10²² FLOPs。
Induction Labs 的主要主張是,儘管 Photon-1 的訓練運算量至少少了 30 倍,但在該公司內部的電腦使用基準測試中,其表現優於 Google 的 Gemini 3.1 Flash-Lite。該公司也表示,Photon-1 每百萬 token 的服務成本約低三倍,報告的加權推論成本為每百萬 token $0.11,而 Gemini 為 $0.36。不過,這些數字存在重要限制:該基準測試是內部且未公開的,因此結果無法由外部獨立重現;而 Gemini 的運算量估算是 Induction Labs 自行提出的保守推測,並非外部驗證資料。
這一主張值得關注,因為電腦使用代理仍是 AI 系統高度依賴監督式示範、特定工具工作流程與特定環境評估的領域之一。如果模型能從未標註螢幕錄影中學到有用的介面動態,打造可執行任務代理所需的人工作業標註量可能會降低,不過 Photon-1 所報告的結果仍依賴於預訓練後較小規模的標註微調階段與強化學習。
We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si — Induction Labs (@induction_labs) July 23, 2026
We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si
想像模型如何運作
Photon-1 與傳統方法的差異不只在規模,也在架構。想像模型不是預測下一個詞或生成原始像素,而是在學得的表示空間中,使用 next-latent-token 目標以自回歸方式預測未來幀。每個影片幀會透過有限純量量化壓縮為 960 個離散 token,且僅佔 2.2 KB。Induction Labs 表示,這比現有 OCR 與多模態表示小約 100 倍,同時仍能保留文字、版面配置與狀態變化。
差分潛在編碼器會成對處理幀,編碼連續狀態之間的差異,而不是只將每一幀表示為絕對的視覺內容。這種壓縮讓大規模自回歸預測未來狀態在計算上變得可行。在預訓練期間,模型學到該公司所稱的「隱式策略」:透過預測螢幕接下來會呈現的樣貌,它在未被告知哪些滑鼠點擊或鍵盤輸入造成觀察到的轉換的情況下,內化了電腦介面的因果結構。
將這種觀察所得知識轉換為可運作的代理,需要第二個階段。Induction Labs 以少於 35,000 條標註電腦使用軌跡對 Photon-1 進行微調,以教導模型正確的動作格式。該公司加入了特殊 token,使 Photon-1 能輸出鍵盤與滑鼠指令。在推論時,系統分兩步運作:先想像能推進任務的下一個狀態,再生成旨在達到該狀態的動作。
Induction Labs 隨後使用線上強化學習,在五種桌面環境中的 Linux 虛擬機上進行即時 rollout。結果透過程式化方式驗證,並使用獎勵訊號進一步改善模型。這種評估設定使所報告的工作聚焦於可對狀態與結果進行儀器化的軟體環境,而非驗證與安全限制更難自動化的開放式實體場景。
該公司也報告稱,Photon-1 的能力延伸到其預訓練期間觀察到的螢幕錄影領域之外。當以 20,000 場錦標賽跳棋對局進行微調時,Photon-1 在世界模擬與走法品質方面都優於視覺編碼器基準線與一個規模相近的語言模型基準線。在 10,000 場合成生成的撞球遊戲中,它在球位置預測上的平均絕對誤差為 0.47,相較之下 LLM 基準線為 1.15,視覺基準線為 1.44。
根據 Induction Labs,該模型也從預訓練資料中學到人類行為模式。它學會提示虛擬機內的 ChatGPT 複製版本、評估其輸出,並引導對話直到任務完成,類似人們在實際工作流程中使用 AI 工具的方式。
世界模型的擴張前沿
Photon-1 的推出,正值 AI 產業日益聚焦於研究人員廣泛稱為「世界模型」的系統。這些系統旨在建立環境如何因應動作而演變的內部表示,而不只是預測文字或產生孤立的影片片段。
2026 年,這一領域的發展已明顯加速。5 月,Google DeepMind 發布 Genie 3,這是一個即時互動式世界模型,可根據文字或影像以每秒 24 幀生成持久的 3D 環境,並使用自我學習的物理規律,而非硬編碼規則。NVIDIA 的 Cosmos 平台提供以 2000 萬小時真實世界資料訓練的開放權重世界基礎模型,下載量已超過 200 萬次,並被包括 1X、Figure AI 和 Agility 在內的機器人公司用於生成合成訓練資料。
Fei-Fei Li 的 World Labs 推出 Marble,這是一套可從文字、影像或影片建立可編輯 3D 世界的商用系統。Yann LeCun 的 AMI Labs 在推出產品前據報估值已達 €30 億,並募得 €5 億,用於推進 JEPA 風格架構;這類架構透過在潛在空間而非像素中進行預測,來學習抽象表示。
其他進展包括 Runway 的 Gen-4.5,該公司明確將其描述為具備真實物理特性的「世界模型」;以及 DreamZero,這是一個 140 億參數的世界動作模型,展示了從人類影片到機器人控制的強大跨具身遷移能力,且僅使用視覺資訊、不使用動作標籤。
整體而言,這些努力指向 AI 研究中更廣泛的架構轉變。大型語言模型已在文字中的模式匹配方面展現效能,而下一代 AI 系統則日益朝向透過直接觀察來理解因果關係、物理與程序。Induction Labs 的方法透過狀態預測從未標註影片中學習,符合這一方向,同時處理了一個關鍵瓶頸:訓練前需要人類先將觀察轉換為標註動作。
該方法接下來的考驗將包括外部可重現性、更廣泛的基準測試覆蓋,以及證明同一訓練配方能在較不受控的環境中運作。想像模型能否從螢幕錄影擴展到體力勞動、社交互動與複雜真實世界動態,仍未有定論。目前,Photon-1 被呈現為一項概念驗證:機器至少在某種程度上可以透過觀看來學會行動。