新聞宏觀經濟Induction Labs 稱 Photon-1 可從未標註影片學會電腦操作

Induction Labs 稱 Photon-1 可從未標註影片學會電腦操作

作者: MarkTechPost·

重點速覽

  • Photon-1 在預訓練期間不是從已標註的點擊、按鍵或指令學習,而是透過潛在表示中的未來影格預測來學習。
  • Induction Labs 表示,Photon-1 使用來自 5.75 億個影格的 5,520 億個 token 進行預訓練,耗用約 30,000 個 H200 GPU 小時。
  • 該模型將每個影片影格壓縮為 960 個離散 token,形成約每影格 2.2 KB 的表示。
  • 預訓練後,Photon-1 使用少於 35,000 條電腦操作軌跡進行微調,並在 Linux 虛擬機器中透過線上強化學習進一步訓練。
  • Induction Labs 表示 Photon-1 可泛化到西洋跳棋與撞球測試,但其主要電腦操作基準尚未發布,無法進行獨立驗證。
Induction Labs 稱 Photon-1 可從未標註影片學會電腦操作

Induction Labs 表示,動作標籤是從影片學習的代理所面臨的一項主要限制。該公司發布了其所稱的想像模型,這是一種基礎模型架構,旨在直接對原始影片進行預訓練,而不需要標註產生每個影格的動作。

其測試系統 Photon-1 是一個稀疏 106B-A5B mixture-of-experts(MoE)Transformer,使用 Induction Labs 所稱相當於 18 年的電腦示範影片進行訓練。該公司表示,在一項內部電腦操作基準測試中,Photon-1 的表現優於 Gemini 3.1 Flash-Lite,同時使用顯著較少的預訓練算力,服務成本約低 3×。這項工作針對電腦操作代理的一個核心問題:大量螢幕影片確實存在,但其中大多數並未附帶產生每個狀態的點擊、按鍵與指令等結構化紀錄。

想像模型如何運作

想像模型透過 next-latent-token-prediction 目標,以自迴歸方式預測未來影格。在預訓練期間,它不會直接生成像素。相反地,系統會在學得的表示空間中對影片建模。

Induction Labs 的核心主張是,預測未來狀態可以教會模型完成任務,即使它在預訓練期間從未觀察到明確的動作標籤。該公司將這種學得的行為描述為隱式策略。模型的目標不是為每一次滑鼠點擊學習一個標籤,而是學習人在電腦上操作時更高層次的概念。

壓縮與表示

Photon-1 的架構依賴使用 finite scalar quantization(FSQ)的視覺編碼器。每個影格會被壓縮為 960 個離散 token。每個 token 是一個 8 維向量,每個維度可取五個值之一:−1、−1/2、0、1/2 或 1。這會產生一個包含 5⁸ 種可能代碼的 codebook。

所得表示約為每個影格 2.2 KB。Induction Labs 表示,在保留文字、版面與狀態變化的同時,這比現有 OCR 與多模態模型表示提供超過 100× 的壓縮率提升。這種壓縮是該主張的核心,因為影片預訓練不只受模型大小限制,也受限於在實際訓練預算與上下文視窗中可容納的影格 token 數量。

為達到這一壓縮率,Photon-1 使用差分潛在編碼器。它不是只把每個影格編碼為獨立影像,而是將影片影格成對編碼,使潛在表示描述影格之間的差異,而不只是影格內容。

資料集與預訓練算力

訓練語料起始於一個包含 20 億支公開可取得影片的內部索引。經過篩選後,該集合縮減為約 200 萬支電腦螢幕錄影。Induction Labs 隨後使用內部關鍵影格偵測模型移除冗餘影格。

最終資料集包含 5.75 億個影格,取樣率為每秒 1 個影格。該公司表示,這相當於 5,520 億個 token,或約 18 年的影片。Photon-1 從零開始預訓練了一個 epoch。

以 32K 上下文長度訓練 106B-A5B MoE 模型耗時約 30,000 個 H200 GPU 小時,或 4.4×10²² 次訓練 FLOPs。研究團隊在 PyTorch 中實作訓練堆疊,並為視覺編碼器與 MoE 層使用自訂 fused kernels,維持 40% 的端到端 MFU。已公布的數字彼此一致:30,000 個 H200 小時在 40% MFU 下接近 4.3×10²² FLOPs。

從預測走向動作

預訓練之後,Induction Labs 使用少於 35,000 條電腦操作軌跡對 Photon-1 進行微調,以教會其動作與指令格式。特殊的電腦操作 token 讓模型能夠輸出動作。在推論期間,Photon-1 會先預測下一個影格的狀態,然後輸出到達該狀態所需的動作。

該公司接著套用線上強化學習。Rollout 以即時方式在大規模虛擬機器上執行,並透過程式化驗證結果以產生獎勵。Linux 虛擬機器包含五種桌面環境:LXQt、Xfce、MATE、GNOME 與 Plasma。每個 VM 都有一個 Google 帳戶,用於需要登入存取的網路應用程式,並配備一個沒有速率限制的內部 ChatGPT 複製版。這套設定旨在測試閉環行為,而不只是離線預測,因為電腦操作模型必須能從自身動作中恢復,並在不斷變化的介面中運作。

算力與成本比較

Induction Labs 表示,其算力與成本比較是按照 10:1 的輸入對輸出 token 比例加權;該公司稱這與其電腦操作測試相符。

這些數字有兩項但書。首先,Gemini 比較是 Induction Labs 自己的保守估計,假設其有 8B 個活躍參數與 25T 個預訓練 token。在這些假設下,比例約為 27×,而不是標題中的 30×。Induction Labs 稱「至少 30×」,理由是其認為真實 Gemini 數字可能更高,且該模型可能經過蒸餾。其次,該基準測試是內部測試且尚未發布,因此目前無法獨立重現結果。

據稱,Photon-1 在 Induction Labs 硬體上的損益兩平成本為每 100 萬個輸入 token $0.06、每 100 萬個輸出 token $0.60,且未使用 speculative decoding。

桌面影片之外的測試

Induction Labs 也評估 Photon-1 是否能泛化到桌面電腦操作影片之外;這是它在預訓練期間唯一見過的影片類型。研究團隊在預訓練中未出現的領域對模型進行微調,並將其與兩個基準模型比較:一個具備相同架構與規模、但沒有想像預訓練的視覺編碼器基準,以及一個 LLM 基準,即 Inclusion AI 的 Ling-flash-2.0,該模型在 20T 個 token 上預訓練。

在來自 Open Checkers Archive 2.0 的 20,000 場錦標賽西洋跳棋棋局中,Photon-1 在世界模擬與走法品質上都優於兩個基準。在以 5 fps 模擬的 10,000 場合成撞球遊戲中,Photon-1 相對於真值物理引擎產生的平均絕對誤差為 0.47,相較之下,LLM 基準為 1.15,視覺編碼器基準為 1.44。這些測試無法取代公開的電腦操作評估,但其目的在於檢驗預訓練目標是否學到了可轉移的狀態動態,而不只是桌面特定的視覺模式。

Induction Labs 也表示,Photon-1 從預訓練影片中習得了人類先驗。經過強化學習後,模型學會使用 VM 內的 ChatGPT 複製版來草擬產物並回答知識問題,以類似人類使用者的方式引導 LLM。

該公司尚未發布 Photon-1 的模型權重、API 或授權。這項成果仍是研究展示,而不是可部署的公開模型。Induction Labs 也發布了一則 X 上的公告串