ニュース株式Induction Labs、Photon-1「イマジネーションモデル」が30分の1の計算量でGemini 3.1 Flash-Liteを上回ると発表

Induction Labs、Photon-1「イマジネーションモデル」が30分の1の計算量でGemini 3.1 Flash-Liteを上回ると発表

著者: Metaverse Post·

重要ポイント

  • Photon-1は、アクションラベルなしで約575百万フレームのコンピューター画面録画により事前学習された。これは1秒に1フレームでサンプリングした18年分の動画に相当する。
  • Induction Labsは、Photon-1が社内のコンピューター操作ベンチマークでGemini 3.1 Flash-Liteを上回り、必要な訓練計算量は少なくとも30分の1だったと報告している。
  • 同社によると、Photon-1の重み付け推論コストは100万トークンあたり$0.11で、Geminiの$0.36と比較されているが、この比較は社内推定に依存している。
  • Photon-1がアクションを実行するエージェントになるには、それでも35,000未満のラベル付きコンピューター操作軌跡とオンライン強化学習が必要だった。
  • この記事は、Photon-1を、テキスト予測やラベル付きアクションのみに依存するのではなく、観察から環境の動態を学習するワールドモデルへのより広範な移行の一部として位置付けている。
Induction Labs、Photon-1「イマジネーションモデル」が30分の1の計算量でGemini 3.1 Flash-Liteを上回ると発表

Induction Labsは、人工知能における長年の前提、すなわち機械は実行を期待される各アクションについて慎重にラベル付けされた例で訓練されなければならない、という考えに疑問を投げかける研究結果を公開した。同社はPhoton-1を発表した。これは同社が「イマジネーションモデル」と呼ぶ新しい基盤アーキテクチャの最初のモデルであり、事前学習中にアクションラベルを見ることなく、インターネット規模の動画から学習するよう設計されている。

Photon-1は、1060億パラメータのスパースなMixture-of-Expertsトランスフォーマーで、50億のアクティブパラメータを持つ。Induction Labsによると、約575百万フレームのコンピューター画面録画で訓練されており、これは1秒に1フレームでサンプリングした18年分の動画に相当する。訓練データは、公開されている20億本の動画から成る初期インデックスをもとに、約200万本の画面録画へ絞り込み、その後、社内のキーフレーム検出モデルを使って冗長なフレームを除去して作成された。このモデルは1エポック分、ゼロから事前学習され、約30,000 NVIDIA H200 GPU時間と4.4 × 10²² FLOPsを必要とした。

Induction Labsの主な主張は、Photon-1が同社の社内コンピューター操作ベンチマークでGoogleのGemini 3.1 Flash-Liteを上回ったというものだ。しかも、訓練に使われた計算量は少なくとも30分の1だったという。同社はまた、Photon-1の提供コストは100万トークンあたり約3分の1であり、重み付け推論コストは100万トークンあたり$0.11、Geminiは$0.36だと報告している。ただし、これらの数値には重要な制約がある。ベンチマークは社内のもので未公開であるため、結果は独立して再現できず、Geminiの計算量推定も外部で検証されたデータではなく、Induction Labs自身による保守的な予測である。

この主張が注目されるのは、コンピューター操作エージェントが、AIシステムの中でも依然として教師付きデモ、ツール固有のワークフロー、環境固有の評価に大きく依存している分野の一つだからだ。モデルがラベルのない画面録画から有用なインターフェースの動態を学べるなら、タスクを実行するエージェントを構築するために必要な人間によるアノテーション量は削減できる可能性がある。ただし、Photon-1の報告された結果も、事前学習後の小規模なラベル付きファインチューニング段階と強化学習に依存している。

We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si — Induction Labs (@induction_labs) July 23, 2026

We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale video. Our first imagination model, Photon-1, learned to use a computer by watching 18 years of screen recording video without action labels. pic.twitter.com/DMhRqL28si

イマジネーションモデルの仕組み

Photon-1が従来のアプローチと異なるのは、規模だけでなくアーキテクチャにもある。次の単語を予測したり生のピクセルを生成したりする代わりに、イマジネーションモデルは、学習済みの表現空間内で、next-latent-token目的を用いて将来のフレームを自己回帰的に予測する。各動画フレームは有限スカラー量子化によって960個の離散トークンに圧縮され、容量はわずか2.2キロバイトとなる。Induction Labsによれば、これは既存のOCRやマルチモーダル表現より約100分の1のサイズでありながら、テキスト、レイアウト、状態変化を保持できるという。

差分潜在エンコーダーはフレームをペアで処理し、各フレームを絶対的な視覚内容としてのみ表現するのではなく、連続する状態間の差分をエンコードする。この圧縮により、将来状態の自己回帰的な予測を大規模に行うことが計算上現実的になる。事前学習中、モデルは同社が「暗黙の方策」と呼ぶものを学習する。画面が次にどのように見えるかを予測することで、どのマウスクリックやキーストロークが観察された遷移を引き起こしたのかを教えられなくても、コンピューターインターフェースの因果構造を内部化する。

その観察から得た知識を実際に動作するエージェントへ変換するには、第2段階が必要だった。Induction Labsは、35,000未満のラベル付きコンピューター操作軌跡でPhoton-1をファインチューニングし、正しいアクション形式をモデルに教えた。同社は、Photon-1がキーボードおよびマウスコマンドを出力できるようにする特殊トークンを追加した。推論時には、システムは2段階で動作する。まずタスクを前進させる次の状態を想像し、次にその状態へ到達するためのアクションを生成する。

その後、Induction Labsはオンライン強化学習を用い、5つのデスクトップ環境にわたるLinux仮想マシン上でリアルタイムのロールアウトを実施した。結果はプログラムで検証され、報酬信号を使ってモデルがさらに改善された。この評価設定により、報告された研究は、状態と結果を計測できるソフトウェア環境に焦点を当てており、検証や安全制約の自動化がより難しいオープンエンドな物理環境ではないことが示されている。

同社はまた、Photon-1の能力が事前学習中に観察した画面録画の領域を超えて広がっているとも報告している。20,000件のトーナメント用チェッカーゲームでファインチューニングしたところ、Photon-1はワールドシミュレーションと手の質の両方で、視覚エンコーダーのベースラインと同程度の規模の言語モデルのベースラインを上回った。10,000件の合成生成されたビリヤードゲームでは、球位置予測の平均絶対誤差が0.47となり、LLMベースラインの1.15、視覚ベースラインの1.44を下回った。

Induction Labsによると、このモデルは事前学習データから人間の行動パターンも学習した。仮想マシン内のChatGPTクローンにプロンプトを与え、その出力を評価し、タスクが完了するまで会話を誘導することを学習したという。これは、人々が実務のワークフローでAIツールを使う方法に似ている。

拡大するワールドモデルの最前線

Photon-1は、AI業界が研究者の間で広く「ワールドモデル」と呼ばれるものに注目を強める中で発表された。これらのシステムは、単にテキストを予測したり単発の動画クリップを生成したりするのではなく、アクションに応じて環境がどのように変化するかについて内部表現を構築するよう設計されている。

2026年、この分野の開発は加速している。5月には、Google DeepMindがGenie 3を公開した。これはテキストや画像から毎秒24フレームで持続的な3D環境を生成できるリアルタイムのインタラクティブなワールドモデルであり、ハードコードされたルールではなく自己学習した物理を用いる。NVIDIAのCosmosプラットフォームは、実世界データ20百万時間で訓練されたオープンウェイトのワールド基盤モデルを提供しており、ダウンロード数は200万件を超え、1X、Figure AI、Agilityなどのロボティクス企業が合成訓練データの生成に利用している。

Fei-Fei LiのWorld Labsは、テキスト、画像、動画から編集可能な3D世界を作成する商用システムMarbleを発表した。Yann LeCunのAMI Labsは、製品をリリースする前に€3 billionの評価額が付いたと報じられており、ピクセルではなく潜在空間で予測することで抽象表現を学習するJEPAスタイルのアーキテクチャを追求するため、€500 millionを調達した。

その他の動きとしては、RunwayのGen-4.5がある。同社はこれを現実的な物理を備えた「ワールドモデル」と明示的に説明している。またDreamZeroは、140億パラメータのワールドアクションモデルであり、アクションラベルなしに視覚情報のみを用いて、人間の動画からロボット制御への強力なクロスエンボディメント転移を示した。

総合すると、これらの取り組みはAI研究におけるより広範なアーキテクチャ上の転換を示している。大規模言語モデルがテキストにおけるパターンマッチングで有効性を高めてきた一方で、次世代のAIシステムは、直接観察を通じて因果関係、物理、手順を理解する方向へますます向かっている。状態予測を通じてラベルのない動画から学習するInduction Labsの手法は、この方向性に沿うものであり、訓練前に人間が観察をラベル付きアクションへ変換しなければならないという主要なボトルネックに対処するものでもある。

このアプローチに対する次の検証点は、外部での再現性、より広範なベンチマークの適用範囲、そして同じ訓練レシピが制御の少ない環境でも機能するという証拠だ。イマジネーションモデルが画面録画を超えて、肉体労働、社会的相互作用、複雑な実世界の動態へ拡張できるかどうかは未解決のままである。現時点でPhoton-1は、機械が少なくとも部分的には観察するだけで行動を学べることを示す概念実証として提示されている。