Induction LabsのPhoton-1は、Google Geminiに比べて計算量が30分の1でありながら、その性能は優れています

Induction Labsは2026年7月23日、いわゆる「想像モデル」の第1弾であるPhoton-1を発表した。これは、事前学習中にラベル付きの行動例なしで、インターネット規模の動画から学習することを目的とした新しいクラスの基盤アーキテクチャだ。アクティブパラメータが50億の、1060億パラメータのスパース・Mixture-of-Experts(MoE)トランスフォーマーは、約5億7500万フレームのコンピュータ画面の録画(1秒あたり1フレームでサンプリングした18年分の動画に相当)で学習された。同社は、少なくとも計算資源が30倍以上少ないのにもかかわらず、社内のコンピュータ利用ベンチマークでGoogleのGemini 3.1 Flash-Liteを上回ると主張している。さらに、提供コストは、Geminiがトークン100万あたり0.36ドルであるのに対し、Photon-1は約3分の1の0.11ドルだという。Photon-1はAIにおける長年の前提に挑戦する。つまり「機械に行動を教えるには、実行させたいあらゆる行動の、細密なラベル付き例が必要だ」という考えだ。Induction Labsのアプローチは、コンピュータ・インターフェースが実際に使われているラベルなし動画を観察するだけで、機械が手続き的な知識を学習できるようにすることで、重要なボトルネックを取り除く。

Photon-1のアーキテクチャと学習仕様

Photon-1は、2.0億の公開動画を初期インデックスとしてそこから抽出されたデータセットで、1エポックのスクラッチ学習を行った。データセットは約2000万本の画面録画まで絞り込まれ、さらに社内のキーフレーム検出モデルによって冗長なフレームが削除された。学習には約30,000 NVIDIA H200 GPU時間と、4.4 × 10²² FLOPsが必要だった。各動画フレームは有限スカラー量子化により960個の離散トークンに圧縮され、占有サイズはわずか2.2キロバイトである。これは既存のOCRやマルチモーダル表現と比べて約100分の1の大きさだが、テキスト、レイアウト、状態変化は保持している。差分潜在エンコーダはフレームをペアとして処理し、絶対的なフレーム内容ではなく、連続する状態間の差分をエンコードする。モデルは、次の潜在トークン目標を用い、学習された表現空間で将来のフレームを自己回帰的に予測する。Induction Labsが引用するベンチマーク結果には重要な注意点がある。ベンチマークは社内のもので公開されていないため、結果は独立に再現できない。また、Geminiの計算資源の見積りは、検証済みデータではなくInduction Labsによる保守的な推定値だ。

想像モデルの圧縮と微調整プロセス

観察による知識を機能するエージェントに変えるには、2段階目が必要だった。Induction Labsは、35,000件未満のラベル付き「コンピュータ利用」軌跡でPhoton-1を微調整し、正しい行動フォーマットを学ばせた。さらに、モデルがキーボードとマウスのコマンドを出力できるように特別なトークンを追加した。推論時、システムは2ステップで動作する。まず、タスクを前進させる次の状態を想像し、次に、その状態に到達するために意図された行動を生成する。その後、オンライン強化学習が行われ、Linuxの仮想マシン上で5つのデスクトップ環境に対してリアルタイムのロールアウトを実施し、結果をプログラムで検証し、報酬シグナルによってさらなる改善を促した。2万回のトーナメントチェッカーゲームで微調整した場合、Photon-1は、視覚エンコーダのベースラインと、同程度のサイズの言語モデルベースラインの両方を、世界シミュレーションと手順(ムーブ)の品質の両面で上回った。1万回の合成ビリヤードゲームでは、ボール位置予測における平均絶対誤差が0.47で、LLMベースラインの1.15、視覚ベースラインの1.44に比べて優れていた。モデルはまた、事前学習データから人間の行動パターンも学び、仮想マシン内のChatGPTクローンにプロンプトを出し、その出力を確認し、タスクが完了するまで会話を導くことを身につけた。

2026年のワールドモデル開発

Photon-1は、AI業界が研究者の間で広く「ワールドモデル」と呼ばれる方向へ転換しているタイミングで登場した。ワールドモデルとは、テキストを予測したり、単発の動画クリップを生成したりするだけでなく、行動に対して環境がどう変化するかを内部表現として構築するシステムのことだ。5月にGoogle DeepMindはGenie 3をリリースした。これは、テキストまたは画像から、24フレーム/秒で持続的な3D環境を生成できるリアルタイムのインタラクティブなワールドモデルである。ハードコードされたルールではなく、自ら学習した物理を備えている。200万時間の現実データで学習したオープンウェイトの基盤ワールドモデルを提供するNVIDIAのCosmosプラットフォームは、200万回を超えるダウンロードを達成し、ロボティクス企業の1X、Figure AI、Agilityが合成トレーニングデータ生成のために採用を進めている。Fei-Fei LiのWorld Labsは、テキスト、画像、または動画から編集可能な3Dワールドを作るための市販システムMarbleを立ち上げた。Yann LeCunのAMI Labs(プロダクトリリース前に推定30億ユーロの評価だったと報じられている)は、ピクセルではなく潜在空間で予測することで抽象的表現を学ぶJEPA型のアーキテクチャを追求するために5億ユーロを調達した。ほかにも注目すべき動きとして、RunwayのGen-4.5がある。これは同社が明確に「現実的な物理を備えたワールドモデル」と位置付けている。また、DreamZeroは、140億パラメータのワールドアクションモデルで、人間の動画からロボット制御へ強力なクロス・エンボディメント転移を示した。行動ラベルを使わず、視覚情報のみで実現した。

FAQ

Induction Labsは2026年7月23日に何を発表しましたか?

Induction LabsはPhoton-1を発表した。これは「想像モデル」の初号であり、アクティブパラメータが50億の、1060億パラメータのスパース・Mixture-of-Experts(MoE)トランスフォーマーだ。ラベルなしのコンピュータ画面録画の約5億7500万フレームで学習された。このモデルは、事前学習中に行動ラベルなしで動画を見て、コンピュータの使い方を学ぶ。

Photon-1の性能はGoogle Gemini 3.1 Flash-Liteと比べてどうですか?

Induction Labsは、Photon-1が社内のコンピュータ利用ベンチマークでGoogleのGemini 3.1 Flash-Liteを上回ると主張している。少なくとも計算資源が30倍以上少ないのにもかかわらず、という。会社の報告では、推論コストはGeminiの1トークン100万あたり0.36ドルに対し、Photon-1は0.11ドルだ。ベンチマークは社内のもので未公開であり、Geminiの計算資源見積りはInduction Labsによる推定値である。

2026年にどのようなワールドモデル開発がありましたか?

5月にGoogle DeepMindはGenie 3をリリースした。これは、24フレーム/秒で持続的な3D環境を生成するリアルタイムのインタラクティブなワールドモデルだ。NVIDIAのCosmosプラットフォームは200万回を超えるダウンロードを達成し、1X、Figure AI、Agilityを含むロボティクス企業に採用されている。Fei-Fei LiのWorld Labsは、編集可能な3Dワールドを作成するためのMarbleを立ち上げた。Yann LeCunのAMI Labsは、JEPA型のアーキテクチャを追求するために5億ユーロを調達した。

免責事項:本ページの情報には第三者提供の内容が含まれる場合があり、参考目的のみで提供されています。これらはGateの見解や意見を示すものではなく、金融、投資、または法律上の助言を構成するものでもありません。暗号資産取引には高いリスクが伴います。意思決定を行う際には、本ページの情報のみに依存しないでください。詳細については、免責事項をご確認ください。
コメント
0/400
コメントなし