Induction Labs 於 2026 年 7 月 23 日揭露 Photon-1,這是它所稱「想像模型(imagination models)」的第一款——一種新的基礎架構類別,旨在於預訓練期間,從網路規模影片中學習,而不需要帶有標註動作的示例。這款 10.6 億(106-billion)參數的稀疏專家混合(mixture-of-experts)Transformer,具有 50 億(5 billion)個啟用參數,訓練於約 5.75 億(575 million)張電腦螢幕錄影幀,等同於以每秒 1 幀取樣的 18 年影片。該公司宣稱,Photon-1 在內部電腦使用基準測試中優於 Google 的 Gemini 3.1 Flash-Lite,儘管其訓練所用計算量至少只有後者的 1/30;同時,在提供服務時的成本約為每百萬 tokens 3 倍更便宜,Photon-1 為 $0.11,Gemini 為 $0.36。該模型挑戰了 AI 長久以來的假設:要教機器行動,必須對每一種它應執行的動作都提供精細標註的示例。Induction Labs 的做法透過讓機器僅藉由觀察未標註的電腦介面使用影片來學習程序性知識,消除了關鍵瓶頸。
Photon-1 以單一 epoch 從零開始訓練,資料集源自一個最初索引為 20 億(two billion)個公開可用影片,經過過濾後約剩下 200 萬(roughly two million)段螢幕錄影,並由內部的關鍵幀偵測模型移除冗餘幀。訓練過程約需要 3 萬(30,000)小時的輝達 H200 GPU-hours 與 4.4 × 10²² FLOPs。每個影片幀會透過有限標量量化(finite scalar quantization)被壓縮成 960 個離散 tokens,僅佔 2.2 kilobytes——約比現有的 OCR 與多模態表示小 100 倍——同時保留文字、布局與狀態變化。差分潛在編碼器(differential latent encoder)將幀以成對方式處理,編碼的是相鄰狀態之間的差異,而非編碼絕對幀內容。模型使用下一個潛在 token(next-latent-token)目標,在學習到的表示空間中以自回歸方式預測未來幀。Induction Labs 所引用的基準測試結果附帶重要限制:該基準為內部測試且未釋出,意味著結果無法被獨立重現;而 Gemini 的計算量估計是 Induction Labs 自己的保守推估,而非經驗證的資料。
要把觀察到的知識轉化成能運作的代理(agent),需要第二階段。Induction Labs 將 Photon-1 使用少於 35,000(35,000)條已標註的電腦使用軌跡進行微調,讓它學會正確的動作格式,並加入特殊 tokens,使模型能輸出鍵盤與滑鼠指令。在推論(inference)時,系統以兩步驟運作:首先想像能推進任務的下一個狀態,接著生成用以到達該狀態的動作。其後進行線上強化學習(online reinforcement learning),透過在橫跨五種桌面環境的 Linux 虛擬機上進行即時回合(rollouts)、以程式化方式驗證結果,以及獎勵訊號來驅動進一步的改進。當以 20,000(20,000)場錦標賽西洋棋(tournament checkers)遊戲進行微調時,Photon-1 在世界模擬與走子品質上,同時優於視覺編碼器基準與一個規模相近的語言模型基準。在 10,000(10,000)個由合成方式生成的撞球(billiard)遊戲上,它在球位置預測的平均絕對誤差(mean absolute error)達到 0.47;相較之下,LLM 基準為 1.15、視覺基準為 1.44。該模型也從預訓練資料中學到人類的行為模式:能在虛擬機中的 ChatGPT 克隆環境裡學會發出提示(prompt)、檢查其輸出,並在對話進行中引導,直到任務完成。
Photon-1 在一個 AI 產業正轉向研究者廣泛稱為「世界模型」的時刻到來——這類系統會建立環境如何隨動作而演化的內部表徵(internal representations),而不只是預測文字或生成孤立的影片片段。5 月,Google DeepMind 發布 Genie 3,這是一種即時互動的世界模型(real-time interactive world model),能以每秒 24 幀從文字或影像生成持續的 3D 環境,並使用自我學習的物理(self-learned physics),而非硬編碼規則。NVIDIA 的 Cosmos 平台提供開放權重的世界基礎模型(world foundation models),以 2,000 萬(20 million)小時的真實世界資料訓練;其下載量已超過 200 萬次,並正被包含 1X、Figure AI 與 Agility 在內的機器人公司採用,用於合成訓練資料的生成。Fei-Fei Li 的 World Labs 推出 Marble,這是一套可商用的系統,可透過文字、影像或影片建立可編輯的 3D 世界。Yann LeCun 的 AMI Labs(據報在推出產品前估值 30 億歐元)募集了 5 億歐元(€500 million),以追求採用 JEPA 類型架構(JEPA-style architectures):透過在潛在空間中進行預測來學習抽象表徵,而不是在像素層級。其他值得注意的進展包括 Runway 的 Gen-4.5;該公司明確將其定位為「具有真實物理的世界模型」。此外還有 DreamZero:一款具有 140 億(14-billion)參數的世界動作模型(world action model),展示了從人類影片到機器人控制的強力跨具身(cross-embodiment)遷移能力,且僅使用視覺資訊、無需動作標籤。
Induction Labs 於 2026 年 7 月 23 日揭露了什麼?
Induction Labs 揭露 Photon-1,這是第一款「想像模型(imagination models)」——一個具有 10.6 億(106-billion)參數的稀疏專家混合(mixture-of-experts)Transformer,擁有 50 億(5 billion)個啟用參數,訓練於約 5.75 億(575 million)幀的未標註電腦螢幕錄影。該模型在預訓練期間透過觀看不含動作標籤的影片來學習如何使用電腦。
Photon-1 的表現如何相較於 Google Gemini 3.1 Flash-Lite?
Induction Labs 宣稱,Photon-1 在內部電腦使用基準測試中優於 Google 的 Gemini 3.1 Flash-Lite,即便其訓練所用計算量至少只有後者的 1/30。該公司指出,推論成本為每百萬 tokens $0.11,而 Gemini 為 $0.36。該基準為內部且未釋出,且 Gemini 的計算量估計是 Induction Labs 自己的推估。
2026 年有哪些世界模型的發展?
5 月,Google DeepMind 發布 Genie 3,一種即時互動的世界模型,可在每秒 24 幀生成持續的 3D 環境。NVIDIA 的 Cosmos 平台下載量已超過 200 萬次,並正被包含 1X、Figure AI 與 Agility 在內的機器人公司採用。Fei-Fei Li 的 World Labs 推出 Marble,用於建立可編輯的 3D 世界。Yann LeCun 的 AMI Labs 募集了 5 億歐元,以追求 JEPA 類型架構。
相關新聞