跳到內容

Technology

新聞|RoboJEPA:80 億參數的機器人潛在世界模型,預測誤差依二階冪律隨算力下降

Meta FAIR 與 Mila 等單位 10 月 7 日發表 RoboJEPA,在凍結的 V-JEPA 2.1 表徵空間中訓練 2,200 萬到 80 億參數的動作條件世界模型,資料涵蓋 12 種機器人平台。整理它的架構、資料、縮放律、規劃能力隨算力出現的順序、真實機器人結果,以及論文自己列出的限制。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

要解決的問題

語言模型的縮放律讓研究者在花算力之前,就能預估多一個數量級的算力會換來多少進步,也知道該把預算放在模型大小還是資料上。機器人世界模型還沒有這樣的工具。世界模型是學到的環境動態模型,agent 可以在裡面推演動作的後果並據此規劃。過去的潛在世界模型多半只在單一規模訓練,品質怎麼隨資料、參數與算力變化,一直沒有被刻畫出來。

機器人領域特別需要這件事,因為高品質的互動資料稀少、收集成本高。論文想回答兩個問題:

模型

RoboJEPA 只訓練預測器。凍結的 V-JEPA 2.1-G 編碼器把每個攝影機視角的畫面轉成 1,664 維的 patch 特徵,預測器根據過去的特徵、動作與本體感覺狀態,一次前向傳遞預測下一步的特徵,損失是潛在空間中的 ℓ1\ell_1 距離。

訓練目標由兩部分平均:

為了同時處理不同視角數、解析度、控制器與動作空間的資料,架構做了這些調整:

項目設計
輸入序列每個時間步依序排入各視角的視覺 token、一個動作 token、一個狀態 token
位置編碼四軸 RoPE,時間、高、寬、視角各占四分之一的通道
視角與機器人資訊每層加上可學習的視角偏置(左、右、手腕等),輸入端加上機器人與視角的嵌入
動作與狀態編碼每種機器人各有一個線性編碼器
注意力時空與視角聯合注意力,加上逐幀因果遮罩,只看最近 8 個時間步
穩定性RMSNorm 與 QK-norm;論文說 QK-norm 對擴大資料與模型時的訓練穩定特別重要
注意力變體grouped-query attention

論文說選 V-JEPA 2.1 當編碼器,是因為早期實驗中它能讓世界模型穩定、可預測地縮放,V-JEPA 2 則不行。

訓練資料

資料集群組片段數影片時數動作時數機器人
DROID9.2 萬414138Franka
Roboset7.3 萬1,244380Franka
RoboMind3.53 萬27698Franka、AgileX
LeRobot2.15 萬18293SO-101
RoboCasa365(模擬)3.2 萬482482Franka + Omron
1X2.35 萬90901X 人形機器人
AgiBot World16.75 萬8,0362,734AgiBot 雙臂、人形機器人
Open-X Embodiment(取 9 個資料集)242.65 萬4,2982,6778 種平台
合計287.13 萬15,0226,69212 種平台、26 個 ID

影片時數把所有攝影機的錄影分開加總,動作時數則不論有幾台攝影機都只算一次。

訓練

縮放律

評估指標是在沒看過的場景上,從初始觀測依照實際動作序列往後預測 9 步,每個 token 的 ℓ1\ell_1 誤差平均。評估用兩組資料:真實機器人的 DROID 保留集,與模擬的 RoboCasa。每個算力下取各模型中最低的誤差,構成算力最佳前緣。

論文用 2,200 萬到 20 億參數模型的前緣點擬合四種曲線,再看哪一種最能外推到 40 億與 80 億參數:

曲線形式DROID 外推誤差(×10⁻³)RoboCasa 外推誤差(×10⁻³)
一階冪律 E+A CαE+A\,C^{\alpha}2.03.7
二階冪律 E+A Cα−γln⁡CE+A\,C^{\alpha-\gamma\ln C}0.61.4
Broken Neural Scaling Law1.01.8
Unified Neural Scaling Law1.45.7

規劃

規劃時只給一張代表任務最終狀態的目標圖片,沒有中間子目標。規劃器用 receding-horizon 的 cross-entropy method,在潛在空間裡搜尋能讓推演結果最接近目標特徵的動作序列,每執行一段動作就重新規劃。

能力出現的順序

論文在 RoboCasa 上設計了四個任務,各自測一種能力:

任務測的能力出現時的訓練算力
移動到目標姿態末端執行器的 3D 控制約 102010^{20} FLOPs
夾著物體移動到目標姿態操作已夾住的物體約 3×10203\times10^{20} FLOPs
繞過障礙物到達目標靜態場景的幾何約 102110^{21} 起飛,約 102210^{22} 飽和
把物體推到目標位置場景中物體的動態約 102210^{22} FLOPs 之前沒有任何模型成功

前兩項只要每一步往目標靠近就能完成,大約是 5,000 萬到 1 億參數的模型在完整資料上訓練的算力。後兩項需要非貪婪的長時程規劃。

用預訓練時 K=2K=2 的設定直接測繞障礙物,獎勵雖然和算力有相關,但看不出清楚的前緣,小模型常贏大模型,例如 3 億參數的版本比 10 億的好。論文認為原因是訓練只推兩步,規劃卻要長時程的準確預測。改在冷卻階段推 K=10K=10 步、加入高解析度資料後:

真實機器人

測試平台是 DROID 的單臂 Franka,配一台裝在手臂左側的外部攝影機與一台手腕攝影機。每個模型大小用訓練算力最多的 checkpoint,三個任務各跑 30 回合,人工評分。對照組是 π0\pi_0-FAST 與 π0.5\pi_{0.5} 兩個視覺語言動作模型(VLA),各跑 50 回合。

模型目標形式抓取成功率舉起(進度/成功)取放(進度/成功)
π0\pi_0-FAST文字指令22%20% / 12%55% / 40%
π0.5\pi_{0.5}文字指令5%12% / 0%69% / 53%
RoboJEPA 2,200 萬目標圖片30%34% / 2%30% / 17%
RoboJEPA 10 億目標圖片50%53% / 24%38% / 10%
RoboJEPA 20 億目標圖片43%60% / 40%47% / 31%
RoboJEPA 40 億目標圖片60%54% / 30%49% / 21%
RoboJEPA 80 億目標圖片67%65% / 50%42% / 27%

釋出

限制

論文自己列出的限制:

另外要留意兩點:真實機器人的每個數字只有 30 回合;規劃一次要幾秒,離即時控制還有距離。

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。