重點
- Meta FAIR 與 Mila 等單位的研究者 10 月 7 日(台北時間 10 月 8 日)在 arXiv 發表 RoboJEPA,一系列在凍結的 V-JEPA 2.1 表徵空間中預測未來的機器人世界模型,參數量從 2,200 萬到 80 億。80 億參數的版本是目前最大的 JEPA 預測器。
- 訓練資料整合 23 個公開操作資料集,涵蓋 12 種機器人平台、26 種動作空間,共 15,022 小時影片,其中 6,692 小時有對應的動作紀錄。
- 用 2,200 萬到 20 億參數的模型擬合,論文比較了四種縮放律形式,二階冪律 外推到 40 億與 80 億參數時誤差最小。估計出的不可約誤差顯示,目前的資料量已接近飽和。
- 規劃能力隨訓練算力依序出現:末端執行器移動約在 FLOPs,夾著物體移動約 ,繞過障礙物約 ,推動物體要到約 。長時程任務只有在冷卻階段改用 10 步自迴歸訓練後,才出現清楚的縮放趨勢。
- 在真實的 Franka 機器人上,只給一張目標圖片、不做任務微調,80 億參數版本的抓取成功率 67%、舉起 50%。取放任務的成功率沒有隨模型變大而一路上升,最好的是 20 億參數版本的 31%。
要解決的問題
語言模型的縮放律讓研究者在花算力之前,就能預估多一個數量級的算力會換來多少進步,也知道該把預算放在模型大小還是資料上。機器人世界模型還沒有這樣的工具。世界模型是學到的環境動態模型,agent 可以在裡面推演動作的後果並據此規劃。過去的潛在世界模型多半只在單一規模訓練,品質怎麼隨資料、參數與算力變化,一直沒有被刻畫出來。
機器人領域特別需要這件事,因為高品質的互動資料稀少、收集成本高。論文想回答兩個問題:
- 世界模型的離線預測誤差,能不能用算力的函數準確外推?
- 離線誤差的改善,會不會反映在實際規劃的成功率上?
模型
RoboJEPA 只訓練預測器。凍結的 V-JEPA 2.1-G 編碼器把每個攝影機視角的畫面轉成 1,664 維的 patch 特徵,預測器根據過去的特徵、動作與本體感覺狀態,一次前向傳遞預測下一步的特徵,損失是潛在空間中的 距離。
訓練目標由兩部分平均:
- teacher forcing:每一步都給真實的特徵,預測下一步
- 自迴歸 rollout:只給較短的特徵前綴與完整的動作序列,讓模型用自己的預測接著往下推,降低誤差累積。預訓練時推 步,冷卻階段推 步
為了同時處理不同視角數、解析度、控制器與動作空間的資料,架構做了這些調整:
| 項目 | 設計 |
|---|---|
| 輸入序列 | 每個時間步依序排入各視角的視覺 token、一個動作 token、一個狀態 token |
| 位置編碼 | 四軸 RoPE,時間、高、寬、視角各占四分之一的通道 |
| 視角與機器人資訊 | 每層加上可學習的視角偏置(左、右、手腕等),輸入端加上機器人與視角的嵌入 |
| 動作與狀態編碼 | 每種機器人各有一個線性編碼器 |
| 注意力 | 時空與視角聯合注意力,加上逐幀因果遮罩,只看最近 8 個時間步 |
| 穩定性 | RMSNorm 與 QK-norm;論文說 QK-norm 對擴大資料與模型時的訓練穩定特別重要 |
| 注意力變體 | grouped-query attention |
論文說選 V-JEPA 2.1 當編碼器,是因為早期實驗中它能讓世界模型穩定、可預測地縮放,V-JEPA 2 則不行。
訓練資料
| 資料集群組 | 片段數 | 影片時數 | 動作時數 | 機器人 |
|---|---|---|---|---|
| DROID | 9.2 萬 | 414 | 138 | Franka |
| Roboset | 7.3 萬 | 1,244 | 380 | Franka |
| RoboMind | 3.53 萬 | 276 | 98 | Franka、AgileX |
| LeRobot | 2.15 萬 | 182 | 93 | SO-101 |
| RoboCasa365(模擬) | 3.2 萬 | 482 | 482 | Franka + Omron |
| 1X | 2.35 萬 | 90 | 90 | 1X 人形機器人 |
| AgiBot World | 16.75 萬 | 8,036 | 2,734 | AgiBot 雙臂、人形機器人 |
| Open-X Embodiment(取 9 個資料集) | 242.65 萬 | 4,298 | 2,677 | 8 種平台 |
| 合計 | 287.13 萬 | 15,022 | 6,692 | 12 種平台、26 個 ID |
影片時數把所有攝影機的錄影分開加總,動作時數則不論有幾台攝影機都只算一次。
訓練
- 模型從 2,200 萬到 80 億參數,訓練算力從 到 FLOPs。
- 學習率先暖身,大部分時間固定在 ,最後短暫線性降到零。固定學習率的階段只跑一次,不同算力的模型從中途的 checkpoint 分別做冷卻,省下重複訓練的成本。
- GPU 依視角數與解析度分組,每組用不同的批次大小平衡各組的步驟時間。最後用了四組:單視角與雙視角,各分 240×320 與 480×640 兩種解析度。
- 以 10 億參數的版本為例,用了 32 個節點、256 張 H100。
縮放律
評估指標是在沒看過的場景上,從初始觀測依照實際動作序列往後預測 9 步,每個 token 的 誤差平均。評估用兩組資料:真實機器人的 DROID 保留集,與模擬的 RoboCasa。每個算力下取各模型中最低的誤差,構成算力最佳前緣。
論文用 2,200 萬到 20 億參數模型的前緣點擬合四種曲線,再看哪一種最能外推到 40 億與 80 億參數:
| 曲線形式 | DROID 外推誤差(×10⁻³) | RoboCasa 外推誤差(×10⁻³) |
|---|---|---|
| 一階冪律 | 2.0 | 3.7 |
| 二階冪律 | 0.6 | 1.4 |
| Broken Neural Scaling Law | 1.0 | 1.8 |
| Unified Neural Scaling Law | 1.4 | 5.7 |
- 二階冪律的指數會隨算力的對數線性變化,外推誤差比一階冪律低約 2 到 3 倍。
- 沒有任何一個模型大小從頭到尾都在前緣上。
- 表現最好的兩種形式估出幾乎相同的不可約誤差:DROID 約 0.2,RoboCasa 約 0.17。論文據此認為,在目前的訓練與資料預算下,RoboJEPA 已接近飽和。
規劃
規劃時只給一張代表任務最終狀態的目標圖片,沒有中間子目標。規劃器用 receding-horizon 的 cross-entropy method,在潛在空間裡搜尋能讓推演結果最接近目標特徵的動作序列,每執行一段動作就重新規劃。
- 同一個機器人上的所有任務與模型大小共用一組規劃超參數,較難的任務只調長規劃步數。
- 兩個平台上總共跑了超過 5 萬個評估回合。
- 為了讓規劃跑得動,用了滾動的 KV cache、預先編譯並存檔的推論引擎,並把機器人直接連到 GPU 叢集平行規劃。80 億參數的模型做一次多步規劃要幾秒,還不是即時的。
- 單純用 BF16 執行時,瓶頸在主機端的 kernel 派送,不在矩陣乘法。改用 AOT Inductor 編譯後,單視角模型在 H200、批次 16 的每步時間從 145.6 毫秒降到 45.0 毫秒。
能力出現的順序
論文在 RoboCasa 上設計了四個任務,各自測一種能力:
| 任務 | 測的能力 | 出現時的訓練算力 |
|---|---|---|
| 移動到目標姿態 | 末端執行器的 3D 控制 | 約 FLOPs |
| 夾著物體移動到目標姿態 | 操作已夾住的物體 | 約 FLOPs |
| 繞過障礙物到達目標 | 靜態場景的幾何 | 約 起飛,約 飽和 |
| 把物體推到目標位置 | 場景中物體的動態 | 約 FLOPs 之前沒有任何模型成功 |
前兩項只要每一步往目標靠近就能完成,大約是 5,000 萬到 1 億參數的模型在完整資料上訓練的算力。後兩項需要非貪婪的長時程規劃。
用預訓練時 的設定直接測繞障礙物,獎勵雖然和算力有相關,但看不出清楚的前緣,小模型常贏大模型,例如 3 億參數的版本比 10 億的好。論文認為原因是訓練只推兩步,規劃卻要長時程的準確預測。改在冷卻階段推 步、加入高解析度資料後:
- 每步訓練的成本變高,但總算力超過約 FLOPs(前緣上約 3 億到 10 億參數)之後,反而更省算力,預測誤差也明顯較低。
- 擬合出的不可約誤差下降,論文認為這表示誤差累積確實減少了。
- 繞障礙物的獎勵開始清楚地依照縮放趨勢變化,3 億參數以下的模型停在約 0.3,對應末端執行器卡在障礙物錯誤的一側。
真實機器人
測試平台是 DROID 的單臂 Franka,配一台裝在手臂左側的外部攝影機與一台手腕攝影機。每個模型大小用訓練算力最多的 checkpoint,三個任務各跑 30 回合,人工評分。對照組是 -FAST 與 兩個視覺語言動作模型(VLA),各跑 50 回合。
| 模型 | 目標形式 | 抓取成功率 | 舉起(進度/成功) | 取放(進度/成功) |
|---|---|---|---|---|
| -FAST | 文字指令 | 22% | 20% / 12% | 55% / 40% |
| 文字指令 | 5% | 12% / 0% | 69% / 53% | |
| RoboJEPA 2,200 萬 | 目標圖片 | 30% | 34% / 2% | 30% / 17% |
| RoboJEPA 10 億 | 目標圖片 | 50% | 53% / 24% | 38% / 10% |
| RoboJEPA 20 億 | 目標圖片 | 43% | 60% / 40% | 47% / 31% |
| RoboJEPA 40 億 | 目標圖片 | 60% | 54% / 30% | 49% / 21% |
| RoboJEPA 80 億 | 目標圖片 | 67% | 65% / 50% | 42% / 27% |
- 進度是每回合分數的平均,成功率是進度達 100% 的回合比例。RoboJEPA 的抓取任務只有成敗兩種結果,所以進度等於成功率。
- 所有大小的 RoboJEPA 在三個任務上都有非零的成功率。抓取與舉起大致隨模型變大而提升,取放任務沒有一致的趨勢。
- VLA 在最難的取放任務上最好,在其他任務上明顯退步, 舉起的成功率是 0%。論文推測是因為 DROID 資料以取放為主,「lift」這類動詞很少出現。
- 兩邊的差異很多:VLA 用文字指令且在 DROID 上微調過,RoboJEPA 用目標圖片,DROID 只是預訓練資料的一部分。論文因此把 VLA 的數字當作參考,不當作可以直接比較的對照組。
- 質性觀察:小模型的主要弱點是夾爪控制,成功時軌跡平順,但從不適合的位置接近物體後很難修正;大模型較能從錯誤中恢復。論文在引言也提到,20 億參數以下的模型夾住物體後常會不小心張開夾爪,讓物體掉下去。
釋出
- 程式碼與每個模型大小在訓練過程中存下的所有 checkpoint 都已公開,另有一個在 DROID 上以三個視角、720p 微調的 80 億參數版本。
- README 標示的授權是 CC BY-NC-SA 4.0,不能商用。
- 另外訓練了一個擴散解碼器,把潛在預測轉回影片,只用於視覺化,不參與規劃。
限制
論文自己列出的限制:
- 編碼器凍結:縮放律描述的是固定表徵上的動態模型,不是編碼器與預測器一起擴大的情況。
- 接近資料飽和:訓練在固定語料上跑多個 epoch,要再往前推,可能需要更多、更多樣的互動資料,光加參數不夠。
- 沒有用到文字:只能用單一目標圖片指定任務。
- 規劃時沒有策略提議:動作從均勻分布抽樣,再由世界模型排序。
另外要留意兩點:真實機器人的每個數字只有 30 回合;規劃一次要幾秒,離即時控制還有距離。