跳到內容

Technology

新聞|Reflection 的 Beam:5010 億參數 MoE 與上億次 rollout 的非同步強化學習

Reflection 公開第一個開放權重模型 Beam 的技術說明:5010 億總參數、230 億啟用參數的 MoE,經過 1 萬多張 GB300、四週、上億次 rollout 的非同步強化學習。整理它的訓練方法、規模數字、跟其他開放模型的分數比較,以及目前還無法驗證的部分。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

發生了什麼

Reflection 在官方部落格發表第一個開放權重模型 Beam。這是純文字模型,訓練重點放在寫程式、終端機操作與工具呼叫。

Reflection 說會在本月以 Apache 2.0 授權釋出權重,同時公開技術報告、model card 與執行、評測、微調用的工具。發表當下模型還在做最後的紅隊測試,只開放少數使用者搶先試用。

模型與預訓練

項目數字
總參數5010 億
每 token 啟用參數230 億
層數52
預訓練資料23.8 兆 token
預訓練硬體6,144 張 GB300 NVL72,不到四週
有效上下文中期訓練延伸到 100 萬 token

架構上,Beam 交錯使用局部與全域注意力,搭配細粒度的路由專家。幾個為了讓後續強化學習穩定而做的設計:

預訓練期間做了九次半自動回捲,原因是梯度範數突波或疑似靜默資料損毀(SDC)。訓練後期的 goodput(實際留在最終模型裡的訓練時間占比)達到 92.3%。

強化學習怎麼放大

這篇說明裡最有分量的是強化學習的規模與做法。

項目數字
GPU10,500 張 GB300,四週
rollout 數超過 1 億次,最長上下文 256K token
訓練環境近 100 萬個程式、agent 與 STEM 環境
沙盒訓練與評分共約 13 億個,同時最多 17 萬個
平均同時進行的 rollout11 萬

作為對照,Reflection 列出 Thinking Machines 的 Inkling 用了 3000 萬次 rollout,MiMo 用了 75.3 萬次。Reflection 說隨著 RL 計算量增加,各項評測分數持續上升,沒有看到飽和。

非同步訓練的過期問題

Beam 用非同步的策略梯度訓練:agent 一邊產生 rollout,訓練器一邊更新並發布新權重。長時間的 rollout 裡,前面的 token 和後面的 token 可能出自不同版本的模型,越早的 token 跟目前策略差距越大。訓練引擎與推論引擎之間的數值誤差會讓問題更嚴重。

Reflection 的做法是幫每個 token 標記產生它的權重版本,讓訓練演算法把過期程度納入計算,同時逐步減少訓練與推論之間的數值落差。官方圖表顯示,即使用的是一天前、落後 107 個權重版本的樣本,數值仍然穩定。具體演算法要等技術報告才會公開。

基礎設施數字

控制推理長度

訓練時加了可調整的長度懲罰:解對才給獎勵,多餘的 token 會扣分。RL 初期,輸出變短但分數上升;後期 agent 能力變強,輸出又變長,多出來的 token 帶來更高的分數。使用者可以用 reasoning effort 參數在速度與表現之間取捨。

Reflection 也提到一個泛化現象:某個階段的 RL 資料只有推理、軟體工程與終端機任務,瀏覽評測的分數卻一起上升。給它上網權限時,模型會自己去查詢其他大型語言模型,或呼叫 OCR API 讀文件。

安全與對齊

安全訓練另外從預訓練檢查點訓練第二個模型,用獨立的 SFT 與 RL 流程。最後用多教師的 on-policy 蒸餾(MOPD),把能力教師與安全教師合成一個模型。

安全資料以對抗方式反覆建立:每一輪訓練完,就找出會讓模型產生有害內容或過度拒答的提示,加進下一輪的資料。安全推理的部分採用 OpenAI 提出的 deliberative alignment,讓模型在推理過程中直接引用安全政策。

Reflection 說能在 RL 前預測獎勵設計會帶來多少改善,預測與實際的相關係數 r = 0.79,只看 Best-of-N 上限時是 0.46。安全評測結果要等技術報告。

分數放在一起看

以下是官方表格中的部分項目(NR 為未回報):

評測BeamGLM-5.2GLM-5.3Kimi K3DeepSeek V4.1 Flash
Terminal-Bench 2.180.181.088.288.390.6
DeepSWE v1.144.444.061.068.074.2
SWE-Bench Pro v2-Hard77.2NR84.388.2NR
HLE(不用工具)36.240.542.346.939.1
GPQA Diamond90.591.291.793.590.9
BrowseComp77.4NRNR91.2NR

Beam 在美國開放模型裡領先 Inkling 與 Nemotron 3 Ultra,例如 SWE-bench Verified 80.9,對上 77.6 與 70.7。跟中國的開放模型比,它大致與 GLM-5.2 同級,GLM-5.2 已經被同公司的 GLM-5.3 取代。

限制與待驗證

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。