重點
- Reflection 10 月 5 日發表 Beam:稀疏 MoE,總參數 5010 億、每個 token 啟用 230 億,主打程式與 agent 任務。
- 強化學習階段用 10,500 張 NVIDIA GB300 跑了四週,產生超過 1 億次 rollout,訓練與評分共用掉約 13 億個沙盒。
- 技術重點在非同步 RL 的穩定性:rollout 落後目前策略一整天(107 個權重版本)時,訓練仍然穩定。
- 官方分數大致與 GLM-5.2 相當,落後 Kimi K3、GLM-5.3 與 DeepSeek V4.1 Flash;「推論計算量少 3 到 4 倍」是估算值,不含 prefill 與服務成本。
- 權重、技術報告與 model card 預計本月稍晚才釋出,目前所有數字都只有 Reflection 自己的說法。
發生了什麼
Reflection 在官方部落格發表第一個開放權重模型 Beam。這是純文字模型,訓練重點放在寫程式、終端機操作與工具呼叫。
Reflection 說會在本月以 Apache 2.0 授權釋出權重,同時公開技術報告、model card 與執行、評測、微調用的工具。發表當下模型還在做最後的紅隊測試,只開放少數使用者搶先試用。
模型與預訓練
| 項目 | 數字 |
|---|---|
| 總參數 | 5010 億 |
| 每 token 啟用參數 | 230 億 |
| 層數 | 52 |
| 預訓練資料 | 23.8 兆 token |
| 預訓練硬體 | 6,144 張 GB300 NVL72,不到四週 |
| 有效上下文 | 中期訓練延伸到 100 萬 token |
架構上,Beam 交錯使用局部與全域注意力,搭配細粒度的路由專家。幾個為了讓後續強化學習穩定而做的設計:
- 專家負載平衡:沿用 DeepSeek-V3 的無輔助損失負載平衡,再讓專家偏置的更新幅度隨訓練以餘弦曲線衰減,減少後期的路由擾動。另外加上序列層級的平衡,讓模型遇到預訓練分布以外的資料時,專家使用仍然平均。預訓練結束時,最忙的專家負載平均只有理想值的 1.04 倍。
- 殘差流控制:依深度縮放子層輸出,搭配 SandwichNorm、逐元素的注意力閘門,以及用 FP32 累加殘差,壓住激活值隨層數增長與離群值。
- 資料篩選:自己訓練網頁、程式與 STEM 的品質分類器。原始網路 token 約 95% 在解析、去重與篩選中被刪掉;Reflection 說傳統過濾器會誤刪約 1.8 兆他們保留下來的高品質 token。
預訓練期間做了九次半自動回捲,原因是梯度範數突波或疑似靜默資料損毀(SDC)。訓練後期的 goodput(實際留在最終模型裡的訓練時間占比)達到 92.3%。
強化學習怎麼放大
這篇說明裡最有分量的是強化學習的規模與做法。
| 項目 | 數字 |
|---|---|
| GPU | 10,500 張 GB300,四週 |
| rollout 數 | 超過 1 億次,最長上下文 256K token |
| 訓練環境 | 近 100 萬個程式、agent 與 STEM 環境 |
| 沙盒 | 訓練與評分共約 13 億個,同時最多 17 萬個 |
| 平均同時進行的 rollout | 11 萬 |
作為對照,Reflection 列出 Thinking Machines 的 Inkling 用了 3000 萬次 rollout,MiMo 用了 75.3 萬次。Reflection 說隨著 RL 計算量增加,各項評測分數持續上升,沒有看到飽和。
非同步訓練的過期問題
Beam 用非同步的策略梯度訓練:agent 一邊產生 rollout,訓練器一邊更新並發布新權重。長時間的 rollout 裡,前面的 token 和後面的 token 可能出自不同版本的模型,越早的 token 跟目前策略差距越大。訓練引擎與推論引擎之間的數值誤差會讓問題更嚴重。
Reflection 的做法是幫每個 token 標記產生它的權重版本,讓訓練演算法把過期程度納入計算,同時逐步減少訓練與推論之間的數值落差。官方圖表顯示,即使用的是一天前、落後 107 個權重版本的樣本,數值仍然穩定。具體演算法要等技術報告才會公開。
基礎設施數字
- 新權重送到推論叢集的時間中位數約 12 秒。先跨機櫃走 RoCE,再在機櫃內走 NVLink,跨機櫃流量減少 75%。
- 推論與訓練的 GPU 比例在 3.9 到 5.4 之間調整。
- 訓練中處理了 71 次推論故障,訓練工作沒有中斷,損失的服務算力只占 0.02%。
- 90% 的新沙盒在 10 秒內就緒。
- 另外有獨立的評審模型重新檢查通過的解答,找出鑽驗證器漏洞的情況。
控制推理長度
訓練時加了可調整的長度懲罰:解對才給獎勵,多餘的 token 會扣分。RL 初期,輸出變短但分數上升;後期 agent 能力變強,輸出又變長,多出來的 token 帶來更高的分數。使用者可以用 reasoning effort 參數在速度與表現之間取捨。
Reflection 也提到一個泛化現象:某個階段的 RL 資料只有推理、軟體工程與終端機任務,瀏覽評測的分數卻一起上升。給它上網權限時,模型會自己去查詢其他大型語言模型,或呼叫 OCR API 讀文件。
安全與對齊
安全訓練另外從預訓練檢查點訓練第二個模型,用獨立的 SFT 與 RL 流程。最後用多教師的 on-policy 蒸餾(MOPD),把能力教師與安全教師合成一個模型。
安全資料以對抗方式反覆建立:每一輪訓練完,就找出會讓模型產生有害內容或過度拒答的提示,加進下一輪的資料。安全推理的部分採用 OpenAI 提出的 deliberative alignment,讓模型在推理過程中直接引用安全政策。
Reflection 說能在 RL 前預測獎勵設計會帶來多少改善,預測與實際的相關係數 r = 0.79,只看 Best-of-N 上限時是 0.46。安全評測結果要等技術報告。
分數放在一起看
以下是官方表格中的部分項目(NR 為未回報):
| 評測 | Beam | GLM-5.2 | GLM-5.3 | Kimi K3 | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 80.1 | 81.0 | 88.2 | 88.3 | 90.6 |
| DeepSWE v1.1 | 44.4 | 44.0 | 61.0 | 68.0 | 74.2 |
| SWE-Bench Pro v2-Hard | 77.2 | NR | 84.3 | 88.2 | NR |
| HLE(不用工具) | 36.2 | 40.5 | 42.3 | 46.9 | 39.1 |
| GPQA Diamond | 90.5 | 91.2 | 91.7 | 93.5 | 90.9 |
| BrowseComp | 77.4 | NR | NR | 91.2 | NR |
Beam 在美國開放模型裡領先 Inkling 與 Nemotron 3 Ultra,例如 SWE-bench Verified 80.9,對上 77.6 與 70.7。跟中國的開放模型比,它大致與 GLM-5.2 同級,GLM-5.2 已經被同公司的 GLM-5.3 取代。
限制與待驗證
- 效率是估算:「計算量少 3 到 4 倍」用的公式是 2 × 啟用參數 × 平均輸出 token 數,不含 prompt 的 prefill、隨上下文增加的注意力計算與服務開銷。這比較的是模型本身的生成計算,跟實際部署的成本是兩回事。
- 其他模型的分數來自第三方:Reflection 說比較對象的分數取自 Artificial Analysis 與 DataCurve,評測條件不一定一致,表中也有不少 NR。
- 尚未公開權重:權重與技術報告釋出前,外界無法重現任何分數,也看不到非同步 RL 演算法的細節。
- 安全結果未公布:紅隊測試還在進行,安全評測要等技術報告。