跳到內容

Technology

新聞|Aleph Alpha 的 Kolibri:78B 總參數、3.46B 活躍的德英雙語 MoE

Aleph Alpha 10 月 3 日以 Apache 2.0 公開 Kolibri 與 189 頁技術報告。整理它的稀疏度與混合注意力消融、Exact Quantile Balancing、UniBPE tokenizer、德文資料與 RL 配方,以及自家評測的限制。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

規格

項目KolibriKolibri Origin(未公開的前一代)
總參數/每 token 活躍參數78.1B/3.46B30.6B/3.27B
Transformer 層50(全部 MoE)50(前 2 層 dense)
全注意力/滑動視窗層10/4050/0
專家(路由/每 token)384/6 + 1 共享128/8 + 1 共享
路由專家隱藏維度512768
注意力頭/KV 頭48/432/4
詞彙量128,00096,000
訓練過的最長 context256k64k

活躍參數不含 embedding。模型支援最長 1M token 的 context,超過 262,144 token 要在 vLLM 加額外參數。推理強度分 none、low、medium、high 四級,每次請求可以指定。

架構怎麼選出來

報告的架構決定大多先在兩個代理模型上做消融:M 規模(7.8B 總參數、0.6B 活躍)與 L 規模(30.6B 總參數、2.1B 活躍)。

稀疏度。 活躍參數固定在 3.4B,路由專家從 128 增加到 256、384,總參數分別是 42.1B、82.3B、122.6B。從 42.1B 到 82.3B,loss 與平均準確率都改善;到 122.6B 只再好一點。代價在推論端:

配置4k context 解碼速度(相對 42.1B)256k context 解碼速度兩張 H100 可同時處理的 256k 請求
82.3B慢 13%慢 4%18
122.6B慢 32%慢 12%3

他們因此把總參數定在 80B 左右。長 context 時差距縮小,是因為 KV cache 讀取的占比變大,而這部分主要來自 10 層全注意力,40 層滑動視窗只讀固定長度。

混合注意力。 每五層一層全注意力,其餘用滑動視窗。在 M 規模、算力相同時,混合模型能訓練的序列長度是全注意力模型的四倍,預訓練基準沒有退步,長 context 任務變好。視窗大小在 M 規模掃過 128 到 4096,再把 128 與 512 拿到 L 規模驗證:

視窗預訓練基準平均長 context 綜合分
12848.0%76.2%
51247.8%77.1%

到 128k 為止兩者最多差 3.1 個百分點;到 256k,512 的視窗高 6.7 個百分點。位置編碼只放在滑動視窗層(RoPE,θ = 10,000)。早期實驗中,拿掉全注意力層的 RoPE 改善了長 context 表現。每層都對 query 與 key 做 RMS 正規化,報告說在增益參數夠小的前提下,這也讓 RL 時的 FP8 KV cache 不會溢位。

負載平衡。 專家偏置只影響選誰,加權仍用未偏置的 sigmoid 分數,選出後也不重新正規化。全域平衡用 Exact Quantile Balancing(EQB)。Kimi 的做法是每個專家累積 1000 格直方圖再加總,精度受格寬限制;Marin 把各 rank 的分位數取平均,結果和整批的分位數不一定相同。EQB 把 bfloat16 數值編成可排序的 16 位元鍵,用兩輪 radix selection 求出整批的精確分位數,每層每個最佳化步驟只需要兩次 all-reduce,傳輸量和批次大小無關。各 microbatch 的局部平衡則用 Load-Error Injection,把每個專家偏離目標負載的量直接加進分數的梯度。

預訓練全程,各層平均的全域 MaxVio 維持在 0.31。前兩層例外,平均 2.39。報告也寫到,前兩層 MoE 的負載雖然平衡,卻幾乎不用路由專家。

UniBPE tokenizer

BPE 每一步合併出現次數最多的相鄰配對。UniBPE 保留 BPE 由下往上合併的流程,改用 Unigram 的語料負對數似然來排序:每一步選讓這個損失下降最多的合併。這個變化量有封閉解,只需要配對次數和兩個母 token 的次數,和 BPE 用到的資訊一樣多。

詞彙表的組成是 256 個 byte token、119,744 次 UniBPE 合併、7,900 次標準 BPE 合併,再加 100 個保留與特殊 token。後段改回標準 BPE,是因為前一代純用 UniBPE 時壓縮率變差,有些有用的合併(例如連續的句點)在 UniBPE 下很難出現。

指標Kolibri對照
德文網頁(FineWeb-2)bytes/token4.90GPT-5 4.35(外部 tokenizer 中最高)
英文網頁(FineWeb)bytes/token4.58GPT-5 4.67
切分落在詞素邊界的精確率(德文/英文)65%/50%外部 tokenizer 最高 49%/42%

同樣資料、同樣詞彙量訓練的純 BPE,德文壓縮率是 4.89,和 Kolibri 幾乎相同,差別主要在切分位置。M 規模的消融裡,兩種 tokenizer 的 bits per byte 一樣,Kolibri 的 tokenizer 在 RULER 變數追蹤與 HELMET JSON KV 兩個長 context 檢索任務上,每個長度的召回率都較高。

資料與預訓練

階段Token 數序列長度每步 batch
預訓練20T(約 21 天)16k75.5M tokens
中段訓練3.4T64k100.7M tokens
長 context 擴展200B256k201.3M tokens

預訓練用 768 張 B200。注意力與專家權重用 Muon,embedding 與正規化用 Adam,LM head 與 router 用 AdamW。學習率 warmup 後一路維持常數,不做 cooldown;base 模型是長 context 階段最後 20 個 checkpoint(每個相隔 10B tokens)的平均。報告說在他們的實驗裡,這樣做的後訓練表現比 cooldown 好。

德文比例來自消融實驗:在 20T 的訓練量下,德文約占 20% 時德文基準表現良好,換算下來至少需要 4T 個德文訓練 token(含重複取樣)。公開德文資料集加總約 1.94T,還沒扣掉過濾、去重與重疊。補足的方式有三種:

整體預訓練資料約 24%(4.8T)是合成資料,包括改寫與翻譯。

容錯紀錄。 主預訓練淨用 377,000 GPU 小時,發生 38 次非預期中斷,約每 1,000 GPU 小時 0.1 次。其中 10 次是 GPU 或節點硬體故障,9 次是物件儲存讀取逾時,16 次沒有查出原因。每次自動恢復平均 45.3 分鐘,合計 28.7 小時。checkpoint 每 250 步存一次。

後訓練

SFT 從 base 模型訓練 4,000 步,約 268B 個 packed tokens。德文推理資料從 SFT 開始放入,目標是讓模型在推理過程中也用德文。

RL 從 SFT checkpoint 開始,訓練 1,000 步。每批 256 組、每組 8 條序列,一條序列最多 100 個 rollout 步驟,context 最長 256k。最後一次 RL 用 38 個環境(31 個英文、7 個德文版本),訓練資料共 1,209,965 筆。目標函數的組成:

驗證集上的平均環境獎勵從前 50 步的 0.62 升到最後 50 步的 0.83,增幅最大的是指令遵循與結構化輸出(0.65 → 0.94)。

基準SFTRL差
AIME 202692.196.0+3.9
GPQA Diamond79.884.3+4.5
AA-Omniscience Index−68.8−32.8+36.0
τ³-bench banking13.138.1+25.0
BrowseComp22.029.4+7.4
LiveCodeBench v675.385.9+10.6
IFBench48.278.1+29.9
LongBench Pro57.164.5+7.4

減少幻覺的環境。 RAG 題目以 Merlin–Arthur 協定改造。Merlin 從檢索內容中遮掉「拿掉後最能提高正確答案機率」的句子,Morgana 遮掉「拿掉後最能降低正確答案機率」的句子。每題以完整內容、Merlin 版、Morgana 版各問一次,不標示是哪一版。前兩種答對得分,Morgana 版要回答「不知道」才得分。兩者的遮罩每一步都依當前策略重算。

評測結果

報告比較了 12 個開放權重的後訓練模型。所有模型用 Aleph Alpha 的 eval-framework 或 Harbor 評測,Kolibri 用 high 推理強度,其他模型用各自模型卡記載的 context 與取樣參數。

基準KolibriQwen3.5 35B-A3BQwen3.6 35B-A3BNemotron 3 Super 120B-A12BQwen3.8 27B(dense)
整體(英文)75.574.771.473.080.2
整體(德文)70.869.867.367.979.9
AIME 2026(英文)96.092.191.090.497.7
GPQA Diamond(英文)84.383.883.478.089.2
SWE-Bench Verified66.471.673.860.272.6
TerminalBench 2.127.739.7–39.776.8
BFCL v4(整體)61.470.567.261.073.2
AA-Omniscience 不幻覺率44.011.156.713.967.3

整體分數上,Kolibri 比 Qwen3.5 35B-A3B 高 0.8(英文)與 1.0(德文),是比較的 MoE 模型裡最高。數學是它最強的項目,英文 AIME 兩屆只輸給 Qwen3.8 27B。程式代理與工具呼叫則落後同級模型:SWE-Bench Verified、TerminalBench 2.1 與 BFCL v4 都低於 Qwen3.5 35B-A3B。

幻覺相關指標比前一代進步很多。AA-Omniscience 不幻覺率從 15.0 升到 44.0,RGB 在文件沒有答案時的保留率從 73.9 升到 85.6。在比較的模型中,Qwen3.6 35B-A3B 的不幻覺率 56.7 仍然較高。

限制

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。