重點
- Aleph Alpha 在 10 月 3 日以 Apache 2.0 公開 Kolibri 的權重與 189 頁技術報告。這是英德雙語的 MoE 模型,總參數 78.1B,每個 token 只用 3.46B(4.4%)。
- 50 層裡 40 層用 512 token 的滑動視窗注意力,10 層用不帶位置編碼的全注意力;每層 MoE 從 384 個專家選 6 個,另加 1 個共享專家。
- 三個階段共訓練約 24T tokens,德文占預訓練的 21.3%。新的 UniBPE tokenizer 在德文網頁上每 token 4.90 bytes,比 GPT-5 的 tokenizer 少用 11.2% 的 token。
- 強化學習用 38 個環境、約 121 萬筆訓練資料。從 SFT 到 RL,IFBench 由 48.2 升到 78.1,τ³-bench banking 由 13.1 升到 38.1。
- 所有分數都來自 Aleph Alpha 自己的評測設定。整體分數高於比較的其他 MoE 模型,但低於 dense 的 Qwen3.8 27B。
規格
| 項目 | Kolibri | Kolibri Origin(未公開的前一代) |
|---|---|---|
| 總參數/每 token 活躍參數 | 78.1B/3.46B | 30.6B/3.27B |
| Transformer 層 | 50(全部 MoE) | 50(前 2 層 dense) |
| 全注意力/滑動視窗層 | 10/40 | 50/0 |
| 專家(路由/每 token) | 384/6 + 1 共享 | 128/8 + 1 共享 |
| 路由專家隱藏維度 | 512 | 768 |
| 注意力頭/KV 頭 | 48/4 | 32/4 |
| 詞彙量 | 128,000 | 96,000 |
| 訓練過的最長 context | 256k | 64k |
活躍參數不含 embedding。模型支援最長 1M token 的 context,超過 262,144 token 要在 vLLM 加額外參數。推理強度分 none、low、medium、high 四級,每次請求可以指定。
架構怎麼選出來
報告的架構決定大多先在兩個代理模型上做消融:M 規模(7.8B 總參數、0.6B 活躍)與 L 規模(30.6B 總參數、2.1B 活躍)。
稀疏度。 活躍參數固定在 3.4B,路由專家從 128 增加到 256、384,總參數分別是 42.1B、82.3B、122.6B。從 42.1B 到 82.3B,loss 與平均準確率都改善;到 122.6B 只再好一點。代價在推論端:
| 配置 | 4k context 解碼速度(相對 42.1B) | 256k context 解碼速度 | 兩張 H100 可同時處理的 256k 請求 |
|---|---|---|---|
| 82.3B | 慢 13% | 慢 4% | 18 |
| 122.6B | 慢 32% | 慢 12% | 3 |
他們因此把總參數定在 80B 左右。長 context 時差距縮小,是因為 KV cache 讀取的占比變大,而這部分主要來自 10 層全注意力,40 層滑動視窗只讀固定長度。
混合注意力。 每五層一層全注意力,其餘用滑動視窗。在 M 規模、算力相同時,混合模型能訓練的序列長度是全注意力模型的四倍,預訓練基準沒有退步,長 context 任務變好。視窗大小在 M 規模掃過 128 到 4096,再把 128 與 512 拿到 L 規模驗證:
| 視窗 | 預訓練基準平均 | 長 context 綜合分 |
|---|---|---|
| 128 | 48.0% | 76.2% |
| 512 | 47.8% | 77.1% |
到 128k 為止兩者最多差 3.1 個百分點;到 256k,512 的視窗高 6.7 個百分點。位置編碼只放在滑動視窗層(RoPE,θ = 10,000)。早期實驗中,拿掉全注意力層的 RoPE 改善了長 context 表現。每層都對 query 與 key 做 RMS 正規化,報告說在增益參數夠小的前提下,這也讓 RL 時的 FP8 KV cache 不會溢位。
負載平衡。 專家偏置只影響選誰,加權仍用未偏置的 sigmoid 分數,選出後也不重新正規化。全域平衡用 Exact Quantile Balancing(EQB)。Kimi 的做法是每個專家累積 1000 格直方圖再加總,精度受格寬限制;Marin 把各 rank 的分位數取平均,結果和整批的分位數不一定相同。EQB 把 bfloat16 數值編成可排序的 16 位元鍵,用兩輪 radix selection 求出整批的精確分位數,每層每個最佳化步驟只需要兩次 all-reduce,傳輸量和批次大小無關。各 microbatch 的局部平衡則用 Load-Error Injection,把每個專家偏離目標負載的量直接加進分數的梯度。
預訓練全程,各層平均的全域 MaxVio 維持在 0.31。前兩層例外,平均 2.39。報告也寫到,前兩層 MoE 的負載雖然平衡,卻幾乎不用路由專家。
UniBPE tokenizer
BPE 每一步合併出現次數最多的相鄰配對。UniBPE 保留 BPE 由下往上合併的流程,改用 Unigram 的語料負對數似然來排序:每一步選讓這個損失下降最多的合併。這個變化量有封閉解,只需要配對次數和兩個母 token 的次數,和 BPE 用到的資訊一樣多。
詞彙表的組成是 256 個 byte token、119,744 次 UniBPE 合併、7,900 次標準 BPE 合併,再加 100 個保留與特殊 token。後段改回標準 BPE,是因為前一代純用 UniBPE 時壓縮率變差,有些有用的合併(例如連續的句點)在 UniBPE 下很難出現。
| 指標 | Kolibri | 對照 |
|---|---|---|
| 德文網頁(FineWeb-2)bytes/token | 4.90 | GPT-5 4.35(外部 tokenizer 中最高) |
| 英文網頁(FineWeb)bytes/token | 4.58 | GPT-5 4.67 |
| 切分落在詞素邊界的精確率(德文/英文) | 65%/50% | 外部 tokenizer 最高 49%/42% |
同樣資料、同樣詞彙量訓練的純 BPE,德文壓縮率是 4.89,和 Kolibri 幾乎相同,差別主要在切分位置。M 規模的消融裡,兩種 tokenizer 的 bits per byte 一樣,Kolibri 的 tokenizer 在 RULER 變數追蹤與 HELMET JSON KV 兩個長 context 檢索任務上,每個長度的召回率都較高。
資料與預訓練
| 階段 | Token 數 | 序列長度 | 每步 batch |
|---|---|---|---|
| 預訓練 | 20T(約 21 天) | 16k | 75.5M tokens |
| 中段訓練 | 3.4T | 64k | 100.7M tokens |
| 長 context 擴展 | 200B | 256k | 201.3M tokens |
預訓練用 768 張 B200。注意力與專家權重用 Muon,embedding 與正規化用 Adam,LM head 與 router 用 AdamW。學習率 warmup 後一路維持常數,不做 cooldown;base 模型是長 context 階段最後 20 個 checkpoint(每個相隔 10B tokens)的平均。報告說在他們的實驗裡,這樣做的後訓練表現比 cooldown 好。
德文比例來自消融實驗:在 20T 的訓練量下,德文約占 20% 時德文基準表現良好,換算下來至少需要 4T 個德文訓練 token(含重複取樣)。公開德文資料集加總約 1.94T,還沒扣掉過濾、去重與重疊。補足的方式有三種:
- 自己處理 Common Crawl,德文分支改用 FineWeb2 的字長門檻(平均字長 0 到 15 字元),取代英文常用的 Gopher 設定(3 到 10 字元),避免德文行政文體被過濾掉。
- 用 Mistral-Nemo-Instruct-2407 把德文原文改寫成百科條目、問答或教學段落,約得到 1.1T 不重複 token,是最大的德文來源。
- 少量經過篩選的翻譯資料。前一代曾大規模使用翻譯,報告指出翻譯會留下來源語言的文化與機構分布。
整體預訓練資料約 24%(4.8T)是合成資料,包括改寫與翻譯。
容錯紀錄。 主預訓練淨用 377,000 GPU 小時,發生 38 次非預期中斷,約每 1,000 GPU 小時 0.1 次。其中 10 次是 GPU 或節點硬體故障,9 次是物件儲存讀取逾時,16 次沒有查出原因。每次自動恢復平均 45.3 分鐘,合計 28.7 小時。checkpoint 每 250 步存一次。
後訓練
SFT 從 base 模型訓練 4,000 步,約 268B 個 packed tokens。德文推理資料從 SFT 開始放入,目標是讓模型在推理過程中也用德文。
RL 從 SFT checkpoint 開始,訓練 1,000 步。每批 256 組、每組 8 條序列,一條序列最多 100 個 rollout 步驟,context 最長 256k。最後一次 RL 用 38 個環境(31 個英文、7 個德文版本),訓練資料共 1,209,965 筆。目標函數的組成:
- 組內相對優勢,不做標準差正規化(類似 Dr. GRPO),並沿用 DAPO 的動態取樣,大致上丟掉環境獎勵全部相同的組。
- 用 DPPO 的 B-TV 遮罩取代 PPO 式 clipping,處理非同步訓練與推論引擎造成的離策略偏移。
- 對數比值平方的正則項,沒有對凍結參考模型的 KL 項。
- 工具使用與終端環境裡,獎勵低且變異小的組改用 targeted OPSD:在出錯的回合插入對應錯誤類型的提示,以加了提示的當前策略分布當老師,蒸餾回沒有提示的情境。
驗證集上的平均環境獎勵從前 50 步的 0.62 升到最後 50 步的 0.83,增幅最大的是指令遵循與結構化輸出(0.65 → 0.94)。
| 基準 | SFT | RL | 差 |
|---|---|---|---|
| AIME 2026 | 92.1 | 96.0 | +3.9 |
| GPQA Diamond | 79.8 | 84.3 | +4.5 |
| AA-Omniscience Index | −68.8 | −32.8 | +36.0 |
| τ³-bench banking | 13.1 | 38.1 | +25.0 |
| BrowseComp | 22.0 | 29.4 | +7.4 |
| LiveCodeBench v6 | 75.3 | 85.9 | +10.6 |
| IFBench | 48.2 | 78.1 | +29.9 |
| LongBench Pro | 57.1 | 64.5 | +7.4 |
減少幻覺的環境。 RAG 題目以 Merlin–Arthur 協定改造。Merlin 從檢索內容中遮掉「拿掉後最能提高正確答案機率」的句子,Morgana 遮掉「拿掉後最能降低正確答案機率」的句子。每題以完整內容、Merlin 版、Morgana 版各問一次,不標示是哪一版。前兩種答對得分,Morgana 版要回答「不知道」才得分。兩者的遮罩每一步都依當前策略重算。
評測結果
報告比較了 12 個開放權重的後訓練模型。所有模型用 Aleph Alpha 的 eval-framework 或 Harbor 評測,Kolibri 用 high 推理強度,其他模型用各自模型卡記載的 context 與取樣參數。
| 基準 | Kolibri | Qwen3.5 35B-A3B | Qwen3.6 35B-A3B | Nemotron 3 Super 120B-A12B | Qwen3.8 27B(dense) |
|---|---|---|---|---|---|
| 整體(英文) | 75.5 | 74.7 | 71.4 | 73.0 | 80.2 |
| 整體(德文) | 70.8 | 69.8 | 67.3 | 67.9 | 79.9 |
| AIME 2026(英文) | 96.0 | 92.1 | 91.0 | 90.4 | 97.7 |
| GPQA Diamond(英文) | 84.3 | 83.8 | 83.4 | 78.0 | 89.2 |
| SWE-Bench Verified | 66.4 | 71.6 | 73.8 | 60.2 | 72.6 |
| TerminalBench 2.1 | 27.7 | 39.7 | – | 39.7 | 76.8 |
| BFCL v4(整體) | 61.4 | 70.5 | 67.2 | 61.0 | 73.2 |
| AA-Omniscience 不幻覺率 | 44.0 | 11.1 | 56.7 | 13.9 | 67.3 |
整體分數上,Kolibri 比 Qwen3.5 35B-A3B 高 0.8(英文)與 1.0(德文),是比較的 MoE 模型裡最高。數學是它最強的項目,英文 AIME 兩屆只輸給 Qwen3.8 27B。程式代理與工具呼叫則落後同級模型:SWE-Bench Verified、TerminalBench 2.1 與 BFCL v4 都低於 Qwen3.5 35B-A3B。
幻覺相關指標比前一代進步很多。AA-Omniscience 不幻覺率從 15.0 升到 44.0,RGB 在文件沒有答案時的保留率從 73.9 升到 85.6。在比較的模型中,Qwen3.6 35B-A3B 的不幻覺率 56.7 仍然較高。
限制
- 評測由開發者自己跑。 BFCL v4 的網頁搜尋後端和官方排行榜不同,各模型用自己的取樣參數,報告寫明分數不能和排行榜直接比。
- 產業 RAG 分數只是相對訊號。 五個產業代理評測(半導體、德國公部門、航太等)是內部建立的,其中兩個只有 11 題與 26 題,報告自己說題數太少,看不出趨勢。
- 德文整體分數的涵蓋面較窄。 八個類別中只有知識、數學、代理檢索與產業 RAG 有德文版,德文「整體」只由這四類平均而來。
- 明顯的弱項。 RGB Closed-Book 在 12 個比較模型裡排最後,也是唯一一項 Kolibri 低於前一代的基準;AA-Omniscience 準確率與 BFCL 多輪也偏弱。
- 架構上的未解問題。 前兩層 MoE 幾乎不用路由專家,報告在附錄分析,但這一版沒有處理。
- 報告內部有數字不一致。 總結章節寫 SFT 用了 537B tokens,SFT 章節寫約 268B;德文 Common Crawl 的不重複 token,正文寫 0.8T,同頁表格寫 1.3T。本文採用各章節正文的數字。
參考資料
- Aleph Alpha:Kolibri: A Sovereign European Model on the Pareto Frontier(技術報告 PDF,2026-10-03)
- Aleph Alpha:Kolibri Has Landed: A Sovereign Open-Weight Model(2026-10-03)
- Aleph-Alpha/Kolibri-1(Hugging Face 模型卡)
- arXiv.28053,Exact Quantile Balancing and Load-Error Injection for Mixture-of-Experts
- arXiv.11614,Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models