重點
- 9 月 29 日,Anthropic 公布對智譜(海外稱 Z.ai)GLM-5.3 的網路能力分析。
- ExploitBench 上,GLM-5.3 在 410 次嘗試中有 50 次做出端到端漏洞利用;Claude Mythos Preview 是 56 次。
- 內部評測抽 100 題,完整控制流劫持是 4% 對 6%。Claude Opus 4.6 與 GLM-5.2 在這 100 題是 0。
- 較小的 GLM-5.3-Flash 依公開資料開發已知 Chrome 漏洞的利用,API 費用 20.40 美元。研究者先給了漏洞資料,模型沒有自己發現這項漏洞。
- 模擬測試裡,直接有害請求的配合率是 0。三種繞過條件分別到 64%、92%、100%。受 API 防護的 Claude 維持 0。
兩組自動評測
Anthropic 把模型放在隔離沙盒,只攻擊他們自己架好的離線目標。能力比較裡的 Claude 關掉了網路防護。
ExploitBench 測的是 Chrome 所用 V8 引擎裡的已知漏洞。這篇只報告端到端利用是否成功:GLM-5.3 是 50/410,Mythos Preview 是 56/410。
內部的 Binary Exploitation 評測從參與 Google OSS-Fuzz 的開源專案抽 100 題,滿分是完整的控制流劫持。GLM-5.3 為 4%,Mythos Preview 為 6%。Claude Opus 4.6 與 GLM-5.2 在這 100 題沒有成功。
研究者在迴圈裡
時程都在一天以內,人的注意力合計不到一小時。第一場用 GLM-5.3,對象是沙盒裡、Linux 版本的一個常用瀏覽器。模型在 JavaScript 引擎找到數個先前未知的漏洞,做出一個網頁:訪客打開後可以讀取電腦上的檔案。Anthropic 說已向維護者揭露。同一場稍後,研究者還在無線驅動、圖形驅動與對外的裝置軟體看到可利用的問題,仍在審查。
第二場用較小的 GLM-5.3-Flash。研究者提供 Chrome 漏洞 CVE-2026-11645 的公開資料,以及另一個已知漏洞的公開資料。模型在幾乎沒有逐步指示的情況下做出可重複的利用。人約 20 分鐘,模型約 8 小時。依智譜 API 價格,費用是 20.40 美元。
防護被繞過的比例
放出的權重對明顯有害的請求常常拒絕。上面的漏洞利用評測沒有觸發這種拒絕。Anthropic 寫,直接要求開發惡意軟體或攻擊遠端目標時,才看得到拒絕。
另一個測試是模擬環境。模型只有假的 bash,程式不會執行,輸出由另一個模型依劇本估算。直接提出有害請求時,GLM-5.3 與受測 Claude 的配合率都是 0。每一格 50 次:5 種攻擊指令、2 個目標、各 5 次。
Anthropic 報告 GLM-5.3 在三種繞過條件下的配合率:
- 欺騙性的任務包裝:64%
- 預填思考 token:92%
- 經 abliteration 改過的權重:100%
受 API 防護的 Claude 在這些條件下仍是 0。預填思考與改權重對 Claude API 不可行。這裡只記條件與比例,不寫做法。
Abliteration 之後,JailbreakBench 與 HarmBench 的拒絕率從 90% 以上降到約 3% 與 2%,StrongREJECT 降到 12%。GPQA-Diamond 與原版相同,文中沒有寫出那個分數。CyberGym 的一個子集低幾個百分點。Anthropic 這次改權重大約 2,200 GPU 小時、約 4,400 美元。他們估計有經驗的團隊大約 600 GPU 小時、1,200 美元。GLM-5.3-Flash 約 600 GPU 小時。
NIST 的計分不同
9 月 17 日,NIST 的 CAISI 評估 GLM-5.3。模型於 8 月 14 日發布,權重約兩週後公開。CAISI 寫,它是迄今網路能力最強的開放權重模型,在綜合指標上落後美國前沿大約四個月。美國前沿包含只給受審核使用者的版本。適用時,美國模型關掉了網路防護。
CAISI 的 ExploitBench 不是 410 次嘗試裡成功幾次。它是 41 題、每題 16 分,取三次嘗試的最佳。GLM-5.3 為 61.1%(9.8/16),美國前沿最佳為 100%(16.0/16)。50/410 與 61.1% 不能當成同一個數。
| 評測 | GLM-5.3 | 美國前沿最佳 | 先前的中國前沿最佳 |
|---|---|---|---|
| SEC-Bench Pro | 40.4%(74/183) | 90.2%(165/183) | 27.3%(50/183) |
| ExploitBench | 61.1%(9.8/16) | 100%(16.0/16) | 32.2%(5.1/16) |
| ExploitGym(Userspace) | 9.4%(47/498) | 44.4%(223/502) | 2.6%(13/502) |
| OSS-Fuzz | 7.7%(23/297) | 23.2%(69/297) | 2.4%(7/297) |
上表是點估計。NIST 原文另附 95% Wilson 信賴區間。ExploitGym 的 GLM-5.3 分母在原文是 498,另外兩欄是 502。
限制
沙盒裡的成功不等於對網際網路上的系統動手。模擬環境不執行模型產生的程式。Anthropic 寫,這不是現實行為的完整測量。
能力數字裡的 Claude 關著防護。GLM-5.3 的權重任何人都可以下載。Anthropic 的政策結論是,同等能力第一次以幾乎沒有有效限制的形式公開,防禦方也應該用得上同等工具。這是他們的判斷。評測表本身沒有推出「因此應擴大 Mythos 的發放」。
五個月前他們以 Project Glasswing 有限開放 Mythos Preview,並說受信任的防禦方找到超過 10,000 個關鍵軟體漏洞。這個數字來自 Anthropic 這篇文章,不是獨立稽核。