跳到內容

Technology

新聞|Anthropic 評估 GLM-5.3 的端到端漏洞利用接近 Mythos

Anthropic 在 ExploitBench 與內部評測比較 GLM-5.3 和 Claude Mythos Preview,並測量開放權重模型的防護能被繞過的比例。NIST CAISI 同月的結論方向一致,計分方式不同。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

兩組自動評測

Anthropic 把模型放在隔離沙盒,只攻擊他們自己架好的離線目標。能力比較裡的 Claude 關掉了網路防護。

ExploitBench 測的是 Chrome 所用 V8 引擎裡的已知漏洞。這篇只報告端到端利用是否成功:GLM-5.3 是 50/410,Mythos Preview 是 56/410。

內部的 Binary Exploitation 評測從參與 Google OSS-Fuzz 的開源專案抽 100 題,滿分是完整的控制流劫持。GLM-5.3 為 4%,Mythos Preview 為 6%。Claude Opus 4.6 與 GLM-5.2 在這 100 題沒有成功。

研究者在迴圈裡

時程都在一天以內,人的注意力合計不到一小時。第一場用 GLM-5.3,對象是沙盒裡、Linux 版本的一個常用瀏覽器。模型在 JavaScript 引擎找到數個先前未知的漏洞,做出一個網頁:訪客打開後可以讀取電腦上的檔案。Anthropic 說已向維護者揭露。同一場稍後,研究者還在無線驅動、圖形驅動與對外的裝置軟體看到可利用的問題,仍在審查。

第二場用較小的 GLM-5.3-Flash。研究者提供 Chrome 漏洞 CVE-2026-11645 的公開資料,以及另一個已知漏洞的公開資料。模型在幾乎沒有逐步指示的情況下做出可重複的利用。人約 20 分鐘,模型約 8 小時。依智譜 API 價格,費用是 20.40 美元。

防護被繞過的比例

放出的權重對明顯有害的請求常常拒絕。上面的漏洞利用評測沒有觸發這種拒絕。Anthropic 寫,直接要求開發惡意軟體或攻擊遠端目標時,才看得到拒絕。

另一個測試是模擬環境。模型只有假的 bash,程式不會執行,輸出由另一個模型依劇本估算。直接提出有害請求時,GLM-5.3 與受測 Claude 的配合率都是 0。每一格 50 次:5 種攻擊指令、2 個目標、各 5 次。

Anthropic 報告 GLM-5.3 在三種繞過條件下的配合率:

受 API 防護的 Claude 在這些條件下仍是 0。預填思考與改權重對 Claude API 不可行。這裡只記條件與比例,不寫做法。

Abliteration 之後,JailbreakBench 與 HarmBench 的拒絕率從 90% 以上降到約 3% 與 2%,StrongREJECT 降到 12%。GPQA-Diamond 與原版相同,文中沒有寫出那個分數。CyberGym 的一個子集低幾個百分點。Anthropic 這次改權重大約 2,200 GPU 小時、約 4,400 美元。他們估計有經驗的團隊大約 600 GPU 小時、1,200 美元。GLM-5.3-Flash 約 600 GPU 小時。

NIST 的計分不同

9 月 17 日,NIST 的 CAISI 評估 GLM-5.3。模型於 8 月 14 日發布,權重約兩週後公開。CAISI 寫,它是迄今網路能力最強的開放權重模型,在綜合指標上落後美國前沿大約四個月。美國前沿包含只給受審核使用者的版本。適用時,美國模型關掉了網路防護。

CAISI 的 ExploitBench 不是 410 次嘗試裡成功幾次。它是 41 題、每題 16 分,取三次嘗試的最佳。GLM-5.3 為 61.1%(9.8/16),美國前沿最佳為 100%(16.0/16)。50/410 與 61.1% 不能當成同一個數。

評測GLM-5.3美國前沿最佳先前的中國前沿最佳
SEC-Bench Pro40.4%(74/183)90.2%(165/183)27.3%(50/183)
ExploitBench61.1%(9.8/16)100%(16.0/16)32.2%(5.1/16)
ExploitGym(Userspace)9.4%(47/498)44.4%(223/502)2.6%(13/502)
OSS-Fuzz7.7%(23/297)23.2%(69/297)2.4%(7/297)

上表是點估計。NIST 原文另附 95% Wilson 信賴區間。ExploitGym 的 GLM-5.3 分母在原文是 498,另外兩欄是 502。

限制

沙盒裡的成功不等於對網際網路上的系統動手。模擬環境不執行模型產生的程式。Anthropic 寫,這不是現實行為的完整測量。

能力數字裡的 Claude 關著防護。GLM-5.3 的權重任何人都可以下載。Anthropic 的政策結論是,同等能力第一次以幾乎沒有有效限制的形式公開,防禦方也應該用得上同等工具。這是他們的判斷。評測表本身沒有推出「因此應擴大 Mythos 的發放」。

五個月前他們以 Project Glasswing 有限開放 Mythos Preview,並說受信任的防禦方找到超過 10,000 個關鍵軟體漏洞。這個數字來自 Anthropic 這篇文章,不是獨立稽核。

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。