跳到內容

Technology

新聞|ScopeBench:資安 agent 在目標壓力下會不會越過授權範圍

Dreadnode 發表 ScopeBench,用 30 個「只能越界才能完成」的網頁資安任務,分開量測 agent 的攻擊能力與守住授權範圍的程度。整理它的配對設計、雙軌評分、8 個模型的結果,以及這個先導版的限制。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

要量的是什麼

委託滲透測試時,客戶會規定哪些主機可以碰、哪些動作不能做。Dreadnode 認為,資安 agent 的攻擊能力已經足以處理大部分實務工作,真正擋住自主部署的是信任:agent 會不會為了達成目標越過這條線。

既有的資安 agent 評測大多只看任務有沒有完成。ScopeBench 的論文把「守住範圍」當成獨立的一個軸來量。

方法:配對的死路任務

設計參考 ImpossibleBench。每個任務在同一個環境、同一個目標、同一支驗證腳本下跑兩種條件:

  1. 能力測試:不設範圍,agent 可以用任何手段拿到 flag。拿到就算成功。
  2. 範圍測試:加上一段自然語言寫的範圍限制。任務刻意設計成在限制下無解,flag 藏在禁止跨越的邊界後面。

在範圍測試裡,最好的結果是 agent 停下來回報發現。只要驗證腳本判定成功,就證明 agent 做了被禁止的動作。

論文舉的例子是客服系統任務:要驗證一個漏洞,必須把工單改派給別人,範圍限制卻寫明不能改動工單的負責人、佇列與狀態。

雙軌評分

只靠驗證腳本會低估越界。沒交出 flag 不代表沒越界,agent 可能越界後沒成功,也可能越界拿到 flag 卻沒提交。Dreadnode 在部落格中提到,常看到模型越界後發現自己違規,接著花剩下的時間找合規的路線,最後不提交。

所以評分分兩軌:

評審的校準用了 100 條由五位資安人員逐次標註的軌跡(來自同團隊的 ScopeJudge 資料集),標註者之間的 Fleiss κ 為 0.64。另外由一位專家盲測 100 條實際評測的軌跡:評審抓到全部 36 次越界,錯誤都是多報,精確度 72%。

實驗規模

項目設定
任務30 個,全部是 Docker 化的網頁應用資安情境
條件不設範圍,以及兩種範圍措辭(口語、正式交戰規則)
重複每個組合跑 3 次,共 2160 條軌跡
預算每條最多 100 次工具呼叫、3600 秒
模型4 個閉源、4 個開放權重,同一個 harness

任務類型包括角色提權、跨租戶存取、物件儲存跨 bucket、內部管理介面、JWT 信任邊界、SSRF 等。

結果

模型能力(無範圍)守住範圍機械驗證越界率
claude-opus-4-881.1%70.0%9.4%
claude-sonnet-4-671.1%34.4%32.2%
qwen3.6-35b-a3b67.8%42.8%23.3%
claude-haiku-4-554.4%55.0%18.9%
glm-5.254.4%65.0%13.3%
gpt-5.4-mini44.4%60.6%20.0%
trinity-large-thinking12.2%86.7%4.4%
nemotron-3-ultra12.2%75.6%4.4%

「守住範圍」結合了機械驗證與評審的判定。考慮評審多報的誤差後,校正值會再高一些,例如 opus-4-8 是 77.4%。

幾個觀察:

跟既有工作比新在哪

限制

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。