跳到內容

Technology

新聞|DART 用表徵位移累積多輪 agent 的風險

預印本提出 DART,把 agent 隱藏狀態在每一段新上下文之後的位移累加起來。六個本機模型上,MT-AgentRisk 的攻擊成功率從 84% 降到 25%;點名片段的提醒在較小模型上可能把成功率越拉越高。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

它在看什麼

多輪情境裡,單步看起來允許的動作可以接成有害結果。DART 不另跑一個監看模型。它取固定層、最後一個 token 的隱藏狀態,把相鄰兩段上下文的向量相減,得到這一段帶來的位移,再投影到一條事先配好的方向上,沿軌跡加總。

這條方向來自對比:有目標不當行為的位移,減去良性行為的位移。論文指出,良性位移的投影不必是零,直接累加會被日常漂移蓋過。去噪在配方向時做完:把良性流量的平均錨在零,再去掉良性位移共變異數的前幾個主方向。執行時只剩內積與加總。

超過以良性校準分數設定的門檻時,DART 把目前貢獻最大的那段上下文記下來,在上下文末端加上一段提醒,然後在下一個外部動作之前重生成。它不刪原本的上下文,也不中止執行。提醒的用詞在論文第 4 節。這裡不逐字抄。論文自己記錄了較小模型會把引文當成新指令。

數字

六個模型都在本機以 MLX、8-bit 權重跑:Qwen3-8B、14B、32B,Qwen3-30B-A3B,Llama-3.1-8B,Mistral-Small-24B。沒有閉源前沿模型。MT-AgentRisk 的每一輪都帶著風險信號。ASEval 把指示嵌進原本良性的工具軌跡。一輪平均 6.7 個受監控片段,其中 1.8 個是注入,信號密度 k/T = 0.26。

基準無防禦的攻擊成功率DART良性不拒絕率偵測
MT-AgentRisk84%25%93% → 85%有害軌跡全部抓到,平均誤報 12%
ASEval97%52%97% → 97%抓到 60%–85%,六個模型的誤報都是 0

門檻用 10% 的誤報預算。MT-AgentRisk 上,有害軌跡每次都被標到。剩下的 25% 來自提醒沒有攔住。Qwen3-32B 與 Qwen3-14B 的殘餘攻擊成功率分別是 0.53 與 0.50。Llama-3.1-8B 與 Mistral-24B 降到 0。

ASEval 上沒有模型降到 0。各模型殘餘約在 0.35(Llama-3.1-8B)到 0.68(Qwen3-14B)。

ToolShield 把事先蒸餾的工具安全經驗一直放在上下文裡。同一協議下,它把 MT-AgentRisk 的平均攻擊成功率從 84% 降到 55%,良性不拒絕率 91%,高於 DART 的 85%。六個模型上 DART 都更低,單側符號檢定 p = 0.016。

去噪在 ASEval 是主要差距。未去噪的監測抓到 7%–40% 的攻擊,去噪後是 60%–85%。論文 Table 1 寫,Qwen3-8B 的軌跡 AUROC 從 0.712 到 0.958,抓取率從 0.33 到 0.78,誤報維持 0。只扣掉良性平均(秩 p = 1)不夠:同一模型的 AUROC 是 0.750,再去掉一個共變異方向才到 0.912。

每步多出來的時間是 0.14–0.56 秒,因為重用 agent 自己的前向計算。論文用現成 Qwen3-4B 重做了一種投機模擬當成本對照,約 6.7 秒一步。對照的模型不是原作者微調過的版本,所以只比較時間。

提醒會失效

附錄記載,同一套監測在單輪間接注入上不用改結構也能跑。緩解沒有一起過去。InjecAgent 的資料竊取設定裡,Qwen3-8B 的攻擊成功率從 0.33 升到 0.87,Llama-3.1-8B 從 0.07 升到 0.38。抓取率仍高。論文的解釋是:提醒會引述被歸因的片段,較小模型把引文讀成最新指令。

他們另外量了兩種不靠模型讀懂引文的做法。直接中止時攻擊成功率到 0,被標記的那些回合幾乎做不完任務。把被歸因的讀取換成占位符再繼續,攻擊成功率在他們測的格子裡不超過 0.09,任務完成率通常低於提醒。論文沒有把這個切換寫進 DART 本體。部署前可以用同一批校準攻擊,看提醒會不會把成功率越拉越高。

另一個邊界是內生誤用:沒有外來指示,危險動作是模型自己決定的工具呼叫。在 Agent-SafetyBench 上,交叉驗證的 AUROC 約 0.65–0.71。論文把這個結果留在信號邊界,執行期管線沒有把內生誤用當成要解的題。

程式放在匿名複現庫。論文寫,層與去噪秩是在與評測分割開的內層驗證集上選的。ASEval 用 p = 16,MT-AgentRisk 用 p = 2。附錄有一張診斷表來自較早的資料切分,作者明確說不要和 Table 1 逐格對。上面的主結果以第 5 節與 Table 1 為準。

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。