跳到內容

Technology

新聞|ThinkingBox 用終端狀態檢驗 agent 能否每次都做對

微軟與 Hugging Face 在 10 月 3 日公開 ThinkingBox,用資料庫終端狀態替 507 道業務流程評分,每題跑 20 次。單次成功率領先的模型,20 次全過的題數可以跟分數較低的模型一樣。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

怎麼評

ThinkingBox 是沙盒,ThinkingBox-Bench 是建在上面的 507 題。領域是零售、汽車保險、旅遊住宿、新銀行內部 IT、顧問公司 IT/人資。每題給定起始後端、使用者目標、MCP 工具、領域政策,以及隱藏的可執行檢查。

模擬使用者握有訂單編號、偏好或生日這類私有資料,被問到才提供。每一次嘗試都換一個隔離的 MCP session,所以 20 次之間不共用資料列,也不共用工具快取。

結束後,副作用抽取器比對實際變更與要求的終態。路徑可以不同。錯的、缺的、多出來的效果都不算過。沒有乾淨資料庫欄位可對的要求,例如必須向使用者說明某件事沒有保證,才加一題二元的回應量表。507 題裡 477 題只看狀態,30 題另加回應量表。模型看得到任務、對話與工具 schema。標準答案、斷言與評分內部留在評測端。

三個數字

公告把三個指標分開。20 次全過是 507 題裡實際 20 次都過的計數,沒有用估計式平滑。

指標問題
pass@1所有嘗試裡成功的比例
pass@2020 次裡至少成功一次的題目比例
觀察到的 20/20紀錄中 20 次都成功的題目比例

論文另定義 pass^k,是各題成功率的 k 次方再平均。Opus 5 的這個估計值剛好也是 47.53%。Kimi-K3 的 pass^20 是 17.60%,高於公告裡 20 次全過的 13.41%。公告的 20/20 是逐題計數,論文的 pass^20 是估計式,兩邊不能當成同一欄。

模型pass@1至少成功一次20 次全過
Claude Opus 5.567.16%公告未給總數241(47.53%)
Claude Opus 566.50%79.09%(106 題一次都沒有)241(47.53%)
GPT-5.465.36%公告未給總數128(25.25%)
GPT-6 Astra58.31%公告未給總數231(45.56%)
Kimi-K357.37%93.89%(476/507)68(13.41%)

Kimi-K3 比 Opus 5 多 75 題至少成功一次。Opus 5 比 Kimi-K3 多 173 題是 20 次全過。Opus 5.5 的 pass@1 比 Opus 5 高約半個百分點,至少成功一次的題也更多,但 20 次全過仍是 241 題。

領域差很大。公告 Table 2 裡,Claude Opus 4.6 的零售 pass@1 是 68.62%,汽車保險是 8.30%。同一張表的模型,零售平均 59.52%,汽車保險平均 33.83%。論文用另一組 14 個未做強化學習微調的模型,算出零售 58.81%、汽車保險 33.18%。方向相同,分母不同。

失敗時工具呼叫看起來往往是正常的

共同集合消融覆蓋 12 個模型、121,680 次有效試驗,79,853 次沒通過可執行檢查。其中 67.24% 仍然正常結束、呼叫了會改狀態的工具,而且最後一次工具沒有報錯。公告接著給出狀態檢查的比例:錯誤欄位值 77.61%,非預期的額外效果 43.30%,缺少必要效果 25.36%,並寫明這些發現彼此重疊。

另一份診斷把每條失敗軌跡分到一個主標籤。這是各模型占比的未加權平均。論文寫明它是可觀察標籤,不是唯一的因果解釋。

失敗簽名占失敗的比例
工具使用79.9%
狀態更新錯誤10.3%
使用者問題沒有處理完7.0%
沒有做會改狀態的動作2.9%

工具使用這欄比格式錯誤的呼叫更寬:工具報錯、前提不成立、查詢是空的,agent 沒有恢復,有時還繼續當作動作已經成功。公告說,他們還沒有在這個基準上量過重試策略、縮小工具面或人工核准能抬高多少分數。

一致性能值多少

成本用的是 2026 年 9 月 20 日 OpenRouter 未打折的牌價,Opus 5.5 則用 Anthropic 網站價格。這是比較用的指數,不是一張雲端帳單,也不等於服務一筆正式請求的價格。

單次成功的成本,是 507 次嘗試(每題一次)的估計花費,除以成功次數。例子:GPT-5.4 這 507 次花 43.49 美元,pass@1 為 65.36%,每次成功約 0.131 美元。

單次成功的成本前緣上有三個模型。GPT-5.6 Sol 最低,每次成功 0.127 美元。GPT-5.4 的 pass@1 再高 3.45 個百分點,每次成功多 0.004 美元。Claude Opus 5.5 再高 1.80 個百分點,每次成功 0.276 美元。Opus 5 每次成功 0.475 美元、pass@1 66.50%,比 Opus 5.5 貴,單次成功率也較低。

20 次全過的成本是整場 20 輪花費,除以全過的題數。GPT-5.4 是 6.80 美元,但只有 128 題達標。GPT-6 Astra 是 7.45 美元、231 題。Opus 5.5 是 7.80 美元、241 題。GPT-5.6 Sol 單次成功最便宜,換算成全過題目是 9.76 美元。

論文裡的強化學習

論文用同一種可執行判決當終端獎勵,以 GRPO 微調 Qwen。訓練題與那 507 題不相交。全參數微調的 Qwen3.8-27B,pass@1 從 51.70% 到 60.78%(標準誤 ±1.68),高於 GPT-6 Astra 的 58.31% 與 Kimi-K3 的 57.37%。10 月 3 日的公告仍把訓練程式標成即將公開。

限制

論文附錄把範圍寫得很窄。任務來自未公開的企業案例,再合成重建,沒有真實客戶資料,也不宣稱是企業工作的隨機樣本。留下的每題只有一個標準終態。多種都說得通的處理方式,在建置時就被排除。

477 題的判決不看使用者看到的句子。後端改對了、回覆講錯了,仍可能算過。30 題的回應量表與全部模擬使用者,都是同一個 GPT-5.4-mini。它目標固定、保持合作、最多 10 輪追問,也不會中途改口。它和受測的 GPT 系列是同一模型家族。論文認為不能排除互動風格的影響。

他們抽了 19,390 則模擬使用者的後續發言做依據審計。自動流程把 6.33% 標成無根據。人工複核 120 則時,抽到的 Grounded 全部得到兩位審閱者確認;抽到的 Ungrounded,兩位分別只確認 32/60 與 30/60。

系統錯誤在報告的指標裡算失敗。API agent 的 temperature 設為 1.0,reasoning effort 為 medium。20 次不是同一段對話的重播。

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。