重點
- 微軟與 Hugging Face 在 10 月 3 日公開 ThinkingBox。507 道有狀態的業務流程,每題從乾淨後端獨立跑 20 次,以終端資料庫狀態與副作用評分。
- Claude Opus 5.5 的 pass@1 為 67.16%。20 次全過的題數是 241,與 pass@1 為 66.50% 的 Opus 5 相同。
- Kimi-K3 至少做對一次的題最多,476/507;20 次全過只有 68 題。
- 12 個模型的 121,680 次有效試驗裡,79,853 次沒通過檢查。其中 67.24% 仍正常結束,而且做了會改狀態的工具呼叫,最後一次工具沒有報錯。
- 任務是合成的。477 題只看後端狀態。模擬使用者固定為合作的 GPT-5.4-mini。
怎麼評
ThinkingBox 是沙盒,ThinkingBox-Bench 是建在上面的 507 題。領域是零售、汽車保險、旅遊住宿、新銀行內部 IT、顧問公司 IT/人資。每題給定起始後端、使用者目標、MCP 工具、領域政策,以及隱藏的可執行檢查。
模擬使用者握有訂單編號、偏好或生日這類私有資料,被問到才提供。每一次嘗試都換一個隔離的 MCP session,所以 20 次之間不共用資料列,也不共用工具快取。
結束後,副作用抽取器比對實際變更與要求的終態。路徑可以不同。錯的、缺的、多出來的效果都不算過。沒有乾淨資料庫欄位可對的要求,例如必須向使用者說明某件事沒有保證,才加一題二元的回應量表。507 題裡 477 題只看狀態,30 題另加回應量表。模型看得到任務、對話與工具 schema。標準答案、斷言與評分內部留在評測端。
三個數字
公告把三個指標分開。20 次全過是 507 題裡實際 20 次都過的計數,沒有用估計式平滑。
| 指標 | 問題 |
|---|---|
| pass@1 | 所有嘗試裡成功的比例 |
| pass@20 | 20 次裡至少成功一次的題目比例 |
| 觀察到的 20/20 | 紀錄中 20 次都成功的題目比例 |
論文另定義 pass^k,是各題成功率的 k 次方再平均。Opus 5 的這個估計值剛好也是 47.53%。Kimi-K3 的 pass^20 是 17.60%,高於公告裡 20 次全過的 13.41%。公告的 20/20 是逐題計數,論文的 pass^20 是估計式,兩邊不能當成同一欄。
| 模型 | pass@1 | 至少成功一次 | 20 次全過 |
|---|---|---|---|
| Claude Opus 5.5 | 67.16% | 公告未給總數 | 241(47.53%) |
| Claude Opus 5 | 66.50% | 79.09%(106 題一次都沒有) | 241(47.53%) |
| GPT-5.4 | 65.36% | 公告未給總數 | 128(25.25%) |
| GPT-6 Astra | 58.31% | 公告未給總數 | 231(45.56%) |
| Kimi-K3 | 57.37% | 93.89%(476/507) | 68(13.41%) |
Kimi-K3 比 Opus 5 多 75 題至少成功一次。Opus 5 比 Kimi-K3 多 173 題是 20 次全過。Opus 5.5 的 pass@1 比 Opus 5 高約半個百分點,至少成功一次的題也更多,但 20 次全過仍是 241 題。
領域差很大。公告 Table 2 裡,Claude Opus 4.6 的零售 pass@1 是 68.62%,汽車保險是 8.30%。同一張表的模型,零售平均 59.52%,汽車保險平均 33.83%。論文用另一組 14 個未做強化學習微調的模型,算出零售 58.81%、汽車保險 33.18%。方向相同,分母不同。
失敗時工具呼叫看起來往往是正常的
共同集合消融覆蓋 12 個模型、121,680 次有效試驗,79,853 次沒通過可執行檢查。其中 67.24% 仍然正常結束、呼叫了會改狀態的工具,而且最後一次工具沒有報錯。公告接著給出狀態檢查的比例:錯誤欄位值 77.61%,非預期的額外效果 43.30%,缺少必要效果 25.36%,並寫明這些發現彼此重疊。
另一份診斷把每條失敗軌跡分到一個主標籤。這是各模型占比的未加權平均。論文寫明它是可觀察標籤,不是唯一的因果解釋。
| 失敗簽名 | 占失敗的比例 |
|---|---|
| 工具使用 | 79.9% |
| 狀態更新錯誤 | 10.3% |
| 使用者問題沒有處理完 | 7.0% |
| 沒有做會改狀態的動作 | 2.9% |
工具使用這欄比格式錯誤的呼叫更寬:工具報錯、前提不成立、查詢是空的,agent 沒有恢復,有時還繼續當作動作已經成功。公告說,他們還沒有在這個基準上量過重試策略、縮小工具面或人工核准能抬高多少分數。
一致性能值多少
成本用的是 2026 年 9 月 20 日 OpenRouter 未打折的牌價,Opus 5.5 則用 Anthropic 網站價格。這是比較用的指數,不是一張雲端帳單,也不等於服務一筆正式請求的價格。
單次成功的成本,是 507 次嘗試(每題一次)的估計花費,除以成功次數。例子:GPT-5.4 這 507 次花 43.49 美元,pass@1 為 65.36%,每次成功約 0.131 美元。
單次成功的成本前緣上有三個模型。GPT-5.6 Sol 最低,每次成功 0.127 美元。GPT-5.4 的 pass@1 再高 3.45 個百分點,每次成功多 0.004 美元。Claude Opus 5.5 再高 1.80 個百分點,每次成功 0.276 美元。Opus 5 每次成功 0.475 美元、pass@1 66.50%,比 Opus 5.5 貴,單次成功率也較低。
20 次全過的成本是整場 20 輪花費,除以全過的題數。GPT-5.4 是 6.80 美元,但只有 128 題達標。GPT-6 Astra 是 7.45 美元、231 題。Opus 5.5 是 7.80 美元、241 題。GPT-5.6 Sol 單次成功最便宜,換算成全過題目是 9.76 美元。
論文裡的強化學習
論文用同一種可執行判決當終端獎勵,以 GRPO 微調 Qwen。訓練題與那 507 題不相交。全參數微調的 Qwen3.8-27B,pass@1 從 51.70% 到 60.78%(標準誤 ±1.68),高於 GPT-6 Astra 的 58.31% 與 Kimi-K3 的 57.37%。10 月 3 日的公告仍把訓練程式標成即將公開。
限制
論文附錄把範圍寫得很窄。任務來自未公開的企業案例,再合成重建,沒有真實客戶資料,也不宣稱是企業工作的隨機樣本。留下的每題只有一個標準終態。多種都說得通的處理方式,在建置時就被排除。
477 題的判決不看使用者看到的句子。後端改對了、回覆講錯了,仍可能算過。30 題的回應量表與全部模擬使用者,都是同一個 GPT-5.4-mini。它目標固定、保持合作、最多 10 輪追問,也不會中途改口。它和受測的 GPT 系列是同一模型家族。論文認為不能排除互動風格的影響。
他們抽了 19,390 則模擬使用者的後續發言做依據審計。自動流程把 6.33% 標成無根據。人工複核 120 則時,抽到的 Grounded 全部得到兩位審閱者確認;抽到的 Ungrounded,兩位分別只確認 32/60 與 30/60。
系統錯誤在報告的指標裡算失敗。API agent 的 temperature 設為 1.0,reasoning effort 為 medium。20 次不是同一段對話的重播。