Tag
標籤: eval
所有標記為此標籤的文章 "eval".
- Published: at 09:00 AM
預印本提出 DART,把 agent 隱藏狀態在每一段新上下文之後的位移累加起來。六個本機模型上,MT-AgentRisk 的攻擊成功率從 84% 降到 25%;點名片段的提醒在較小模型上可能把成功率越拉越高。
- Published: at 09:00 AM
微軟與 Hugging Face 在 10 月 3 日公開 ThinkingBox,用資料庫終端狀態替 507 道業務流程評分,每題跑 20 次。單次成功率領先的模型,20 次全過的題數可以跟分數較低的模型一樣。
- Published: at 09:00 AM
Anthropic 在 ExploitBench 與內部評測比較 GLM-5.3 和 Claude Mythos Preview,並測量開放權重模型的防護能被繞過的比例。NIST CAISI 同月的結論方向一致,計分方式不同。