重點
- 馬里蘭大學、Google DeepMind 與西門菲莎大學的研究者 10 月 5 日在 arXiv 發表 IdeaLens。它判斷的是文件的點子來自人類還是 AI(idea provenance),跟文字是誰寫的分開看。
- 做法是把文件轉成「論述角色+改寫過的內容描述」組成的大綱,再用商用偵測器 Pangram 的文字來源標籤,在 100 萬份網頁文件上訓練。大綱裡幾乎沒有原文的用字,模型只能從點子去擬合標籤。
- AI 依越來越詳細的人類大綱寫文章時,IdeaLens 判為 AI 的比例從 94.9% 降到 6.8%,Pangram 4 仍判 92.4%。人類照 AI 大綱親手寫的 50 篇故事,IdeaLens 判 68% 為 AI,Pangram 4 只判 8%。
- 在 19 個傳統偵測評測上,IdeaLens 偵測到 91.1% 的 AI 文件,誤判率 0.6%,高於最強的開源偵測器 EditLens-3B。
- 論文自己列出的限制包括:訓練標籤只是近似、抽大綱要靠專有模型、對訓練資料之後的新模型偵測率降到 51–79%、門檻附近的判定不穩定。
要解決的問題
Pangram、EditLens 這類 AI 文字偵測器回答的是「字是誰寫的」。越來越多寫作政策在意的是「點子是誰想的」,論文舉了 Springer Nature 與 ICLR 2027 的 AI 使用政策為例。
兩者在同一份文件裡可以不同。人可以先想好論點再請 AI 寫成文章,也可以拿 AI 的構想自己動筆。既有研究多半靠模擬人機協作的資料來分開兩者,例如 AI 潤飾人類的文字,或用「人性化」工具改寫 AI 文字。這類資料做起來貴,訓練出的偵測器也不一定適用於真實的協作。
IdeaLens 的出發點是:文字偵測器用的標籤很便宜,人類文字可以從 ChatGPT 出現前的語料取樣,AI 文字可以隨時生成。如果能讓模型只看到點子,就能用同樣便宜的標籤、同樣的規模訓練點子偵測器。
方法
論文依寫作的認知歷程模型,把「點子」定義為作者決定要說什麼,包括主張、事件與組織方式,跟用哪些字分開。點子用大綱表示,每一項是一個論述角色配上一段簡短的內容描述。
訓練資料 WildOutlines 的建立步驟:
- 選文件:從已有 Pangram 3.3.2 標籤的 FineWeb 子集抽 100 萬份英文文件,至少 500 字,屬於八種長文格式。被標為「人機混合」的文件剔除。
- 歸納角色:用 GPT-5.6 Sol 為每種格式提出論述角色,再在 200 份文件上試標、補充、去重。非虛構類最後有 42 個角色。
- 抽大綱:用 Gemini 3.7 Flash 與 Gemini 3.1 Pro 依角色清單抽出大綱。
- 改寫:用 Gemini 3.1 Pro 改寫大綱,去掉從原文抄來的字句,避免模型靠用字走捷徑。
改寫的效果有數字佐證。人類文件的大綱裡,被 Pangram 4 判為人類寫的文字比例從 8.5% 降到 0.3%。意思大致保留:改寫後的大綱跟改寫前的餘弦相似度是 0.93(無關大綱之間是 0.39),跟原文是 0.76(無關文件之間是 0.26)。
模型骨幹是 Nemotron-3.5-Lightning-30B-A3B(總參數 300 億、每個 token 啟用 30 億的 MoE),用 LoRA 微調一個 epoch。對照組 ProseLens 用同樣的骨幹、文件與標籤,只差在讀原文。兩者的判定門檻都設在人類文件上誤判率 1%。
語料分成約 84.2 萬筆訓練、3 萬筆驗證、8 萬筆只含人類文件的校準集與 5 萬筆測試,建置成本約 6.64 萬美元。推論時不改寫,直接讀抽出的大綱,用 Gemini 3.7 Flash 抽一份大綱約 0.018 美元。
結果
評測涵蓋 22 個資料集,包括 19 個既有評測與作者新建的三個:
- IdeaShift:從 500 份種子文件出發,由 GPT-5.6 Sol 寫出 0 到 5 級、越來越詳細的提示詞,0 級只有主題,5 級是完整大綱,再由 GPT-5.6 系列模型生成文章
- TwiceTold:17 位資訊科學研究生與教師當面依 AI 故事的大綱親手寫成 50 篇故事,寫作時看不到 AI 原文
- IdeaShift-X:24 種語言的版本
主要數字:
| 情境 | IdeaLens | ProseLens | Pangram 4 |
|---|---|---|---|
| AI 依完整人類大綱寫成(IdeaShift 5 級),判為 AI | 6.8% | 86.5% | 92.4% |
| 人類依 AI 大綱寫成(TwiceTold),判為 AI | 68% | 0% | 8% |
| 10 個 AI 潤飾、改寫人類文字的評測,平均判為 AI | 5.6% | 46.0% | 52.0% |
| 點子與文字來源不同時的準確率 | 81.3% | 25.4% | 25.9% |
| 點子與文字來源相同時的準確率 | 95.3% | 99.1% | 98.5% |
在 IdeaShift 上,提示詞只有主題時 IdeaLens 判 94.9% 為 AI;如果大綱來自 AI,不管提示詞多詳細,判定率都在 96% 以上。可見它追蹤的是點子的來源,跟提示詞長短無關。判定率降得最多的地方在 3 級到 4 級之間,也就是提示詞開始包含內容、不只有結構的時候。
TwiceTold 的 68% 有不小的誤差範圍,95% 信賴區間是 54–79%。被 IdeaLens 判為人類的 16 篇裡,有 12 篇帶有奇幻或推想元素,寫作者在大綱之外加了新的事件與世界觀細節。
在傳統的「全人類對全 AI」評測上:
| 偵測器 | 偵測率 | 誤判率 |
|---|---|---|
| IdeaLens | 91.1% | 0.6% |
| EditLens-3B | 81.8% | 0.2% |
| ProseLens | 98.9% | 0.7% |
| Pangram 4(官方門檻) | 97.3% | 0.3% |
IdeaLens 只用英文訓練,透過英文大綱就能套用到其他語言。在 24 種語言上,它判 0 級文件 95.3% 為 AI、5 級只判 0.7%;兩個文字偵測器分別是 82–85% 與 45–62%,在泰米爾語、阿姆哈拉語這類低資源語言差距更大。對 1 萬份 ChatGPT 出現前的非英文文件,誤判率是 0.1%。
人類與 AI 的點子差在哪
作者分析了 9 萬筆逐項預測,歸納出四種系統性差異:
| 差異 | 人類的點子 | AI 的點子 |
|---|---|---|
| 細節的作用 | 細節會改變作者的論點或結論 | 細節可以套到任何同類對象 |
| 具體程度 | 數字有比較基準,步驟照著能做 | 方法或數字看似具體,實際用不上 |
| 主張的範圍 | 寫明主張在什麼條件下成立 | 主張超出證據,延伸到不確定的未來 |
| 成本與缺點 | 保留既有的成本、限制與未解問題 | 成本消失,或被描述成理想的取捨 |
論文的例子:人類寫的相機評測指出底部的電池與記憶卡蓋在接上腳架時打不開;AI 寫的喇叭評測則用「頂級音質」這類能套在任何喇叭上的描述。在 13,616 個保留項目上,79 個特徵中有 64 個與 IdeaLens 的分數方向一致,只有 1 個衝突。
跟既有工作比新在哪
既有的混合來源研究,多半偵測 AI 編修過的文字,或試圖直接從文本分離內容與表達。IdeaLens 換了做法:標籤沿用文字偵測器的,只改變模型的輸入,讓標籤只能透過點子擬合。這跟電腦視覺用風格化圖片壓掉紋理線索的思路相近。
另一個新東西是 TwiceTold。過去的資料集只能用「人類編修 AI 文字」來近似「人類用 AI 的點子寫作」,這類文件大半仍是 AI 寫的。TwiceTold 是第一個人類完全自己動筆、只依 AI 大綱寫成的長文資料集。
模型、訓練資料、評測資料與程式碼都已公開,另有線上展示站 ideadetector.ai。
限制
論文附錄列出的限制:
- 標籤有雜訊:訓練標籤來自 Pangram 的文字來源判斷,假設點子與文字通常同源。人寫下模型的點子、模型潤飾人的文字,都會讓標籤出錯。作者沒有量化這部分造成多少誤差。
- 只訓練英文長文:訓練語料都是 500 字以上的英文文件。短文的 AI 偵測率較低(87.5%,長文是 90.4%);非英文文件的表現取決於抽大綱的模型。
- 依賴專有模型:抽大綱要用 Gemini 3.7 Flash,作者只測過專有的前沿模型,成本與取得性可能限制採用。
- 抽取有隨機性:同一份文件抽五次大綱,整體有 94% 的判定不變,但在門檻附近只有 52.5%。
- 新模型偵測率下降:對語料截止後才釋出的四個模型寫的故事,IdeaLens 只偵測到 51–79%,舊模型是 97%。ProseLens 對其中兩個 Claude 模型也下降,Pangram 4 沒有下降。
- 部分攻擊下較弱:對 DIPPER 改寫,IdeaLens 偵測率 77.6%,Pangram 4 是 95.1%。在各種人性化與對抗攻擊下,IdeaLens 的偵測率平均掉 6.4 個百分點,介於 Pangram(4.9)與 ProseLens(10.6)之間。
- 二元分類:點子一部分來自人、一部分來自 AI 的文件,現在的設定處理不好。
- TwiceTold 規模小:只有 50 篇故事。
論文引言用《華爾街日報》一篇被 Pangram 判為 100% AI 寫成的投書當例子,IdeaLens 對其點子的 AI 機率是 98.3%(門檻 86.3%)。作者在註腳特別說明,這只是模型預測,不能當作寫作過程的直接證據。