重點
- 9 月 30 日,Google DeepMind 在 Nature 發表 SynthIDBio,分別處理蛋白質序列與預測結構。
- 序列浮水印做在 ProteinMPNN 的取樣上。三個目標的體外實驗裡,結合力分布與未加浮水印的設計沒有全體顯著差異;送測設計在 0.1% 偽陽性率下的偵測真陽性率是 100%。
- 結構浮水印微調 AlphaFold 3。推薦的低噪聲設定沒有拉低 LDDT 與模板建模分數,0.1% 偽陽性率的真陽性率超過 99.8%。
- 抗刻意竄改還沒完成。官方把這件事列為後續工作,論文也報告兩種標記都有測到失效的情況。
- DeepMind 希望它成為 DNA 合成篩檢的來源訊號。論文寫明這仍是概念驗證,還不能直接當成作業流程。
序列與結構各做一次
SynthIDBio-sequence 使用文字浮水印 SynthID-Text 的 tournament sampling。ProteinMPNN 依一條骨架逐個殘基抽胺基酸時,取樣分布會依密鑰偏置。檢測時用同一把密鑰重算分數。實驗沒有從頭生成骨架,而是拿 AlphaProteo 已有、且已知能結合的骨架,重新設計序列。
SynthIDBio-structure 微調 AlphaFold 3 的擴散模組與信心模組,把浮水印做進權重,讓輸出的原子座標自帶訊號。偵測器另外訓練,不跟微調後的模型權重一起給使用者。這次微調用 256 張 A100,大約一天。推論階段沒有額外成本。
功能與偵測率
序列的體外測試有三個目標:SARS-CoV-2 棘蛋白受體結合域(SC2RBD)、血管內皮生長因子 A(VEGF-A)、PD-L1。每個目標 15 條骨架。不含對照時,未加浮水印 222 條序列,每種浮水印設定 267 條。結合力用表面電漿共振的解離常數 KD。
論文寫,浮水印 binder 對 SC2RBD 是低奈米莫耳,對 VEGF-A 與 PD-L1 是次奈米莫耳。雙尾 Wilcoxon rank-sum 檢定下,未加浮水印與兩種浮水印設定的 KD 分布沒有全體顯著差異。SC2RBD 上,distortionary、溫度 0.1 的中位數 KD 顯著低於非 distortionary、溫度 0.5。命中率在 KD ≤ 100 nM 沒有顯著差異。門檻放寬到 KD ≤ 1 μM 時,未加浮水印的命中率顯著高於非 distortionary 0.5。9 個陰性對照都沒有可測到的結合。
偵測門檻用 0.1% 偽陽性率校正。過了這道 g 值門檻的設計,真陽性率是 100%。門檻會降低通過率,流程得產生更多候選。論文的估算是,沒過門檻的序列不必再跑 AlphaFold 3,所以實際多出來的計算不多。
結構模型在 AlphaFold 3 評估集上測三種訓練噪聲:0.001、0.01、0.1 Å。0.1% 偽陽性率時,真陽性率都超過 99.8%。0.001 Å 的模型相對真實結構的 LDDT 與模板建模分數,不低於未浮水印的 AlphaFold 3;訓練噪聲加大時,這兩項會小幅下降。同一模型在 0.01% 偽陽性率的真陽性率是 98.99%。殘基少於 16 的結構,偵測明顯變差。
與先前工作的差別
論文比較的序列浮水印,先前停在電腦模擬,對象是 PDB 的野生型單體,沒有體外功能數據。結構方面,FoldMark 先做事後浮水印,再蒸餾進 ESMfold,RMSD 明顯變差。SynthIDBio 的結構做法是把浮水印損失直接加進 AlphaFold 3 的擴散訓練。
官方部落格說,標記要能在合成出來的蛋白質上驗證。序列浮水印寫在胺基酸序列裡。他們向 Twist Bioscience 訂基因片段、表現蛋白質、測結合;偵測讀的是序列分數。論文沒有另做一種化學檢驗。結構浮水印在預測座標上。論文沒有報告把這些座標對應的蛋白質做出來之後,還能用同一個偵測器讀到標記。
篩檢用途與抗竄改
DNA 合成商現在主要拿訂單去對已知危害序列。DeepMind 的說法是,AI 可以做出和資料庫幾乎不像的新序列,篩檢不能再把「不像已知危害」當成安全。若訂單帶有可驗證浮水印,篩檢方多一個訊號:這份設計來自一把受信任的密鑰所對應的模型。Twist 生物安全副總 James Diggans 在部落格裡的早期意見,是把這看成工具箱的可能補充。
論文把同一件事寫成尚未可操作。序列浮水印位於取樣,使用者可以關閉。結構浮水印位於權重,使用者即使拿得到模型,也拿不到偵測器。兩種都是 zero-bit,只表示有這道浮水印,不能區分是哪一個使用者或哪一個工具。要給合成商用,還得在開發者與合成商之間交換密鑰,並把偽陽性率調到篩檢擔得住的水準。
抗竄改是明確的缺口。官方部落格把「讓浮水印更能抵抗刻意竄改」列為接下來的挑戰。論文報告,序列標記在依同一條骨架重新產生序列之後會大量消失,估計的結合命中率也會下降。結構標記對剛性變換與很小的座標噪聲仍可偵測;一種能量最小化的結構弛豫之後,浮水印沒有留下來。失效時用的軟體、力場與參數這裡不寫。
同一則部落格還寫了另一項進行中的合作:與 Stanford、Arc Institute 的 Hie 實驗室把 SynthID Bio 放進基因模型 Evo 2,標記一個由 Evo 2 設計的噬菌體基因組。細菌培養的早期測試裡,這些噬菌體仍有功能。技術手稿尚未發表,數字不在這篇 Nature 論文裡。
程式、體外數據,以及建議使用的結構權重(訓練噪聲 0.001 Å)在 google-deepmind/synthidbio。