跳到內容

Technology

新聞|DeepMind 用 SynthID Bio 標記 AI 生成的蛋白質序列與結構

Google DeepMind 在 Nature 發表 SynthIDBio,分別為蛋白質序列與 AlphaFold 3 的結構預測加上浮水印。體外實驗裡結合力大致保住,官方把抗竄改列為尚未完成的工作。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

序列與結構各做一次

SynthIDBio-sequence 使用文字浮水印 SynthID-Text 的 tournament sampling。ProteinMPNN 依一條骨架逐個殘基抽胺基酸時,取樣分布會依密鑰偏置。檢測時用同一把密鑰重算分數。實驗沒有從頭生成骨架,而是拿 AlphaProteo 已有、且已知能結合的骨架,重新設計序列。

SynthIDBio-structure 微調 AlphaFold 3 的擴散模組與信心模組,把浮水印做進權重,讓輸出的原子座標自帶訊號。偵測器另外訓練,不跟微調後的模型權重一起給使用者。這次微調用 256 張 A100,大約一天。推論階段沒有額外成本。

功能與偵測率

序列的體外測試有三個目標:SARS-CoV-2 棘蛋白受體結合域(SC2RBD)、血管內皮生長因子 A(VEGF-A)、PD-L1。每個目標 15 條骨架。不含對照時,未加浮水印 222 條序列,每種浮水印設定 267 條。結合力用表面電漿共振的解離常數 KD。

論文寫,浮水印 binder 對 SC2RBD 是低奈米莫耳,對 VEGF-A 與 PD-L1 是次奈米莫耳。雙尾 Wilcoxon rank-sum 檢定下,未加浮水印與兩種浮水印設定的 KD 分布沒有全體顯著差異。SC2RBD 上,distortionary、溫度 0.1 的中位數 KD 顯著低於非 distortionary、溫度 0.5。命中率在 KD ≤ 100 nM 沒有顯著差異。門檻放寬到 KD ≤ 1 μM 時,未加浮水印的命中率顯著高於非 distortionary 0.5。9 個陰性對照都沒有可測到的結合。

偵測門檻用 0.1% 偽陽性率校正。過了這道 g 值門檻的設計,真陽性率是 100%。門檻會降低通過率,流程得產生更多候選。論文的估算是,沒過門檻的序列不必再跑 AlphaFold 3,所以實際多出來的計算不多。

結構模型在 AlphaFold 3 評估集上測三種訓練噪聲:0.001、0.01、0.1 Å。0.1% 偽陽性率時,真陽性率都超過 99.8%。0.001 Å 的模型相對真實結構的 LDDT 與模板建模分數,不低於未浮水印的 AlphaFold 3;訓練噪聲加大時,這兩項會小幅下降。同一模型在 0.01% 偽陽性率的真陽性率是 98.99%。殘基少於 16 的結構,偵測明顯變差。

與先前工作的差別

論文比較的序列浮水印,先前停在電腦模擬,對象是 PDB 的野生型單體,沒有體外功能數據。結構方面,FoldMark 先做事後浮水印,再蒸餾進 ESMfold,RMSD 明顯變差。SynthIDBio 的結構做法是把浮水印損失直接加進 AlphaFold 3 的擴散訓練。

官方部落格說,標記要能在合成出來的蛋白質上驗證。序列浮水印寫在胺基酸序列裡。他們向 Twist Bioscience 訂基因片段、表現蛋白質、測結合;偵測讀的是序列分數。論文沒有另做一種化學檢驗。結構浮水印在預測座標上。論文沒有報告把這些座標對應的蛋白質做出來之後,還能用同一個偵測器讀到標記。

篩檢用途與抗竄改

DNA 合成商現在主要拿訂單去對已知危害序列。DeepMind 的說法是,AI 可以做出和資料庫幾乎不像的新序列,篩檢不能再把「不像已知危害」當成安全。若訂單帶有可驗證浮水印,篩檢方多一個訊號:這份設計來自一把受信任的密鑰所對應的模型。Twist 生物安全副總 James Diggans 在部落格裡的早期意見,是把這看成工具箱的可能補充。

論文把同一件事寫成尚未可操作。序列浮水印位於取樣,使用者可以關閉。結構浮水印位於權重,使用者即使拿得到模型,也拿不到偵測器。兩種都是 zero-bit,只表示有這道浮水印,不能區分是哪一個使用者或哪一個工具。要給合成商用,還得在開發者與合成商之間交換密鑰,並把偽陽性率調到篩檢擔得住的水準。

抗竄改是明確的缺口。官方部落格把「讓浮水印更能抵抗刻意竄改」列為接下來的挑戰。論文報告,序列標記在依同一條骨架重新產生序列之後會大量消失,估計的結合命中率也會下降。結構標記對剛性變換與很小的座標噪聲仍可偵測;一種能量最小化的結構弛豫之後,浮水印沒有留下來。失效時用的軟體、力場與參數這裡不寫。

同一則部落格還寫了另一項進行中的合作:與 Stanford、Arc Institute 的 Hie 實驗室把 SynthID Bio 放進基因模型 Evo 2,標記一個由 Evo 2 設計的噬菌體基因組。細菌培養的早期測試裡,這些噬菌體仍有功能。技術手稿尚未發表,數字不在這篇 Nature 論文裡。

程式、體外數據,以及建議使用的結構權重(訓練噪聲 0.001 Å)在 google-deepmind/synthidbio。

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。