跳到內容

Technology

新聞|AlphaProtein Novo:de novo 酶設計首次在困難反應上超過天然序列挖掘

Google DeepMind 與 Caltech、匹茲堡在 10 月 5 日上傳 AlphaProtein Novo 預印本。整理它用擴散模型 motif scaffolding、LigandMPNN 重新設計序列、AlphaFold 3 機制導向篩選的流程,哌啶合成與 DEHP 降解的成果,multi-resequence 與 multi-partial-diffusion 的骨架評估,以及限制。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

要解決的問題

把酶設計成能催化任意反應,是分子科學的長期目標。傳統蛋白質工程靠定向演化,但得先找到具有目標活性的天然序列當起點,這一步費力且容易失敗。de novo(從零開始)設計原則上可以繞過這個限制,但一直做不出具實用價值的催化性質。

論文指出三個瓶頸:過去的進展多集中在天然酶已經很優化的反應,而 de novo 設計的速率還比天然酶低幾個數量級;在有用的新生化學裡,只有 Kemp 消除這個簡單模型反應曾讓 de novo 酶贏過天然序列;過去的分析只基於少數設計與更少的骨架,限制了方法結論的普遍性。

AP Novo 針對兩個實用且困難的選擇性問題做正面比較:合成藥物常見的哌啶骨架,以及降解環境毒物 DEHP。論文說,這是據他們所知首次直接把 de novo 設計與「篩選天然序列或突變體」這個標準做法比對。

流程

AP Novo 先以 motif scaffolding、再篩選候選設計:

  1. 建 motif。 依假設的催化機制,把側鏈官能基與小分子配基組成催化 motif。
  2. 擴散生成骨架。 把 motif 輸入擴散模型,產生把 motif 固定在指定構型的蛋白骨架。這個模型同時生成序列:座標走高斯擴散,序列走遮罩式離散擴散。
  3. 重新設計序列。 把骨架交給 LigandMPNN 產出最終序列(resequencing)。部分實驗也直接用擴散模型生成的序列,不再重新設計。
  4. 篩選。 用 AlphaFold 3(或一個針對離開原子微調的變體 AF3-LA)預測結構,再依機制相關的原子幾何指標挑選要實驗驗證的設計。

兩個實用成果

哌啶合成的硝烯轉移酶。 (5-疊氮基戊基)苯的環化可以生成吡咯啶或哌啶產物。天然與工程體的 188 個變體篩選裡,有 9 個超過活性門檻,卻沒有一個超過 30

的哌啶:吡咯啶區域異構比,顯示用天然骨架做六員環有多難。AP Novo 設計含組氨酸配位血紅素的新骨架,領先設計 GDM_NT_270 做出 22 次總轉換數、99
的哌啶選擇性、以及 94% 對映體過量,與天然原蛋白相比,哌啶產物的總轉換數提升兩個數量級。這把天然酶偏好吡咯啶的方向反轉了過來。

降解 DEHP 的水解酶。 DEHP 是普遍的塑化劑與環境污染物,天然能降解它的酶很少,因為側鏈空間障礙大,而且改善溶解度的有機共溶劑會讓多數酶失活。AP Novo 把新骨架命中率提到 11%(活性超過對照酶 QHH 的 2%),回收骨架則到 39%;相比之下,一項針對 65 個天然酶的篩選只找到一個有活性的 DEHP 降解酶。

設計酶在活性上比不上天然酶,卻更穩定:

GDM_DEHP_376 的性質數值
蛋白長度191 個氨基酸,比 QHH、Q7SIG1 小 60% 與 40%
90°C 與室溫比較90°C 活性是室溫的 14 倍
75% 乙腈與 0% 比較75% 乙腈下活性是 0% 的 2 倍
兩個天然酶在上述條件完全失活

室溫水溶液裡,活性最高的 GDM_DEHP_378 在 4 小時只達天然酶 QHH 產物量的 6%。但設計酶小、表達量高、耐溫耐溶劑,論文視為適合優化的起點。距離實際生物修復還需要更高活性與把 DEHP 完全降解到鄰苯二甲酸。

模型反應與方法開發

開發階段,AP Novo 在三個模型反應上跑多輪設計-測試-學習,順便拿到較高的催化參數。

反應最佳設計與催化性質
Kemp 消除GDM_KE_1872 在 pH 10 的 kcat/Km 約 44,940 M⁻¹s⁻¹;GDM_KE_1483 在 pH 7.5 為 14,600 M⁻¹s⁻¹
絲氨酶(4MU-Ac 水解)GDM_SE_2937 的 kcat/Km 約 360,000 M⁻¹s⁻¹,但骨架與天然絲氨酶相近
碳轉移酶(苯乙烯環丙烷化)GDM_CT_103 在單輪設計就做到 >99
非對映體比與 96% 對映體過量

Kemp 消除的最佳數字比過去最好的新骨架 de novo 設計高約 70 倍,但還比經實驗反覆優化的設計低 10 到 100 倍。絲氨酶最強的 GDM_SE_2937 雖然超過以往所有 de novo 設計,但它的骨架與活性位置與 PDB 裡的天然絲氨酶相似;排除這類「天然絲氨酶構型」後,最佳設計的 kcat/Km 是 4,900 M⁻¹s⁻¹,約為以往最佳新骨架設計的 4 倍。

關鍵發現:用序列集合評估骨架

論文最重要的方法貢獻,是把篩選從單一序列擴到序列集合。當設計是由一個結構假設(催化 motif)驅動時,它們評估的是 AF3 在複數狀態(apo 與配位結合)與複數隨機種子下的預測穩健度。

Multi-resequence(MR)評分。 對同一骨架,用 LigandMPNN 產生多條序列,要求每條都通過同一組篩選指標。這等於在問:光看骨架本身,是不是就能讓關鍵催化作用很容易被預先組織好。回測數據裡,MR 讓 Kemp 與絲氨酶的命中率分別提升 2.5 倍與 5.4 倍;後續前瞻性設計輪次裡,MR 篩選的絲氨酶命中率到 44%,是沒用 MR 時的 30 倍。

Multi-partial-diffusion(MPD)。 AP Novo 的擴散模型自己也能做類似的事:對現有設計加少量雜訊再重跑去噪,得到骨架幾乎一樣、序列略改的版本,再對每條套用篩選。MR 與 MPD 可以結合:把所有 Kemp 與絲氨酶設計回測性篩到 10/10 MPD 加 10/10 MR 都通過,命中率分別到 60% 與 80%,是全部分析中最高的。

論文認為這解釋了近來「迭代重設計」流程為什麼有效:那些流程讓骨架(帶微小變化)反覆通過篩選,實際上就是隱含地在做 MR 或 MPD 評分,選出在序列與結構空間裡功能基較寬的骨架。

驗證與新穎性

限制

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。