重點
- Google DeepMind 與 Caltech(Frances Arnold 實驗室)、匹茲堡大學在 10 月 5 日於 bioRxiv 上傳 AlphaProtein Novo(AP Novo)的預印本,程式與權重放在 GitHub(程式 Apache 2.0,權重另訂非商用條款)。
- 論文聲稱這是 de novo 酶設計首次在「困難且實用」的反應上超過天然序列挖掘。以往只有 Kemp 消除這類簡單模型反應,de novo 設計能贏天然酶。
- 流程是用擴散模型對催化模型進行 motif scaffolding(同時生成骨架與序列),再用 LigandMPNN 重新設計序列,最後用 AlphaFold 3 預測的機制導向指標篩選。
- 兩個代表成果:設計出對哌啶合成具高區域選擇性的硝烯轉移酶(領先設計 99 的哌啶:吡咯啶比、對映體過量 94%),以及能在變性條件下降解塑化劑 DEHP 的水解酶。
- 關鍵方法發現:對同一骨架衍生的「序列集合」做篩選(multi-resequence),把命中率拉高到單序列篩選的數倍;與 multi-partial-diffusion 合用時,Kemp 與絲氨酶的回測命中率分別到 60% 與 80%。
要解決的問題
把酶設計成能催化任意反應,是分子科學的長期目標。傳統蛋白質工程靠定向演化,但得先找到具有目標活性的天然序列當起點,這一步費力且容易失敗。de novo(從零開始)設計原則上可以繞過這個限制,但一直做不出具實用價值的催化性質。
論文指出三個瓶頸:過去的進展多集中在天然酶已經很優化的反應,而 de novo 設計的速率還比天然酶低幾個數量級;在有用的新生化學裡,只有 Kemp 消除這個簡單模型反應曾讓 de novo 酶贏過天然序列;過去的分析只基於少數設計與更少的骨架,限制了方法結論的普遍性。
AP Novo 針對兩個實用且困難的選擇性問題做正面比較:合成藥物常見的哌啶骨架,以及降解環境毒物 DEHP。論文說,這是據他們所知首次直接把 de novo 設計與「篩選天然序列或突變體」這個標準做法比對。
流程
AP Novo 先以 motif scaffolding、再篩選候選設計:
- 建 motif。 依假設的催化機制,把側鏈官能基與小分子配基組成催化 motif。
- 擴散生成骨架。 把 motif 輸入擴散模型,產生把 motif 固定在指定構型的蛋白骨架。這個模型同時生成序列:座標走高斯擴散,序列走遮罩式離散擴散。
- 重新設計序列。 把骨架交給 LigandMPNN 產出最終序列(resequencing)。部分實驗也直接用擴散模型生成的序列,不再重新設計。
- 篩選。 用 AlphaFold 3(或一個針對離開原子微調的變體 AF3-LA)預測結構,再依機制相關的原子幾何指標挑選要實驗驗證的設計。
兩個實用成果
哌啶合成的硝烯轉移酶。 (5-疊氮基戊基)苯的環化可以生成吡咯啶或哌啶產物。天然與工程體的 188 個變體篩選裡,有 9 個超過活性門檻,卻沒有一個超過 30
的哌啶:吡咯啶區域異構比,顯示用天然骨架做六員環有多難。AP Novo 設計含組氨酸配位血紅素的新骨架,領先設計 GDM_NT_270 做出 22 次總轉換數、99 的哌啶選擇性、以及 94% 對映體過量,與天然原蛋白相比,哌啶產物的總轉換數提升兩個數量級。這把天然酶偏好吡咯啶的方向反轉了過來。降解 DEHP 的水解酶。 DEHP 是普遍的塑化劑與環境污染物,天然能降解它的酶很少,因為側鏈空間障礙大,而且改善溶解度的有機共溶劑會讓多數酶失活。AP Novo 把新骨架命中率提到 11%(活性超過對照酶 QHH 的 2%),回收骨架則到 39%;相比之下,一項針對 65 個天然酶的篩選只找到一個有活性的 DEHP 降解酶。
設計酶在活性上比不上天然酶,卻更穩定:
| GDM_DEHP_376 的性質 | 數值 |
|---|---|
| 蛋白長度 | 191 個氨基酸,比 QHH、Q7SIG1 小 60% 與 40% |
| 90°C 與室溫比較 | 90°C 活性是室溫的 14 倍 |
| 75% 乙腈與 0% 比較 | 75% 乙腈下活性是 0% 的 2 倍 |
| 兩個天然酶在上述條件 | 完全失活 |
室溫水溶液裡,活性最高的 GDM_DEHP_378 在 4 小時只達天然酶 QHH 產物量的 6%。但設計酶小、表達量高、耐溫耐溶劑,論文視為適合優化的起點。距離實際生物修復還需要更高活性與把 DEHP 完全降解到鄰苯二甲酸。
模型反應與方法開發
開發階段,AP Novo 在三個模型反應上跑多輪設計-測試-學習,順便拿到較高的催化參數。
| 反應 | 最佳設計與催化性質 |
|---|---|
| Kemp 消除 | GDM_KE_1872 在 pH 10 的 kcat/Km 約 44,940 M⁻¹s⁻¹;GDM_KE_1483 在 pH 7.5 為 14,600 M⁻¹s⁻¹ |
| 絲氨酶(4MU-Ac 水解) | GDM_SE_2937 的 kcat/Km 約 360,000 M⁻¹s⁻¹,但骨架與天然絲氨酶相近 |
| 碳轉移酶(苯乙烯環丙烷化) | GDM_CT_103 在單輪設計就做到 >99 非對映體比與 96% 對映體過量 |
Kemp 消除的最佳數字比過去最好的新骨架 de novo 設計高約 70 倍,但還比經實驗反覆優化的設計低 10 到 100 倍。絲氨酶最強的 GDM_SE_2937 雖然超過以往所有 de novo 設計,但它的骨架與活性位置與 PDB 裡的天然絲氨酶相似;排除這類「天然絲氨酶構型」後,最佳設計的 kcat/Km 是 4,900 M⁻¹s⁻¹,約為以往最佳新骨架設計的 4 倍。
關鍵發現:用序列集合評估骨架
論文最重要的方法貢獻,是把篩選從單一序列擴到序列集合。當設計是由一個結構假設(催化 motif)驅動時,它們評估的是 AF3 在複數狀態(apo 與配位結合)與複數隨機種子下的預測穩健度。
Multi-resequence(MR)評分。 對同一骨架,用 LigandMPNN 產生多條序列,要求每條都通過同一組篩選指標。這等於在問:光看骨架本身,是不是就能讓關鍵催化作用很容易被預先組織好。回測數據裡,MR 讓 Kemp 與絲氨酶的命中率分別提升 2.5 倍與 5.4 倍;後續前瞻性設計輪次裡,MR 篩選的絲氨酶命中率到 44%,是沒用 MR 時的 30 倍。
Multi-partial-diffusion(MPD)。 AP Novo 的擴散模型自己也能做類似的事:對現有設計加少量雜訊再重跑去噪,得到骨架幾乎一樣、序列略改的版本,再對每條套用篩選。MR 與 MPD 可以結合:把所有 Kemp 與絲氨酶設計回測性篩到 10/10 MPD 加 10/10 MR 都通過,命中率分別到 60% 與 80%,是全部分析中最高的。
論文認為這解釋了近來「迭代重設計」流程為什麼有效:那些流程讓骨架(帶微小變化)反覆通過篩選,實際上就是隱含地在做 MR 或 MPD 評分,選出在序列與結構空間裡功能基較寬的骨架。
驗證與新穎性
- 機制導向的 AF3 指標有效。 在 Kemp 消除上,前瞻性地篩選催化鹼與過渡態類似物的幾何,把命中率提高 3 倍、最佳 kobs 從 0.49 升到 1.38 s⁻¹。
- 活性來自設計的催化位。 絲氨酶裡,針對催化三聯體的突變 100% 消除活性。
- 高熱穩定。 所有測試的設計在加熱後活性持平或略升,T50 都超過 80°C,而對照的天然酶在較低溫度就失活。
- 結構新穎。 新骨架設計對 PDB 最佳匹配的 TM-score 中位數是 0.33;彼此之間平均成對 TM-score 中位數 0.34;最活躍的設計與天然序列的最高序列相似度是 29%。
限制
- 設計初期需要專家手工建 motif,motif 對結果影響很大,現有篩選指標捕捉不到。
- 一個 motif 要生成很多樣本才找得到通過篩選的設計,成本可能非常高。
- de novo 設計的催化活性仍比天然酶或定向演化優化的酶低幾個數量級。論文自述這表示模型並沒有真正建模催化的物理。
- MR 雖然是有效的通用策略,卻仍依賴已經建立的反應專屬指標。
- 這是未經同儕審查的預印本;數字來自作者自己的實驗與分析。