Google DeepMind 的 AlphaProtein Novo 為自然界從未演化出的反應設計酵素
重點速覽
- •Google DeepMind 與加州理工學院及匹茲堡大學合作推出 AlphaProtein Novo,一條從基本原理建構酵素、而非最佳化自然界既有蛋白質的機器學習流程。
- •研究人員在五種目標反應中評估了超過 5,600 個候選設計,命中率最高達 80%,並在無需迭代實驗最佳化的情況下達到最先進的催化效率。
- •領先的從頭氮烯轉移酶 GDM_NT_270 對六元哌啶環到 99:1 的選擇性,鏡像異構物超額為 94%,轉化次數為 22 次,逆轉了天然血紐素酵素對吡咯烷的偏好。
- •AP Novo 產生了七個能夠分解塑化劑 DEHP 的酵素新結構家族,而近期對 65 種天然酯酶的篩選僅發現一種具活性的 DEHPase。
- •要求支撐骨架的每個 LigandMPNN 重新序列化變異體都通過源自反應機制的篩選條件,使絲氨酸酯酶命中率提升最多 30 倍;結合局部擴散重取樣後,回溯性命中率達到 80%。

Google DeepMind 推出了 AlphaProtein Novo(AP Novo),一條用於從頭酵素設計的機器學習流程。根據本週發表於 bioRxiv 的預印本,該系統首次證明計算設計的酵素在具挑戰性的化學反應上可以超越天然序列探勘。AP Novo 由 Google DeepMind 與加州理工學院及匹茲堡大學共同打造,從基本原理出發建構酵素,而非最佳化既有蛋白質,針對生物催化劑探索中長期存在的瓶頸提出解決方案。由於天然酵素的發現依賴於演化早已產生的序列,生命體從未採用的反應幾乎無從探勘——這正是從零設計方法所要填補的缺口。
這條流程的核心是基序支撐搭建(motif scaffolding)。擴散模型圍繞催化基序——即假設反應機制所需的側鏈與配體排列——共同生成蛋白質結構與胺基酸序列。候選設計隨後以源自 AlphaFold 3 預測的指標進行篩選,評估與機制相關的原子層級細節,例如催化鹼基與受質之間的幾何關係。研究團隊總計在五種反應中測試了超過 5,600 個設計,在最佳設計面向中命中率最高達 80%,並在基準反應上達到最先進的催化效率,且無需迭代實驗最佳化。
兩項指標性應用展示了這種方法的廣度。第一項針對可合成哌啶(piperidine)的氮烯轉移酶,這種雜環存在於多種經 FDA 核准的藥物中。受質的競爭性環化可產生五元的吡咯烷(pyrrolidine)或六元的哌啶環,而天然血紐素酵素強烈偏向前者。篩選 188 個天然與工程化變異體,沒有任何酵素超過 30:70 的哌啶對吡咯烷比例。領先的從頭設計 GDM_NT_270 則達到 99:1 的哌啶區域選擇性,並具備 94% 的鏡異構物超額——衡量分子以單一鏡像形式生成的專一程度,是藥物合成中至關重要的純度指標——以及 22 次轉化次數,透過直接控制活性位幾何結構逆轉了天然偏好。
第二項應用針對鄰苯二甲酸二(2-乙基己基)酯(DEHP),這是一種普遍存在的塑化劑與干擾內分泌的環境污染物,其龐大的側鏈與水不溶性使大多數天然水解酶束手無策。近期一項針對 65 種天然酯酶的篩選僅發現一種具活性的 DEHPase;相比之下,AP Novo 產生了七個能夠催化該反應的新結構家族,新支撐骨架的命中率達 11%(回收支撐骨架為 39%)。雖然這些設計在水溶液條件下的活性仍低於天然酵素,但它們展現了自然界罕見的特性:其中一個含 191 個殘基的酵素在 90°C 下的活性是室溫下的 14 倍,並能在 75% 乙腈中保持功能——這些條件會使天然酯酶完全變性。這種穩健性具有實際意義,因為高溫可加速反應,而有機溶劑有助於溶解 DEHP 這類水不溶性受質。其體積小且在大腸桿菌中高表達,進一步降低了生產成本。
序列集成作為關鍵訊號
這項研究在方法學上的主要洞見與篩選有關。研究人員發現,針對同一支撐骨架評估多個 LigandMPNN 衍生序列的集成——要求每個重新序列化的變異體都通過源自反應機制的篩選條件——大幅放大了預測能力,使絲氨酸酯酶的命中率提升最多 30 倍。結合對支撐骨架的局部擴散重取樣,回溯性命中率進一步達到 Kemp 消去酶的 60% 與絲氨酸酯酶的 80%。作者認為這解釋了迭代重設計流程有效的原因:它們隱性地篩選出局部序列-結構空間能廣泛支援目標催化幾何結構的支撐骨架。
限制依然存在。催化活性仍比天然或定向演化最佳化的酵素低數個數量級,基序建構需要針對特定反應的專業知識,而模型尚未能有意義地捕捉催化的物理本質。儘管如此,隨著程式碼與權重以非商業用途釋出——讓外部研究團隊能將這條流程應用於自身的目標反應——AP Novo 表明,生成式蛋白質設計正成熟為天然生物多樣性探勘的實用補充,在特定案例中甚至是替代方案。
來源:Metaverse