新闻股票谷歌DeepMind的AlphaProtein Novo为自然界从未进化过的反应设计酶

谷歌DeepMind的AlphaProtein Novo为自然界从未进化过的反应设计酶

作者: Metaverse Post·

要点速览

  • •谷歌DeepMind与加州理工学院及匹兹堡大学合作推出了AlphaProtein Novo,这是一个从第一性原理构建酶的机器学习流水线,而非优化自然界已有的蛋白质。
  • •在五个目标反应中,研究人员评估了超过5,600个候选设计,命中率高达80%,并在无需迭代实验优化的情况下实现了最先进的催化效率。
  • •领先的从头设计氮宾转移酶GDM_NT_270对六元哌啶环实现了99:1的选择性,对映体过量达94%,转换数为22,逆转了天然血红素酶对吡咯烷的偏好。
  • •AP Novo生成了七个能够分解增塑剂DEHP的新酶结构家族,而此前对65种天然酯酶的筛选仅发现一种有活性的DEHP酶。
  • •要求同一骨架的每个LigandMPNN重测序变体都通过受机制启发的过滤器,使丝氨酸酯酶命中率提升高达30倍,再结合部分扩散重采样,回溯性命中率提高至80%。
谷歌DeepMind的AlphaProtein Novo为自然界从未进化过的反应设计酶

谷歌DeepMind推出了AlphaProtein Novo(AP Novo),这是一个用于酶的从头设计的机器学习流水线。根据本周发表在 bioRxiv 上的预印本论文,该系统首次证明计算设计的酶在具有挑战性的化学反应上可以超越天然序列挖掘。AP Novo由DeepMind与加州理工学院及匹兹堡大学联合开发,从第一性原理出发构建酶,而非优化现有蛋白质,从而解决了生物催化剂发现领域长期存在的瓶颈。由于天然酶的发现依赖于进化已经产生的序列,对于生物体从未采用过的反应,几乎没有可挖掘的资源——这正是从零设计方法所要弥补的空白。

该流水线的核心是motif支架构建。一个扩散模型围绕催化motif——即假定的反应机制所需的侧链和配体排列——共同生成蛋白质结构和氨基酸序列。随后,候选设计使用基于AlphaFold 3预测的指标进行筛选,评估与机制相关的原子细节,例如催化碱基与底物之间的几何构型。团队在五个反应中总共测试了超过5,600个设计,报告称最佳设计类别中的命中率高达80%,并且在基准反应上实现了最先进的催化效率,且无需迭代实验优化。

两个重点应用展示了该方法的广度。第一个针对合成哌啶的氮宾转移酶,哌啶是众多FDA批准药物中常见的杂环结构。底物的竞争性环化可以生成五元吡咯烷环或六元哌啶环,而天然血红素酶强烈倾向于前者。对188个天然和工程化变体的筛选中,没有一种酶的哌啶与吡咯烷比例超过30:70。而领先的从头设计GDM_NT_270实现了99:1的哌啶区域选择性,对映体过量达94%——这是衡量分子以单一镜像形式生成的专一程度的指标,是药物合成中重要的纯度参数——转换数达22,通过对活性位点几何构型的直接控制逆转了天然偏好。

第二个应用针对邻苯二甲酸二(2-乙基己基)酯(DEHP),这是一种普遍存在的增塑剂和干扰内分泌的环境污染物,其庞大的侧链和水不溶性使大多数天然水解酶无能为力。最近对65种天然酯酶的筛选仅发现一种有活性的DEHP酶;相比之下,AP Novo产生了七个能够催化该反应的新结构家族,新型支架命中率高达11%(回收支架为39%)。虽然这些设计在水性条件下的活性仍低于天然酶,但它们表现出自然界中罕见特性:一个含191个残基的酶在90°C下的活性是室温下的14倍,并在75%乙腈中保持功能——这些条件会使天然酯酶完全变性。这种稳健性具有重要的实用价值,因为高温可加速反应,溶剂有助于溶解DEHP等水不溶性底物。其较小的体积和在 E. coli 中的高表达量进一步降低了生产成本。

序列集合作为关键信号

这项研究在方法论上的主要洞见在于过滤环节。研究人员发现,针对同一骨架评估由LigandMPNN衍生的序列集合——要求每个重新测序的变体都通过受机制启发的过滤器——可大幅放大预测能力,将丝氨酸酯酶的命中率提升至30倍。结合对骨架的部分扩散重采样,回溯性命中率在Kemp消除酶反应中达到60%,在丝氨酸酯酶反应中达到80%。作者认为,这解释了迭代重新设计流水线之所以有效的原因:它们隐式地筛选出其局部序列-结构空间能够广泛支持目标催化几何构型的骨架。

局限性依然存在。催化活性仍比天然酶或经定向进化优化的酶低若干数量级,motif构建需要针对特定反应的专业知识,而且模型尚未能有效捕捉催化的物理本质。尽管如此,随着代码和权重以非商业用途发布——外部研究团队可借此将流水线应用于各自的目标反应——AP Novo表明,生成式蛋白质设计正在成熟为挖掘天然生物多样性的实用补充手段,在部分情况下甚至可以成为替代方案。

来源: Metaverse