Google DeepMind 推出 SynthID Bio:为 AI 生成的蛋白质添加水印
要点速览
- •SynthID Bio 将不可感知的水印嵌入 AI 生成蛋白质的氨基酸序列和预测的 3D 结构中,且这些签名在合成的实体蛋白质上依然可验证,同时不损害其生物功能。
- •在针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 的湿实验测试中,带水印的蛋白质结合剂在命中率、结合亲和力和序列多样性方面与不带水印的版本相当,产生了首批具有生物功能的带水印结合剂。
- •对于蛋白质折叠,水印能力直接内置在 AlphaFold 3 的模型权重中,在保持预测精度的同时提供近乎完美的可检测性,并能抵御数字噪声或微小的坐标变化。
- •该系统旨在通过向 DNA 合成服务商提供自动化的订单来源验证信号来加强生物安全,并帮助在 Protein Data Bank、UniProt 和 GenBank 等数据库中对合成条目进行正确标注或标记以供审查。
- •在与斯坦福大学 Hie 实验室和 Arc Institute 的合作中,DeepMind 将 SynthID Bio 集成到 Evo 2 基因组模型中,为设计出的噬菌体基因组添加水印,细菌培养物中的早期实验室测试确认了这些带水印噬菌体具有功能。

Google DeepMind 推出了 SynthID Bio,这是一项将水印技术引入合成生物学领域的概念验证工作。该公司在 9 月 30 日发布的一篇博客文章中宣布,该系统将不可感知的签名直接嵌入 AI 生成蛋白质的生物代码中,确保水印不仅在数字模型上可验证,而且在合成出的实体蛋白质上也可验证——同时在实验室测试中保持其生物功能。
这项工作由 Pushmeet Kohli、David Stutz、Ali Cowen-Rivers 和 Jeremy Ratcliff 撰写,正值生成式 AI 日益帮助科学家应对关键生物学挑战之际:利用 AlphaFold 预测蛋白质结构,利用 AlphaProteo 和 ProteinMPNN 设计全新蛋白质,以及最近开发新的噬菌体——即感染细菌的病毒。然而,这些工具也带来了新的挑战。新颖的 AI 设计可能绕过传统的 DNA 合成筛查,而标注错误的合成 3D 结构则有污染公共数据库并误导后续研究的风险。
SynthID Bio 的工作原理
SynthID Bio 是一套专为合成生物学开发的水印方法,旨在加强生物安全和科学诚信。该方法会根据数据类型进行调整:对于序列,它会细微地引导氨基酸的选择;对于预测的 3D 结构,它会调整原子坐标。在这两种情况下,这些修改都会创建一个可靠的检测信号。
在实验中,这些调整并未损害蛋白质的生物功能——Google DeepMind 将这一特性描述为有效治疗疾病和推进科学研究的关键。
该团队通过将其实用的结合剂设计方法 AlphaProteo 与启用 SynthID Bio 的 ProteinMPNN 版本(一种常用的蛋白质序列生成方法)相结合,验证了其针对蛋白质结合剂——即被设计为选择性附着于其他蛋白质的分子——的水印方法。在针对三种靶蛋白(VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1)的湿实验测试中,带水印的设计在命中率、结合亲和力和天然序列多样性方面均与不带水印的版本相当,成功创建了首批带水印且具有生物功能的蛋白质结合剂。结合亲和力以 KD 衡量,数值越低表示结合力越强。
对于蛋白质折叠,SynthID Bio 对 AlphaFold 3 扩散网络的一小部分进行了微调,将水印能力直接构建到模型权重中。这确保了无论谁运行该模型,预测的 3D 坐标都天然携带可检测的签名。据该公司介绍,该技术在保持 AlphaFold 3 预测精度的同时,提供了近乎完美的可检测性,维持了关键结构特征的分布,并能抵御数字噪声或微小的坐标变化。团队以蛋白质 7PPA 为例展示了结果,并将 AlphaFold 3 预测结构与真实结构以及带水印的结构进行了对比。
加强生物安全与信息完整性
生物安全依赖于分层防御——即“瑞士奶酪”模型,多种独立的安全措施协同工作,以弥补彼此的盲点。模型级缓解措施和客户审查保障措施各自代表着一个可能存在漏洞的关键层面。作为 Google DeepMind 更广泛的生物韧性愿景的一部分,SynthID Bio 的水印方法充当了一个嵌入生物设计本身的重要且切实的验证层。
“SynthID Bio 是追踪生物设计来源这一拼图中的重要一环,”审阅了这项工作的生物安全政策专家、Science Policy Consulting 负责人 Sarah Carter 表示。“通过将设计与模型开发者联系起来,这些水印使开发者能够在安全方面发挥主导作用,并使合成服务提供商能够为使用过这些模型的客户简化筛查流程。”
这一层对于处于生物安全第一线的 DNA 合成筛查尤为重要。将数字蛋白质设计转化为实体分子需要向 DNA 合成服务商下单,后者会根据已知威胁数据库对请求进行筛查。从历史上看,一个陌生的序列可以被安全地假定来自某种未被发现的自然生物。但由于 AI 可以创造出与已知危害几乎毫无相似之处的全新序列,筛查人员不再能做出这种假设。要核实一份陌生订单并非工程化威胁,需要进行详尽的人工审查,这可能会拖延重要的研究。在这种情况下,SynthID Bio 可以提供自动化的验证信号,证明订单源自一个内置安全保障的可信模型。
“AI 正在扩展科学家能够设计的范围,而 DNA 合成公司在帮助这项创新负责任地规模化方面发挥着重要作用,”Twist Bioscience 政策与生物安全副总裁 James Diggans 表示,他为论文提供了早期反馈。“对 Twist 而言,水印为生物安全工具箱提供了一个很有前景的新工具,随着 AI 设计的生物技术不断进步,它可以加强筛查、将资源集中在需要更仔细审查的序列上,并提高生物安全的效率。”
同样,SynthID Bio 可以帮助维护 Protein Data Bank、UniProt 和 GenBank 等数据库的完整性。这些数据库中有许多向公众开放提交,在科学进步中发挥着至关重要的作用——但标注错误的条目可能对生物安全决策产生过大的负面影响,随着 AI 生成生物数据的增加,这一挑战可能只会越来越大。作为提交流程的一部分,SynthID Bio 可以帮助确保合成条目得到正确标注或被标记以供进一步审查。
展望未来
虽然没有哪种单一的生物安全干预措施是万灵药,但 SynthID Bio 将 Google DeepMind 久经考验的水印工具 SynthID 带入了合成生物学领域,这标志着向可靠识别和追踪 AI 生成的生物序列与结构迈出了重要的第一步。
接下来,关键挑战包括使水印更能抵御蓄意篡改。SynthID Bio 还可以与来源元数据方法(类似于数字媒体领域的 C2PA)或 AI 生成生物数据的中央存储库相结合,以更好地识别和追踪 AI 生成的蛋白质。
为了匹敌前沿 AI 技术日益增长的能力,Google DeepMind 还在研究如何将水印应用于更复杂的生物对象。在与斯坦福大学 Hie 实验室和 Arc Institute 的持续合作中,团队将 SynthID Bio 集成到先进基因组模型 Evo 2 中,为 Evo 2 设计的噬菌体基因组添加水印。在细菌培养物中进行的早期实验室测试已确认这些带水印的噬菌体具有功能。Google DeepMind 表示,这项工作有潜力应对与基因组设计相关的一些生物安全风险,并将在即将发布的技术手稿中分享更多细节。
要充分实现这项工作的生物安全效益,需要社区合作和进一步的研究。作为其对负责任创新承诺的一部分,该公司正在发表其方法论文、代码和体外数据,并向研究社区发布模型权重。Google DeepMind 表示,其目标是与生物安全、基因合成和政策领域的合作伙伴开放合作,确保安全与责任跟上 AI 驱动的发现的步伐。有兴趣就该主题开展合作的相关方可通过 synthidbio@google.com 联系团队并提交高层级提案,且请勿披露任何机密或专有信息。
致谢
该项目由 Pushmeet Kohli 发起。研究和技术开发由 Alexander I. Cowen-Rivers 和 David Stutz 领导,Kohli 担任顾问。Guillermo Ortiz-Jimenez、Jeremy Ratcliff、Vinicius Zambaldi、Lindsay Willmore、Josh Abramson、Harshnira Patani、Christina Kouridi、Florian Stimberg、Mel Vecerik、Alex Chu、Sukhdeep Singh、Sumanth Dathathri、Eliseo Papa、Valentin De Bortoli、Arnaud Doucet、Jue Wang 和 Sven Gowal 做出了关键的工程与研究贡献。团队感谢 Adaptyv Bio 在体外验证方面提供的帮助。
这项工作向噬菌体 DNA 水印的扩展是 Google DeepMind 与斯坦福大学 Hie 实验室和 Arc Institute 的合作,主要贡献者包括 Google DeepMind 的 Jeremy Ratcliff、Aleks Petrov、Alexander I. Cowen-Rivers、David Stutz、Elisa L. H. Wong、Victor Martin Palacios、Francesca Pietra、Alfred Piccioni、Tristan Oliver Kwan、Tor Lattimore、Sumanth Dathathri 和 Pushmeet Kohli,以及 Arc Institute 和斯坦福大学的 Brian Hie、Samuel King 和 Aditi Merchant。
Google DeepMind 还感谢 Rudy Bunel、Anna Cupani、Rob Fergus、Thomas Frerix、Sahra Ghalebikesabi、John Jumper、Jacob Kelly、David La、Victor Martin、Sebastian Nowozin、Stig Petersen、Aleks Petrov、Uchechi Okereke、Sylvestre-Alvise Rebuffi、Rosalia Schneider、Armin Senoner、Richard Shuai、Ashok Thillaisundaram、Elisa L. H. Wong、Zachary Wu 和 Augustin Žídek 对研究文章的贡献,并感谢 Julien Bergeron 对 3D 渲染的贡献。团队最后感谢 Demis Hassabis 对该项目的鼓励与支持。