谷歌DeepMind的SynthID被马里兰大学改造用于为AI设计蛋白质添加水印的概念验证研究
要点速览
- •马里兰大学的研究人员改造了谷歌DeepMind的SynthID技术,在包括ProteinMPNN在内的AI设计模型生成的蛋白质序列中嵌入基于私钥的不可见水印。
- •验证测试显示,添加水印后pLDDT折叠质量评分保持不变,即被标记的蛋白质在结构上依然稳固。
- •与基于元数据的溯源方法不同,统计水印嵌入在序列本身之中,可经受复制粘贴、文件格式转换和跨系统分发。
- •该技术可补充国际基因合成联盟现有的生物安全筛查,其已知危害数据库可能无法匹配真正全新的AI生成序列。
- •这项工作仅为概念验证——尚无商业产品,该方法能否迁移至其他蛋白质设计模型及实际合成筛查工作流程仍无定论。

谷歌DeepMind的SynthID水印技术最初用于识别AI生成的文本、图像、音频和视频,如今已被拓展至一个全新领域:生物学。马里兰大学的研究人员对这一系统进行了改造,可直接在AI设计的蛋白质序列中嵌入不可见水印,为合成生物学建立了一种潜在的追踪机制,且不会损害蛋白质本身。
在氨基酸层面添加水印
该方法建立在SynthID-Text的基础上,其原理是在生成过程中对词元的概率分布进行细微调整——在本例中,是氨基酸而非文字。研究人员采用无偏Gumbel采样方法,将一个由私钥派生的水印嵌入包括ProteinMPNN在内的蛋白质设计模型的氨基酸概率分布中。
ProteinMPNN发布于2022年,是设计新型蛋白质序列的知名AI模型之一。它以目标三维蛋白质结构为输入,反向推导出预期可折叠成该形状的氨基酸序列。这一领域已迅速进入主流视野:2024年诺贝尔化学奖表彰了计算蛋白质设计(授予David Baker)以及AI驱动的蛋白质结构预测(由谷歌DeepMind的Demis Hassabis和John Jumper凭借AlphaFold2共同获得)。水印层叠加在这一工作流程之上,影响具体选择哪些氨基酸,但不改变输出的整体统计特性。
验证测试显示,pLDDT评分——预测蛋白质折叠质量的标准指标——在添加水印后保持不变。从结构上看,带水印的蛋白质与不带水印的蛋白质同样稳固。
生物安全层面的意义
随着AI蛋白质设计工具日益强大且更易获取,生成新型生物序列的能力引发了合理的安全担忧。传统溯源方法(如附加在文件上的元数据日志)可以像删除照片中的EXIF数据一样被轻易抹去,无法提供持久的监管链。
嵌入式统计水印则有所不同。它存在于序列本身之中,可经受复制粘贴、文件格式转换以及跨系统分发。任何持有相应私钥的人都可以事后检测到水印,使机构能够判断某一蛋白质序列是否由特定AI模型生成。
这一能力还可以直接接入现有的生物安全基础设施。国际基因合成联盟(IGSC)已建立针对已知危险序列数据库筛查DNA合成订单的框架。由于此类筛查依赖于将订单与危害目录进行比对,真正全新的AI生成序列可能与参考数据库中的任何内容都不相似——留下一个文档缺口,而序列内嵌的溯源信息或可填补这一空白。带水印的蛋白质序列可以通过这些相同渠道进行追踪,为筛查流程增加一层针对AI的溯源信息。
当前进展
目前尚无名为“SynthID Bio”的商业产品可供购买或部署;这项研究完全处于概念验证阶段。谷歌DeepMind底层的SynthID技术是真实存在的,并已积极部署于AI生成的文本、图像、音频和视频水印。蛋白质应用是这些原理的延伸,但迄今仅在研究环境中得到演示,尚未实现产品化。该方法能否迁移至其他蛋白质设计模型,以及能否在实际合成筛查工作流程中得到应用,仍是该领域悬而未决的问题。
该研究还凸显了统计水印相较其他方法的结构性优势。由于水印嵌入在生成过程本身而非事后附加,它创造了一种与AI模型内在绑定的溯源形式。使用这种方法无法在事后为蛋白质序列添加水印——它必须在生成时进行,这意味着它天然追踪的是来源起点,而非某些下游处理环节。