新聞宏觀經濟Google DeepMind 的 SynthID 技術獲馬里蘭大學改用於 AI 設計蛋白質浮水印之概念驗證

Google DeepMind 的 SynthID 技術獲馬里蘭大學改用於 AI 設計蛋白質浮水印之概念驗證

作者: CryptoBriefing·

重點速覽

  • •馬里蘭大學研究人員改編 Google DeepMind 的 SynthID 技術,將基於私鑰的隱形浮水印嵌入包括 ProteinMPNN 在內的 AI 設計模型所生成的蛋白質序列中。
  • •驗證測試顯示浮水印處理後 pLDDT 折疊品質分數維持不變,代表標記過的蛋白質結構依然穩固。
  • •有別於基於詮釋資料的來源追溯方法,此統計浮水印嵌入於序列本身,可承受複製貼上、檔案格式轉換以及跨系統傳布。
  • •此技術可與國際基因合成聯盟(IGSC)既有的生物安全篩檢相輔相成,因為其已知危害資料庫可能無法比對出真正新穎的 AI 生成序列。
  • •此研究僅為概念驗證——目前尚無商業化產品,且該方法能否應用於其他蛋白質設計模型與實際篩檢工作流程仍是未知數。
Google DeepMind 的 SynthID 技術獲馬里蘭大學改用於 AI 設計蛋白質浮水印之概念驗證

Google DeepMind 的 SynthID 浮水印技術最初是為了識別 AI 生成的文字、圖像、音訊和影片而開發,如今已延伸至一個新領域:生物學。馬里蘭大學的研究人員改編了該系統,將隱形浮水印直接嵌入 AI 設計的蛋白質序列中,為合成生物學建立一種潛在的追蹤機制,且不損及蛋白質本身。

在胺基酸層級進行浮水印

該方法建立在 SynthID-Text 的基礎上,其運作方式是在生成過程中微調權元(token)的機率分佈——在此案例中是胺基酸而非文字。研究人員採用所謂的無偏 Gumbel 取樣方法,將由私鑰衍生的浮水印嵌入蛋白質設計模型(包括 ProteinMPNN)的胺基酸機率分佈中。

ProteinMPNN 於 2022 年發布,是設計全新蛋白質序列的知名 AI 模型之一。它接受所需的三維蛋白質結構,並反向運算以產生預期能折疊成該形狀的胺基酸序列。這個領域已快速進入主流:2024 年諾貝爾化學獎表彰了計算蛋白質設計(得主 David Baker),以及 AI 驅動的蛋白質結構預測(由 Google DeepMind 的 Demis Hassabis 與 John Jumper 以 AlphaFold2 共同獲得)。浮水印層疊加在此工作流程之上,影響哪些特定胺基酸被選中,但不改變輸出的整體統計特性。

驗證測試顯示,pLDDT 分數——衡量預測蛋白質折疊品質的標準指標——在浮水印處理後維持不變。就結構而言,帶有浮水印的蛋白質與未處理者同樣穩固。

生物安全層面的意義

隨著 AI 蛋白質設計工具日益強大且易於取得,生成全新生物序列的能力引發了正當的安全疑慮。傳統的來源追溯方法,例如附於檔詮釋資料日誌,可以像從照片中移除 EXIF 資料一樣輕易被抹除,無法提供持久的監管鏈。

嵌入式統計浮水印的運作方式不同。它存在於序列本身之中,可承受複製貼上、檔案格式轉換以及跨系統的傳布。任何持有對應私鑰的人皆可於日後偵測出該浮水印,使組織得以判斷某個蛋白質序列是否由特定 AI 模型所生成。

此功能還可直接銜接既有的生物安全基礎設施。國際基因合成聯盟(IGSC)已建立框架,依據已知危險序列資料庫篩檢 DNA 合成訂單。由於該篩檢依賴將訂單與已知危害目錄進行比對,真正新穎的 AI 生成序列可能與這些參考資料庫中的任何項目都不相似——留下序列嵌入式來源追溯或有助填補的文件記錄缺口。帶有浮水印的蛋白質序列可透過這些相同管道被追蹤,為篩檢流程增加一層針對 AI 的來源追溯。

目前的進展

目前並沒有名為「SynthID Bio」的商業化產品可供購買或部署;此研究完全處於概念驗證階段。Google DeepMind 的底層 SynthID 技術是真實存在且已積極部署,用於為 AI 生成的文字、圖像、音訊和影片加上浮水印。蛋白質應用是這些原則的延伸,但迄今僅在研究環境中獲得驗證,尚未產品化。該方法能否移植到其他蛋白質設計模型,以及能否在實際的合成篩檢工作流程中被採用,仍是該領域有待解答的問題。

這項研究也凸顯了統計浮水印相較於其他方法的結構性優勢。由於浮水印嵌入於生成過程本身,而非事後附加,它所創造的來源追溯形式與 AI 模型本質上緊密相連。使用此方法無法在事後為蛋白質序列加上浮水印——必須在生成時進行,這意味著它自然地追蹤源頭,而非某些下游處理步驟。