ニュースマクロGoogle DeepMindのSynthIDを応用、メリーランド大学の概念実証でAI設計タンパク質への電子透かし埋め込みを検証

Google DeepMindのSynthIDを応用、メリーランド大学の概念実証でAI設計タンパク質への電子透かし埋め込みを検証

著者: CryptoBriefing·

重要ポイント

  • •メリーランド大学の研究チームは、Google DeepMindのSynthID技術を応用し、ProteinMPNNを含むAIタンパク質設計モデルが生成した配列に、秘密鍵に基づく不可視の透かしを埋め込んだ。
  • •検証試験では、透かしを埋め込んでもpLDDT折りたたみ品質スコアは変化せず、タンパク質の構造的健全性が保たれることが示された。
  • •メタデータに基づく来歴管理手法とは異なり、この統計的透かしは配列自体に埋め込まれ、コピー&ペースト、ファイル形式の変換、システム間での配布を経ても保持される。
  • •この技術は、国際遺伝子合成コンソーシアム(IGSC)による既存のバイオセキュリティー審査を補完する可能性がある。同組織の既知の危険物データベースは、真に新規のAI生成配列と一致しない場合がある。
  • •本研究はあくまで概念実証であり、商用製品は存在しない。手法が他のタンパク質設計モデルや実際の合成審査ワークフローに転用可能かは未解決のままである。
Google DeepMindのSynthIDを応用、メリーランド大学の概念実証でAI設計タンパク質への電子透かし埋め込みを検証

AI生成のテキスト、画像、音声、動画を識別するために開発されたGoogle DeepMindの電子透かし技術「SynthID」が、新たな領域である生物学へと拡張された。メリーランド大学の研究チームは、この技術を応用し、AI設計によるタンパク質配列に不可視の透かしを直接埋め込むことに成功した。これにより、タンパク質そのものに影響を与えずに合成生物学の追跡手段を確立する可能性が示された。

アミノ酸レベルでの電子透かし

この手法は、生成過程でトークン(この場合は単語ではなくアミノ酸)の確率分布を微妙に調整することで機能するSynthID-Textを基盤としている。研究者らは非偏Gumbelサンプリングと呼ばれる手法を用い、秘密鍵から導出された透かしを、ProteinMPNNを含むタンパク質設計モデルのアミノ酸確率分布に埋め込んだ。

2022年に発表されたProteinMPNNは、新規タンパク質配列を設計するための代表的なAIモデルの一つである。所望の三次元タンパク質構造を入力として受け、その形状に折りたたまれることが期待されるアミノ酸配列を逆向きに生成する。この分野は急速に主流となっており、2024年のノーベル化学賞は、計算によるタンパク質設計を担うデイビッド・ベイカー氏、ならびにAlphaFold2によるAI駆動のタンパク質構造予測を手がけたGoogle DeepMindのデミス・ハサビス氏とジョン・ジャンパー氏に授された。このワークフローの上に透かし層が組み込まれ、出力全体の統計的性質を変えることなく、どのアミノ酸が選択されるかに影響を与える。

検証試験では、予測タンパク質折りたたみ品質の標準的な指標であるpLDDTスコアは、透かしの埋め込み後も変化しなかったことが示された。構造面では、透かしがあってもなくてもタンパク質は同等の安定性を保っていた。

バイオセキュリティー上の意義

AIによるタンパク質設計ツールが強力かつ利用しやすくなるにつれ、新規の生物配列を生成できることへの正当な安全性の懸念が高まっている。ファイルに添付されたメタデータログのような従来の来歴管理手法は、写真からEXIFデータを削除するのと同じように容易に剥奪でき、耐久性のある管理連鎖を提供できない。

埋め込み型の統計的透かしはこれとは異なる動作をする。透かしは配列自体の中に存在するため、コピー&ペースト、ファイル形式の変換、システム間での配布を経ても保持される。対応する秘密鍵にアクセスできる者は後から透かしを検出でき、組織は特定のタンパク質配列が特定のAIモデルによって生成されたものかを判定できる。

この能力は、既存のバイオセキュリティーインフラにもそのまま組み込める。国際遺伝子合成コンソーシアム(IGSC)は既に、DNA合成注文を既知の危険な配列のデータベースと照合して審査する枠組みを運用している。この審査は既知の危険物カタログとの照合に依存しているため、真に新規のAI生成配列は参照データベース内のどの配列とも類似しない可能性があり、配列に埋め込まれた来歴情報が埋めることができる文書化の空白が生じる。透かし入りのタンパク質配列はこれらの既存の経路を通じて追跡でき、審査プロセスにAI固有の来歴の層を追加できる。

現在の状況

「SynthID Bio」という商用製品は現時点で購入も展開もできず、本研究は純粋に概念実証の段階にある。Google DeepMindによる基盤となるSynthID技術は実在し、AI生成のテキスト、画像、音声、動画への透かし付けとして実際に展開されている。タンパク質への応用はこれらの原則の拡張だが、これまで研究環境での実証にとどまっており、製品化はされていない。この手法が他のタンパク質設計モデルに転用可能か、実際の合成審査ワークフローで採用されるかは、この分野における未解決の問いである。

また、本研究は統計的透かしが代替手法に対して持つ構造的利をも浮き彫りにした。透かしは後から付加されるのではなく生成プロセス自体に埋め込まれるため、AIモデルに本質的に結び付いた来歴情報が生まれる。この手法では、タンパク質配列へ後から透かしを施すことはできない。生成時に実行する必要があり、それゆえ下流の処理段階ではなく、起点を自然に追跡することになる。