Google DeepMind、AI生成タンパク質にウォーターマークを埋め込む「SynthID Bio」を発表
重要ポイント
- •SynthID Bioは、AI生成タンパク質のアミノ酸配列と予測3D構造に知覚できないウォーターマークを埋め込み、その署名は生物学的機能を損なうことなく、合成された物理的なタンパク質でも検証可能である。
- •VEGF-A、SARS-CoV-2スパイクタンパク質RBD、PD-L1を対象とした湿式実験室試験では、ウォーターマーク付きタンパク質結合剤がウォーターマークなしのバージョンと同等のヒット率、結合親和性、配列多様性を示し、初めて生物学的に機能するウォーターマーク付き結合剤が作製された。
- •タンパク質フォールディングについては、ウォーターマーク機能がAlphaFold 3のモデル重みに直接組み込まれており、予測精度を維持しながらほぼ完全な検出性とデジタルノイズや軽微な座標変化への耐性を提供する。
- •本システムは、DNA合成プロバイダーに注文が信頼できるモデルに由来することを示す自動シグナルを提供することでバイオセキュリティを強化するよう設計されており、Protein Data Bank、UniProt、GenBankなどのデータベースける合成エントリーの適切なラベル付けやフラグ設定にも役立つ。
- •スタンフォード大学のHie研究室およびArc Instituteとの共同研究で、DeepMindはSynthID BioをEvo 2ゲノムモデルに統合して設計されたバクテリオファージのゲノムにウォーターマークを施し、細菌培養での初期の実験室試験により、ウォーターマーク付きファージが機能することが確認された。

Google DeepMindは、合成生物学にウォーターマーク技術をもたらす概念実証の取り組み「SynthID Bio」を発表した。9月30日に公開されたブログ記事によると、このシステムはAIが生成したタンパク質の生物学的コードに知覚できない署名を直接埋め込み、デジタルモデル上だけでなく合成された物理的なタンパク質自体でもウォーターマークを検証可能にするものであり、実験室での試験において生物学的機能を維持する。
この研究はPushmeet Kohli、David Stutz、Ali Cowen-Rivers、Jeremy Ratcliffによるもので、AlphaFoldによるタンパク質構造の予測、AlphaProteoやProteinMPNNによる全く新しいタンパク質の設計、そして近年では細菌に感染するウイルスであるバクテリオファージの新規開発など、生成AIが科学者を支援して重要な生物学の課題に対処する動きが広がる中で登場した。しかし、これらのツールは新たな課題ももたらしている。新規のAI設計は従来のDNA合成スクリをすり抜ける可能性があり、誤ってラベル付けされた合成3D構造は公共データベースを汚染し、その後の研究を誤導するリスクがある。
SynthID Bioの仕組み
SynthID Bioは、バイオセキュリティと科学的完全性を強化するため、合成生物学向けに特化して開発されたウォーターマーク手法のファミリーである。このアプローチは対象となるデータの種類に適応する。配列についてはアミノ酸の選択を微妙に誘導し、予測された3D構造については原子座標を調整する。いずれの場合も、これらの変更が検出のための信頼性の高いシグナルを生み出す。
実験では、これらの調整によってタンパク質の生物学的機能が損なわれることはなかった。同社はこの特性を、疾患の効果的な治療と科学研究の推進に不可欠なものだと説明している。
研究チームは、タンパク質結合剤——他のタンパク質に選択的に結合する分子——へのウォーターマーク手法を検証した。これは、同社の結合剤設計手法AlphaProteoと、広く使われているタンパク質配列生成手法ProteinMPNNのSynthID Bio対応版を組み合わせることで実現した。3つの標的タンパク質——VEGF-A、SARS-CoV-2スパイクタンパク質RBD、PD-L1——を対象とした湿式実験室試験において、ウォーターマーク付き設計はウォーターマークなしのバージョンと同等のヒット率、結合親和性、天然配列多様性を示し、史上初のウォーターマーク付きで生物学的に機能するタンパク質結合剤の作製に成功した。結合親和性はKDとして測定され、値が低いほど強い結合を示す。
タンパク質フォールディングについては、SynthID BioはAlphaFold 3の拡散ネットワークの一部をファインチューニングし、ウォーターマーク機能をモデルの重みに直接組み込む。これにより、モデルを実行するのが誰であっても、予測された3D座標が本質的に検出可能な署名を帯びることが保証される。同社によると、この手法はAlphaFold 3の予測精度を維持しながら、ほぼ完全な検出性を提供し、主要な構造的特徴の分布を保ち、デジタルノイズや軽微な座標の変化にも耐えるという。チームはタンパク質7PPAを用いて結果を示し、AlphaFold 3による予測構造を正解構造およびウォーターマーク付き構造と並べて提示した。
バイオセキュリティと情報の完全性の強化
バイオセキュリティは多層防御に依存している。これは「スイスチーズ」防御モデルのようなもので、複数の独立した安全対策が連携して互いの盲点を補う。モデルレベルの緩和策や顧客審査などの保護措置は、それぞれ潜在的な穴を持つ重要な層を表している。Google DeepMindのバイオレジリエンスに対するより広範なビジョンの一環として、SynthID Bioのウォーターマーク手法は、生物学的設計そのものに埋め込まれた重要かつ具体的な検証層としてする。
「SynthID Bioは、生物学的設計の来歴を追跡するための重要なピースです」と、この研究をレビューしたバイオセキュリティ政策の専門家でScience Policy ConsultingのプリンシパルであるSarah Carter氏は述べた。「設計をモデル開発者と紐付けることで、これらのウォーターマークは開発者が安全性を主導することを可能にし、合成プロバイダーがこれらのモデルを利用した顧客向けのスクリーニングを効率化することを可能にします」
この層は、バイオセキュリティの最前線に位置するDNA合成スクリーニングにとって特に重要である。デジタルのタンパク質設計を物理的な分子に変換するには、DNA合成プロバイダーに発注する必要があり、プロバイダーは既知の脅威のデータベースと照合してリクエストをスクリーニングする。歴史的には、見慣れない配列は未発見の天然生物であると安全に想定できた。しかし、AIは既知の脅威とほとんど類似しない全く新しい配列を作成できるため、スクリーナーはもはやその想定ができない。見慣れない注文が工学的に設計された脅威ではないことを確認するには、徹底的な手動レビューが必要となり、重要な研究の停滞を招きかねない。ここでSynthID Bioは自動的な検証シグナルを提供し、注文が内蔵の安全策を備えた信頼できるモデルに由来することを証明できる。
「AIは科学者が設計できる範囲を広げており、DNA合成企業にはそのイノベーションが責任を持って拡大するのを支援する重要な役割があります」と、この論文に早期のフィードバックを提供したTwist Bioscienceの政策・バイオセキュリティ担当バイスプレジデントであるJames Diggans氏は述べた。「Twistにとって、ウォーターマークはスクリーニングを強化し、より綿密なレビューを要する配列にリソースを集中させ、AI設計生物学が進展し続ける中でバイオセキュリティをより効率的にする可能性を秘めた、バイオセキュリティツールボックスへの有望な新機能です」
同様に、SynthID BioはProtein Data Bank、UniProt、GenBankなどのデータベースの完全性維持にも役立つ可能性がある。これらのデータベースの多くは一般からの投稿を受け付けており、科学の進歩に不可欠な役割を果たしているが、誤ってラベル付けされたエントリーはバイオセキュリティ上の意思決定に不釣り合いなほど大きな悪影響を及ぼすがあり、この課題はAI生成の生物学データの追加によってさらに拡大する可能性がある。投稿プロセスの一環として、SynthID Bioは合成エントリーが適切にラベル付けされるか、さらなるレビューのためにフラグが立てられることを支援できる。
今後の展望
単一のバイオセキュリティ対策が万能薬であることはないが、SynthID Bioは実績あるGoogle DeepMindのウォーターマークツール「SynthID」を合成生物学にもたらし、AI生成の生物学配列・構造を確実に識別・追跡するための重要な第一歩となる。
今後の主な課題には、意図的な改ざんに対するウォーターマークの頑健性を高めることが含まれる。また、SynthID Bioは、デジタルメディアにおけるC2PAに類似した来歴メタデータのアプローチや、AI生成生物学データの一元リポジトリと組み合わせることで、AI生成タンパク質のより良い識別と追跡を可能にできる。
フロンティアAI技術の高まる能力に対応するため、Google DeepMindはより複雑な生物学的対象へのウォーターマーク適用も研究している。スタンフォード大学のHie研究室およびArc Instituteとの進行中の研究では、SynthID Bioを先進的なゲノムモデル「Evo 2」に統合し、Evo 2が設計したバクテリオファージのゲノムにウォーターマークを施した。細菌培養での初期の実験室試験により、これらのウォーターマーク付きバクテリオファージが機能することが確認された。Google DeepMindは、この研究にはゲノム設計に関連する一部のバイオセキュリティリスクに対処する可能性があり、詳細は近日中に技術論文で共有されるとしている。
この研究のバイオセキュリティ上の便益を最大化するには、コミュニティとの協力とさらなる研究が必要である。責任あるイノベーションへのコミットメントの一環として、同社は手法論文を公開し、コードとin vitroデータをオープンソース化し、モデル重みを研究コミュニティにリリースする。Google DeepMindは、バイオセキュリティ、遺伝子合成、政策の分野のパートナーとオープンに協力し、安全性と責任がAI駆動の発見の歩みに追いつくことを目指すとしている。このテーマでの提携に関心のある方は、概要レベルの提案を添えてsynthidbio@google.comまで連絡するよう求められている。機密情報や専有情報を開示しないようにとのことである。
##謝辞
本プロジェクトはPushmeet Kohliによって開始された。研究と技術開発はAlexander I. Cowen-RiversとDavid Stutzが主導し、Kohliがアドバイザーを務めた。Guillermo Ortiz-Jimenez、Jeremy Ratcliff、Vinicius Zambaldi、Lindsay Willmore、Josh Abramson、Harshnira Patani、Christina Kouridi、Florian Stimberg、Mel Vecerik、Alex Chu、Sukhdeep Singh、Sumanth Dathathri、Eliseo Papa、Valentin De Bortoli、Arnaud Doucet、Jue Wang、Sven Gowalが主要なエンジニアリングおよび研究面の貢献を行った。チームはin vitro検証への協力としてAdaptyv Bioに謝意を表明した。
バクテリオファージのDNAへのウォーターマーク適用への拡張は、Google DeepMindとスタンフォードのHie研究室およびArc Instituteとの共同研究であり、Google DeepMindからはJeremy Ratcliff、Aleks Petrov、Alexander I. Cowen-Rivers、David Stutz、Elisa L. H. Wong、Victor Martin Palacios、Francesca Pietra、Alfred Piccioni、Tristan Oliver Kwan、Tor Lattimore、Sumanth Dathathri、Pushmeet Kohliが、Arc InstituteおよびスタンフォードからはBrian Hie、Samuel King、Aditi Merchantが主要な貢献を行った。
さらに、研究論文への貢献としてRudy Bunel、Anna Cupani、Rob Fergus、Thomas Frerix、Sahra Ghalebikesabi、John Jumper、Jacob Kelly、David La、Victor Martin、Sebastian Nowozin、Stig Petersen、Aleks Petrov、Uchechi Okereke、Sylvestre-Alvise Rebuffi、Rosalia Schneider、Armin Senoner、Richard Shuai、Ashok Thillaisundaram、Elisa L. H. Wong、Zachary Wu、Augustin Žídekに、3Dレンダリングへの貢献としてJulien Bergeronに感謝すると述べている。最後に、チームは本プロジェクトへの励ましと支援についてDemis Hassabisに謝意を表した。