ニュースマクロ研究者がAIエージェントが独立して科学研究を行えるかテスト—期待に応えられず

研究者がAIエージェントが独立して科学研究を行えるかテスト—期待に応えられず

著者: Decrypt·

重要ポイント

  • プリンストン大学、スタンフォード大学、英国AIセキュリティ研究所などの研究者らは、未発表のNeurIPS 2026論文2本の研究問いを用いて、最先端AIエージェントが独立して独創的なAI研究を行えるかを評価した。
  • 各AIエージェントには6日間、数千ドルのAPIクレジット、GPUリソース、インターネットアクセス、仮想マシンが与えられたが、生成された両論文とも原著者によって却下された。
  • エージェントは文献レビュー、ソフトウェアのデバッグ、実験の実行、完全な論文の作成を含むエンジニアリングタスクを人間の介入なしで正常に完了した。
  • 審査者らはシステムが独創的な科学的貢献を生み出せなかったと結論付け、研究では出版可能な研究を妨げた5つの繰り返し現れる失敗パターンが特定された。
  • 著者らは研究が2つのプロジェクトのみを対象としたことを注意喚起し、サンプルサイズの小ささや原著者がAI生成論文の評価に関与したことなどの限界を認めた。
研究者がAIエージェントが独立して科学研究を行えるかテスト—期待に応えられず

新しい研究により、現在の最先端AIエージェントはAI研究に必要なエンジニアリングタスクの多くを完了できるものの、トップクラスの機械学習カンファレンスで受理される水準の独創的な研究を生み出せなかったことが判明した。

水曜日に発表されたこの研究(タイトル「Can AI agents conduct open-ended AI research?」)において、プリンストン大学、英国AIセキュリティ研究所、スタンフォード大学、トロント大学、および他の複数の学術・研究機関の研究者らは、最先端AIエージェントが独立して独創的なAI研究を行えるかを評価した。この問いは、AI研究所が自社のシステムを科学的発見を加速させるツールとしてますます位置づける中、また各分野の研究者がAIアシスタントを研究プロセスに組み込み始める中で、より緊急性を増している。

「この問いに厳密に答えるには、エージェントが訓練データから暗記したりオンラインで見つけたりできない、汚染されていない真の研究問いが必要である」と研究者らは記している。「これらの要件を満たすため、我々は実験を実施した時点では公開されていなかった高品質なAI研究に依存している。」

研究者らはAIエージェントに、未発表のNeurIPS 2026論文2本の中心的な研究問いを提供し、システムが訓練データやウェブから回答を取得できないようにした。各エージェントには、カンファレンス水準の論文を作成するために6日間、数千ドルのAPIクレジット、GPUリソース、インターネットアクセス、仮想マシンへのアクセスが与えられた。その後、未発表研究の原著者が生成された論文を審査した。両論文とも却下された。

研究では、AIシステムが出版可能な研究を生み出すことを妨げた5つの繰り返し現れる失敗パターンが特定された。エージェントは、文献レビューの実施、ソフトウェアのデバッグ、実験の実行、GPUリソースの管理、人間の介入なしでの完全な学術論文の作成など、研究に関わるエンジニアリングの大部分を正常に完了した。しかし、審査者らはシステムが出版に値する独創的な科学的貢献を生み出せなかったと結論付けた。研究の機械的枠組みの自動化と真に斬新な科学的洞察の創出との間のこの違いは、現在のAI能力がどこまで及ぶかに関する継続的な議論の核心である。

著者らは、この評価が事前定義されたタスクではなくオープンエンドの研究問題をテストするため、以前のベンチマークよりも科学的推論をより適切に測定できると指摘した。既存のAIベンチマークの多くは、既知の答えがある明確に定義されたタスクでのパフォーマンスを評価しており、システムが非構造化環境において実際以上に能力が高いように見える場合がある。著者らは、研究が2つの研究プロジェクトのみを対象としたことを注意喚起し、サンプルサイズの小ささや元の研究者がAI生成論文を評価したことなど、限界を認めた。結果は、現在の最先端AIエージェントは研究に関わる多くのエンジニアリングタスクを自動化できるものの、独創的な科学研究の生成には依然として苦戦していることを示唆している。

これらの知見は、研究者らがますます自律化するAIエージェントにおいて驚くべき、時に危険な行動を発見し続ける中で報告された。5月には、UCリバーサイド、Microsoft、Nvidiaの研究者らが、AIエージェントが目標達成に集中する中で頻繁に危険または非合理的なタスクを実行することを発見した。7月上旬には、OpenAIが自社の最先端AIエージェントの1つがサイバーセキュリティベンチマークで不正を行おうとして隔離環境から脱出しHugging Faceをハッキングしたことを明らかにした。今週、同社はそのエージェントがさらに4つのオンラインサービスにもアクセスしていたことを公表した