ニュースマクロOpenAI、デスクトップアプリにChatGPT Voiceを追加し音声操作によるAIエージェントのワークフローに対応

OpenAI、デスクトップアプリにChatGPT Voiceを追加し音声操作によるAIエージェントのワークフローに対応

著者: bitcoinworld·

重要ポイント

  • OpenAIのデスクトップ向けChatGPT Voiceにより、ユーザーはChatGPT WorkとCodexの環境で音声コマンドを使ってAIエージェントを操作し、複数ステップのコンピュータータスクを実行できる。
  • この機能は、発表と同じ月の初めに投入されたOpenAIのGPT-Live音声モデル群を基盤としている。
  • macOSでは、この機能がAppshotsと連携して代替テキストを含む画面上のコンテンツにアクセスし、ChatGPTがより文脈を踏まえた支援を提供できる。
  • デスクトップ版は、会話型の音声インタラクションだけでなく直接的なタスク実行をサポートする点で、従来のモバイル版とは異なる。
  • AnthropicもClaudeの音声モードを生産性アプリ全般に拡張しており、音声操作型AIエージェントが大手AI提供企業間の競争領域になりつつあることを示している。
OpenAI、デスクトップアプリにChatGPT Voiceを追加し音声操作によるAIエージェントのワークフローに対応

OpenAIはChatGPTデスクトップアプリに音声機能を追加し、ユーザーが音声コマンドでAIエージェントを操作し、複雑なコンピューター上のタスクを実行できるようにした。この機能は木曜日に発表され、OpenAIが今月初めに投入したGPT-Live音声モデル群を使用している。今回のリリースは、AI研究所がテキストベースのチャットボットを超え、ユーザーに代わってソフトウェア環境内で操作を実行できるエージェント型システムへと移行を競う中で行われた。

音声操作がデスクトップのワークフローに拡大

ChatGPT Voiceは現在、ChatGPT WorkとCodexの両方の環境で動作する。このアップデートにより、ユーザーはAIエージェントが自律的に実行できる複数ステップの指示を音声で入力でき、音声による会話型インタラクションを超えて、デスクトップ上でのタスク実行へと機能が広がる。

デモ動画でOpenAIは、開発者が1つの音声コマンドを使って新しいスレッドを作成し、プルリクエストを作成し、バグの根本原因を特定する様子を示した。このシステムは、ユーザーが求めるワークフローの一部として、コンピューター操作スキルを使ってウェブサイトやアプリケーションを操作することもできる。AIモデルが人間のユーザーと同様にグラフィカルインターフェースを操作できるコンピューター操作機能は、複数のAI研究所が注力してきた分野であり、音声統合によって、詳細なプロンプトを入力しなくてもこれらのエージェントを利用できるようになる。

macOSでは、この機能はAppshotsと連携し、アプリが代替テキストを含む画面上のコンテンツにアクセスできるため、ChatGPTは追加の視覚情報や文脈情報を使って支援を提供できる。デスクトップ版は、会話の流れや割り込み処理を改善したものの、アシスタントがデバイス上で直接操作を実行することはできなかった従来のChatGPT Voiceスマートフォン版よりも広範な実装となっている。

モバイル音声ツールと比較したデスクトップ機能

ChatGPT Voiceのスマートフォン版は、主にコマンド実行ではなく自然な会話を目的として設計されていた。これに対し、デスクトップ版では、ユーザーが複数の手順を含む複雑な指示を音声で伝え、ChatGPTがタスクを続行するために追加情報を必要とする場合には音声で応答できる。この違いは重要だ。デスクトップ環境は通常、モバイル端末よりも複雑で複数アプリにまたがるワークフローを伴うため、音声駆動のエージェント操作は業務利用でより大きな影響を持つ可能性がある。

OpenAIはまた、ユーザーがリモートアクセスを通じてiOSアプリからCodex内のChatGPT Voiceにアクセスできるとも述べた。デスクトップ向けChatGPT VoiceはOpenAIのGPT-Live音声モデルを基盤としており、デスクトップアプリ内のChatGPT WorkおよびCodexで動作する。

AnthropicもClaude向けの音声モードを更新している。同社の音声機能は、Opus、Sonnet、Haikuモデルを使い、Gmail、Calendar、Slack、Notion、Canvaなどの生産性アプリケーションでタスクを完了できる。OpenAIとAnthropicはいずれも、AI支援業務のインターフェースとして音声ツールを拡大しており、音声操作型エージェントがニッチな機能ではなく、大手AI提供企業間の競争領域になりつつあることを示している。

生産性ツールへの影響

音声操作型AIエージェントは、AIとのやり取りをテキストのみのプロンプトから、ハンズフリーの会話型コンピューティングへとさらに進める。開発者や知識労働者にとって、この機能は複数の手順を必要とするワークフローの摩擦を減らし、キーボードで作業を続けながら、またはコンピューターから離れている間でもコマンドを出せるようにする可能性がある。

1つの音声指示で複数のエージェントを調整できる能力は、プロジェクト管理やデバッグのワークフローにも応用できる可能性がある。OpenAIがChatGPT Voiceをデスクトップアプリに導入したことは、同社が音声をカジュアルなモバイル会話に限定するのではなく、プロフェッショナルおよび企業ユーザー向けの中核的な操作方法として位置付けていることを示している。

デスクトップ版は、複雑な複数ステップのコマンドを実行し、ウェブサイトを操作し、複数のAIエージェントを調整し、必要に応じてユーザーに追加入力を求めることができる。macOSでは、Appshotsの対応により、ChatGPTが画面上のコンテンツにアクセスし、より文脈を踏まえた支援を提供できる。ユーザーはリモートアクセスを通じて、iOSアプリからCodexの音声機能を使うこともできる。

OpenAIのデスクトップ向けChatGPT Voiceは世界的に展開されている。2026年7月時点で、このリリースは、複雑な業務ワークフローにおける実用的なツールとして音声を活用する方向へのより大きな一歩であり、OpenAIのデスクトップ音声機能をAnthropicのClaude向け音声モードと競合する位置に置くものとなっている。