OpenAIのGPT-Live音声モードがファイル添付、プロジェクト、クロス機能統合を追加
重要ポイント
- •GPT-Liveは全二重音声アーキテクチャを採用し、同時の聞き取りと発話を可能にすることで、文中での割り込みや重なる対話といった自然な会話行動をサポートします。
- •フラグシップモデルのGPT-Live-1は有料サブスクライバー向けに全機能で提供され、無料ユーザーには処理能力のヘッドルームが削減されたGPT-Live-1 miniが提供されます。
- •GPT-Liveは、応答性の高いリアルタイム音声レイヤーを維持しながら、計算負荷の高いタスクをGPT-5.5などのより強力なモデルにルーティングできます。
- •音声セッションは現在、ファイル添付、画像処理、メモリ機能、ウェブ検索、およびWork、Codex、デスクトップ環境にまたがるプロジェクト機能との統合をサポートしています。
- •ChatGPT Libraryは現時点で音声セッション中の直接的なファイル検索やファイル追加をサポートしておらず、これは更新されたシステムにおける残存する制限となっています。

OpenAIは2026年7月8日、GPT-LiveをChatGPTの新しいデフォルト音声モデルファミリーとして公開しました。今回のアップデートにより、ファイル添付、プロジェクト統合、メモリ、検索機能が、これまでほぼ孤立して機能していた製品の一部にもたらされました。
ユーザーはChatGPTとの音声会話を維持しながら、同時にドキュメントを共有できるようになり、コンテンツベースのタスクのためにテキストモードに切り替える必要がなくなりました。この変更は、AIアシスタントにおける長年の摩擦ポイントを解消するものです。これまで音声インタラクションは、テキストベースのワークフローで利用可能な同じツールやコンテキストにアクセスできる統合レイヤーではなく、独立したサーフェスエリアとして扱われることが一般的でした。
全二重音声アーキテクチャ
GPT-Liveは全二重音声モデルのファミリーであり、システムが交互にターンを取るのではなく、同時に聞き取りと発話を行うことができます。これにより、文中での割り込みや重なる対話といった自然な会話行動が可能になります。従来のターンベースの音声アシスタントでは、応答を切断または再起動せずにこれらを処理することはできませんでした。フラグシップモデルはGPT-Live-1で、有料サブスクライバー向けに全機能セットで提供されます。軽量版のGPT-Live-1 miniは無料ユーザー向けに提供され、同じ会話アーキテクチャを持ちますが、能力のヘッドルームが削減されています。
GPT-Liveは、応答性の高い音声レイヤーを維持しながら、計算負荷の高いタスクをGPT-5.5を含むより強力なモデルに委譲できます。このルーティングアーキテクチャは、軽量で低遅延なインターフェースがより重いバックエンドモデルによる作業を統制するという、より広範な業界のトレンドを反映しています。これは、リアルタイムの応答性と深い推論能力のバランスを取る設計選択です。
ファイル添付とプロジェクト統合
運用上最も重要な追加は、ライブ音声セッション中のファイル添付サポートです。ユーザーは会話の途中でファイルを添付し、ChatGPTにそのコンテンツをリアルタイムで処理させることができます。また今回のアップデートでは、音声セッション内での画像処理、メモリ機能、ウェブ検索も導入されました。
GPT-Liveは現在、ChatGPTのプロジェクト機能に接続されています。この機能により、ユーザーは保存されたファイル、設定、カスタム指示を通じてセッション間で永続的なコンテキストを維持できます。この統合は、Work、Codex、デスクトップ環境にまたがって適用されます。会話、コーディング、ドキュメント中心など複数のサーフェスでChatGPTを利用するユーザーにとって、プロジェクト統合は音声をスタンドアロンのインタラクションモードから、他のインターフェースと同じナレッジベースから情報を引き出せる共有エントリーポイントへと効果的に変えます。
一つの制限が残っています:プロジェクトとは別にドキュメントを保存するChatGPT Libraryは、現時点では音声セッション中の直接的なファイル検索やファイル追加をサポートしていません。
Advanced Voice Modeからの進化
GPT-Liveは、OpenAIが以前Advanced Voice Modeと呼んでいたものの根本的な再発明ではなく、段階的な成熟を表しています。Advanced Voice ModeはChatGPTの音声に自然な韻律と感情の幅をもたらしましたが、依然としてターンベースのシステムで動作していました。GPT-Liveは構造的な接続性を追加し、音声を検索、メモリ、ファイルアップロード、プロジェクト統合を含むより広範な製品エコシステムにリンクさせます。この軌跡は、切り離された機能セットを持つ並列機能を維持するのではなく、音声、テキスト、マルチモーダル入力を単一のセッションモデルの下で統一しようとする会話AIプロバイダー全体の広範な推進を反映しています。