新聞宏觀經濟OpenAI 的 GPT-Live 語音模式新增檔案附件、專案與跨功能整合

OpenAI 的 GPT-Live 語音模式新增檔案附件、專案與跨功能整合

作者: CryptoBriefing·

重點速覽

  • GPT-Live 採用全雙工語音架構,能夠同時聆聽與說話,支援句中打斷與重疊對話等自然對話行為。
  • 旗艦模型 GPT-Live-1 提供給付費訂閱者並具備完整功能,而免費層級使用者則可使用 GPT-Live-1 mini,但運算上限有所降低。
  • GPT-Live 可將運算需求較高的任務路由至 GPT-5.5 等更強大的模型,同時維持即時的語音回應層。
  • 語音通話現已支援檔案附件、圖片處理、記憶功能、網頁搜尋,以及跨越 Work、Codex 與桌面環境的 Projects 功能整合。
  • ChatGPT Library 目前不支援在語音通話中直接搜尋或新增檔案,是此次更新系統中尚存的限制。
OpenAI 的 GPT-Live 語音模式新增檔案附件、專案與跨功能整合

OpenAI 於 2026 年 7 月 8 日推出 GPT-Live,將其確立為 ChatGPT 全新的預設語音模型系列。此次更新將檔案附件、專案整合、記憶與搜尋功能帶入先前在很大程度上處於孤立狀態的產品區域。

使用者現在可以在與 ChatGPT 進行語音對話的同時分享文件,無需切換至文字模式即可處理基於內容的任務。此一改變解決了 AI 助理長期存在的痛點——語音互動向來被視為獨立的使用介面,而非能夠存取與文字工作流程相同工具和上下文的整合層。

全雙工語音架構

GPT-Live 是一系列全雙工語音模型,意味著系統能夠同時聆聽與說話,而非交替輪流。這使得句中打斷與重疊對話等自然對話行為成為可能,而這些是傳統輪流式語音助理無法在不中斷或重新啟動回應的情況下處理的。旗艦模型為 GPT-Live-1,提供給付費訂閱者並具備完整功能集。輕量版本 GPT-Live-1 mini 則開放給免費層級使用者,共享相同的對話架構但功能上限有所降低。

GPT-Live 可將運算密集型任務委派給更強大的模型(包括 GPT-5.5),同時維持語音層的即時回應能力。此路由架構反映了業界更廣泛的趨勢——由輕量、低延遲的介面來協調由更大型後端模型執行的工作,這種設計選擇在即時回應能力與深度推理能力之間取得平衡。

檔案附件與專案整合

最具實質意義的新增功能是即時語音通話中的檔案附件支援。使用者可以在對話過程中附加檔案,並讓 ChatGPT 即時處理該內容。此次更新還在語音通話中引入了圖片處理、記憶功能與網頁搜尋。

GPT-Live 現已連接 ChatGPT 的 Projects 功能,允許使用者透過已儲存的檔案、偏好設定和自訂指令,在多次對話間維持持久的上下文。此整合涵蓋 Work、Codex 與桌面環境。對於在多種介面——對話、程式編寫與文件導向——之間依賴 ChatGPT 的使用者而言,Projects 整合有效地將語音從獨立的互動模式轉變為共享入口點,能夠像其他介面一樣從相同的知識庫中提取資訊。

但仍有一項限制:ChatGPT Library(獨立於 Projects 儲存文件的功能)目前不支援在語音通話中直接搜尋或新增檔案。

從 Advanced Voice Mode 的演進

GPT-Live 代表的是 OpenAI 先前稱為 Advanced Voice Mode 的漸進式成熟,而非根本性的重新發明。Advanced Voice Mode 為 ChatGPT 的語音帶來了更自然的韻律和情感範圍,但仍採用輪流式系統運作。GPT-Live 在此基礎上增加了結構性的連接能力,將語音與更廣泛的產品生態系統連結起來,包括搜尋、記憶、檔案上傳與 Projects 整合。這一發展軌跡反映了對話式 AI 服務提供商更廣泛的努力方向——將語音、文字與多模態輸入統一到單一的對話模型之下,而非維持功能各自孤立的平行能力。