OpenAI的GPT-Live语音模式新增文件附件、项目及跨功能集成
要点速览
- •GPT-Live采用全双工语音架构,支持同时听和说,能够处理句中打断和重叠对话等自然对话行为。
- •旗舰模型GPT-Live-1面向付费订阅用户,提供完整功能;免费用户可使用GPT-Live-1 mini,处理能力有所降低。
- •GPT-Live可将计算密集型任务路由至GPT-5.5等更强大的模型,同时保持实时语音层的即时响应。
- •语音会话现支持文件附件、图像处理、记忆功能、网络搜索,以及横跨Work、Codex和桌面环境的项目功能集成。
- •ChatGPT Library目前暂不支持在语音会话中直接搜索或添加文件,这是更新系统中尚存的一项限制。

OpenAI于2026年7月8日推出GPT-Live,将其确立为ChatGPT全新的默认语音模型系列。此次更新将文件附件、项目集成、记忆和搜索功能引入了此前长期处于隔离状态的产品模块。
用户现在可以在与ChatGPT进行语音对话的同时共享文档,无需切换至文本模式即可完成基于内容的任务。这一改变解决了AI助手中长期存在的痛点——语音交互通常被视为一个独立的界面,而非能够访问文本工作流中相同工具和上下文的集成层。
全双工语音架构
GPT-Live是一系列全双工语音模型,意味着系统可以同时听和说,而非交替轮换。这使得句中打断和重叠对话等自然对话行为成为可能,而传统的基于轮换的语音助手在处理这些场景时往往需要中断或重新生成回复。旗舰模型GPT-Live-1面向付费订阅用户,提供完整功能集。轻量版本GPT-Live-1 mini则面向免费用户,拥有相同的对话架构,但能力上限有所降低。
GPT-Live可以将计算密集型任务委托给包括GPT-5.5在内的更强大模型,同时保持语音层的即时响应。这种路由架构反映了行业内更广泛的趋势:轻量、低延迟的界面负责编排由后端重型模型执行的工作,这种设计平衡了实时响应能力与深度推理能力。
文件附件与项目集成
最具实际意义的新增功能是在实时语音会话中支持文件附件。用户可以在对话过程中直接附加文件,让ChatGPT实时处理该内容。此次更新还在语音会话中引入了图像处理、记忆功能和网络搜索。
GPT-Live现已接入ChatGPT的项目(Projects)功能,用户可以通过存储的文件、偏好设置和自定义指令,在多次会话间维持持久的上下文。该集成覆盖Work、Codex和桌面环境。对于在对话、编程和文档等多个场景中依赖ChatGPT的用户而言,项目集成实际上将语音从独立的交互模式转变为一个共享入口,可以像其他界面一样调用同一知识库。
目前仍有一个限制:与项目分开存储文档的ChatGPT Library,暂不支持在语音会话中直接搜索或添加文件。
从Advanced Voice Mode的演进
GPT-Live是对OpenAI此前所称的Advanced Voice Mode的渐进式成熟,而非彻底的重新发明。Advanced Voice Mode为ChatGPT的语音带来了更自然的韵律和情感范围,但仍基于轮换式系统运行。GPT-Live在此基础上增加了结构性连接,将语音与更广泛的产品生态系统关联起来,包括搜索、记忆、文件上传和项目集成。这一趋势反映了对话式AI提供商正在推动的更广泛方向——将语音、文本和多模态输入统一到单一的会话模型之下,而非维持功能割裂的并行能力。