新闻股票OpenAI 将 GPT-Live 全双工语音控制引入 Codex 和 ChatGPT 桌面应用

OpenAI 将 GPT-Live 全双工语音控制引入 Codex 和 ChatGPT 桌面应用

作者: VentureBeat AI·

要点速览

  • OpenAI 已将其 GPT-Live 全双工语音模型嵌入 ChatGPT 桌面应用,并首次与 Codex 和 ChatGPT Work 集成。
  • 开发者可以使用语音命令启动多个并发编程任务,例如错误调查、拉取请求审查和单元测试生成,而无需中断工作流。
  • 该集成将实时语音层与执行引擎解耦,使 GPT-Live 能够保持流畅对话,同时由后台模型处理繁重的计算工作负载。
  • 语音桌面功能仅面向 Plus、Pro、Business、Enterprise 和 Education 计划的付费订阅用户开放,底层系统仍完全封闭,且不可自托管。
  • 此次发布也为工程团队提出了实际问题:随着语音启动的智能体获得修改仓库和触发构建流水线的能力,代码审查标准、企业安全政策和审计追踪可能需要相应调整。
OpenAI 将 GPT-Live 全双工语音控制引入 Codex 和 ChatGPT 桌面应用

在推出具备全双工能力的 GPT-Live 音频 AI 模型两周后,OpenAI 正将这项可同时听取和回应用户的技术直接嵌入开发者工作流。

该公司宣布,GPT-Live 现在已为 macOS 和 Windows 上的 ChatGPT 桌面应用提供支持,并与 Codex 和 ChatGPT Work 等智能体系统集成;这些系统是 ChatGPT 桌面应用内提供的独立体验。

OpenAI 最初于 2026 年 7 月 8 日发布 GPT-Live,推出了一种能够同时听取和说话的连续音频模型。该设计消除了僵硬的轮流对话模式,同时将复杂推理委托给 GPT-5.5 等后台模型。最新发布将这一对话层扩展到技术任务,使软件工程师能够使用自然语音命令编排多线程编程任务、审查拉取请求并调试应用程序。

此次更新可能为免手动软件开发开启一个新时代,甚至可能为 Codex 和 ChatGPT Work 合计超过 1000 万周活跃用户带来现场面对面的多人编程会话。Codex 是 OpenAI 为其专注于编程的模型和工具体系所使用的名称,不过该公司今年已将其扩展为更广泛的生产力平台。OpenAI 一位发言人告诉 VentureBeat,这是语音激活首次被集成到这些智能体编程工具中。此举发生之际,AI 辅助编程市场已变得日益拥挤,GitHub Copilot、Anthropic 的 Claude 和 Google 的 Gemini 都在扩展自主开发能力,但尚无一家将全双工语音作为编程智能体的主要控制界面推出。

OpenAI 发布了一段宣传视频,视频中员工 Jason Liu(Codex 开发者体验工程师)和 Guinness Chen(Codex 技术人员)在同一房间内与同一个 ChatGPT 桌面应用会话对话。两人分别发出不同指令,并同时与同一个模型交互。

集成的工作方式

从核心上看,这一集成将实时语音层与底层执行引擎解耦。GPT-Live 维持流畅对话,在不打断用户的情况下插入类似“got it”的自然语音确认,同时将繁重的计算工作负载交给后台推理模型。

在 macOS 上,桌面应用整合了“Appshots”和屏幕上下文功能,使 ChatGPT Voice 能够分析最前端窗口,同时结合本地文件、代码库结构和活动插件。这一架构形成了一种结对编程动态:开发者以对话方式讨论问题,而智能体异步执行任务。

开发者无需暂停编程会话来输入详细指令或切换窗口,而是可以完全免手动地指挥系统。全双工引擎会动态决定何时说话、暂停或调用工具,即使后台智能体正在处理复杂代码修改,也能保持对话状态。

通过语音指挥编程和复杂构建

此次更新的核心能力是在 Codex 和 ChatGPT Work 环境中执行多任务。软件工程师可以通过一条语音提示启动多个并发任务线程。例如,准备发布某项功能的开发者可以指示系统同时调查一个未解决的身份验证错误、审查一个待处理的 API 迁移拉取请求,并生成缺失的单元测试。

桌面应用会在不同上下文之间协调这些操作,通过 Slack 对话、GitHub 仓库和本地代码库追踪问题。开发者还可以通过语音将设计稿转换为可运行代码,并将任务拆分到前端、后端和测试层。

借助对多文件夹项目(build 26.715)和通过 iOS 进行远程执行的支持,工程师可以检查任务进度、回答智能体提示,并重新定向正在运行的任务,而无需切换应用程序或逐行管理各个进程。

专有许可模式

OpenAI 的语音桌面版本采用专有的商业企业模式。访问权限仅限于 Plus、Pro、Business、Enterprise 和 Education 计划的付费订阅用户。

对于个人开发者和企业工程部门而言,这意味着模型权重、语音处理流水线和智能体状态架构仍完全封闭。组织无法修改或自托管底层系统。通过 ChatGPT Voice 启动的任务会直接消耗现有 Codex 和 ChatGPT Work 计划配额中的标准使用额度,语音触发的操作与标准智能体工作负载被同等处理。这种封闭方式不同于 Meta 的 Code Llama 和 DeepSeek 的 Coder 等竞争对手提供的开放权重编程模型,不过这些替代方案尚未达到 OpenAI 正在部署的语音与智能体集成能力。

社区反应

开发者社区很快注意到,将连续全双工语音引入自主编程工作流所带来的影响。针对 build 26.715 发布公告——其中详细说明了语音集成和多文件夹项目支持——AI Insider 记者 @ChrisGPT 在 X 上指出:"Today OpenAI will release voice and remote guidance for codex ! One step closer to personal AGI"。

早期技术反馈显示,开发者对免手动编排复杂智能体任务表现出广泛热情,尤其是在离开工作站或远程管理构建流水线时。此次发布也为工程团队提出了实际问题:随着语音启动的智能体获得修改仓库和触发构建流水线的能力,而不再需要传统键盘输入作为中介,代码审查标准、企业安全政策和审计追踪可能需要如何调整。