НовостиАкцииOpenAI добавляет полно-дуплексное голосовое управление GPT-Live в Codex и настольное приложение ChatGPT

OpenAI добавляет полно-дуплексное голосовое управление GPT-Live в Codex и настольное приложение ChatGPT

Автор: VentureBeat AI·

Ключевые выводы

  • OpenAI встроила свою полно-дуплексную голосовую модель GPT-Live в настольное приложение ChatGPT, впервые интегрировав ее с Codex и ChatGPT Work.
  • Разработчики могут использовать голосовые команды для запуска нескольких параллельных задач программирования, включая расследование ошибок, проверку pull request и генерацию unit-тестов, не прерывая рабочий процесс.
  • Интеграция отделяет голосовой слой реального времени от движков выполнения, позволяя GPT-Live поддерживать плавный диалог, пока фоновые модели обрабатывают тяжелые вычислительные нагрузки.
  • Доступ к голосовым настольным функциям ограничен платными подписчиками тарифов Plus, Pro, Business, Enterprise и Education, а базовые системы остаются полностью закрытыми и недоступными для самостоятельного хостинга.
  • Релиз поднимает практические вопросы для инженерных команд о пересмотре стандартов code review, корпоративных политик безопасности и аудиторских журналов по мере того, как запускаемые голосом агенты получают возможность изменять репозитории и запускать конвейеры сборки.
OpenAI добавляет полно-дуплексное голосовое управление GPT-Live в Codex и настольное приложение ChatGPT

Через две недели после представления своей аудио-модели ИИ GPT-Live с полно-дуплексными возможностями — позволяющими одновременно слушать и говорить — OpenAI встраивает эту технологию непосредственно в рабочие процессы разработчиков.

Компания объявила, что GPT-Live теперь работает в настольном приложении ChatGPT на macOS и Windows, интегрируясь с агентными системами, включая Codex и ChatGPT Work, которые являются отдельными интерфейсами, доступными внутри настольного приложения ChatGPT.

OpenAI впервые запустила GPT-Live 8 июля 2026 года, представив непрерывную аудиомодель, способную слушать и говорить одновременно. Такой подход устраняет жесткую очередность реплик, передавая сложные рассуждения фоновым моделям, таким как GPT-5.5. Новый релиз расширяет этот разговорный слой на технические задачи, позволяя инженерам-программистам организовывать многопоточные задачи по написанию кода, проверять pull request и отлаживать приложения с помощью естественных голосовых команд.

Обновление может открыть новую эпоху разработки ПО без использования рук — и даже живых очных групповых сессий программирования — для более чем 10 миллионов еженедельно активных пользователей Codex и ChatGPT Work. Codex — это название моделей и инструментария OpenAI, ориентированных на программирование, хотя в этом году компания расширила его до более широкой платформы продуктивности. Представитель OpenAI сообщил VentureBeat, что это первый случай интеграции голосовой активации в эти агентные инструменты программирования. Шаг происходит на фоне все более насыщенного рынка ИИ-помощников для разработки: GitHub Copilot, Claude от Anthropic и Gemini от Google расширяют автономные возможности разработки, но ни один из них пока не представил полно-дуплексный голос как основной интерфейс управления агентами программирования.

OpenAI опубликовала промо-видео с участием сотрудников Jason Liu, инженера по developer experience в Codex, и Guinness Chen, технического специалиста Codex, которые в одной комнате обращаются к одной и той же сессии настольного приложения ChatGPT. Каждый из них одновременно давал разные инструкции и общался с одной и той же моделью.

Как работает интеграция

В основе интеграции лежит отделение голосового слоя реального времени от базовых движков выполнения. GPT-Live поддерживает плавный диалог — вставляя естественные устные подтверждения вроде "got it", не перебивая пользователя, — при этом передавая тяжелые вычислительные нагрузки фоновым моделям рассуждения.

На macOS настольное приложение включает функции "Appshots" и экранного контекста, позволяя ChatGPT Voice анализировать активное окно вместе с локальными файлами, структурами кодовой базы и активными плагинами. Такая архитектура создает динамику парного программирования, при которой разработчики обсуждают проблемы в разговорном формате, а агенты асинхронно выполняют задачи.

Вместо того чтобы прерывать сессии программирования для ввода подробных инструкций или переключения окон, разработчики могут полностью без рук управлять системой. Полно-дуплексный движок динамически решает, когда говорить, делать паузу или вызывать инструменты, сохраняя состояние диалога даже тогда, когда фоновые агенты обрабатывают сложные изменения кода.

Голосовое управление программированием и сложными сборками

Ключевая возможность этого обновления — многозадачное выполнение в средах Codex и ChatGPT Work. Инженеры-программисты могут запускать несколько параллельных потоков задач одной голосовой командой. Например, разработчик, готовящийся выпустить функцию, может поручить системе одновременно исследовать открытую ошибку аутентификации, проверить ожидающий pull request по миграции API и сгенерировать недостающие unit-тесты.

Настольное приложение координирует эти действия в разных контекстах, отслеживая проблемы через переписки в Slack, репозитории GitHub и локальные кодовые базы. Разработчики также могут голосом преобразовывать дизайн-макеты в рабочий код, распределяя задачи между frontend, backend и слоями тестирования.

Благодаря поддержке много-папочных проектов (build 26.715) и удаленного выполнения через iOS инженеры могут проверять ход задач, отвечать на запросы агентов и перенаправлять активные задания без переключения между приложениями и без построчного управления отдельными процессами.

Проприетарная модель лицензирования

Настольный релиз OpenAI с голосовыми возможностями работает по проприетарной коммерческой корпоративной модели. Доступ ограничен платными подписчиками тарифов Plus, Pro, Business, Enterprise и Education.

Для индивидуальных разработчиков и корпоративных инженерных подразделений это означает, что веса моделей, конвейеры обработки голоса и архитектуры состояния агентов остаются полностью закрытыми. Организации не могут изменять базовые системы или размещать их самостоятельно. Задачи, инициированные через ChatGPT Voice, напрямую расходуют стандартные лимиты использования из существующих квот планов Codex и ChatGPT Work, приравнивая голосовые действия к обычным агентным рабочим нагрузкам. Закрытый подход контрастирует с моделями для программирования с открытыми весами, предлагаемыми конкурентами, такими как Code Llama от Meta и Coder от DeepSeek, хотя эти альтернативы пока не сравнялись с интегрированными голосовыми агентными возможностями, которые внедряет OpenAI.

Реакция сообщества

Сообщества разработчиков сразу отметили последствия внедрения непрерывного полно-дуплексного голоса в автономные рабочие процессы программирования. Реагируя на объявление о релизе build 26.715, где подробно описаны голосовая интеграция и поддержка много-папочных проектов, журналист AI Insider @ChrisGPT отметил в X: "Today OpenAI will release voice and remote guidance for codex ! One step closer to personal AGI".

Первые технические отзывы показывают широкий интерес к управлению сложными агентными задачами без рук, особенно при отходе от рабочего места или удаленном управлении конвейерами сборки. Релиз также поднимает практические вопросы для инженерных команд о том, как стандарты code review, корпоративные политики безопасности и аудиторские журналы должны адаптироваться по мере того, как агенты, запускаемые голосом, получают возможность изменять репозитории и запускать конвейеры сборки без традиционного контроля через клавиатуру.