ActualitésActionsOpenAI intègre le contrôle vocal full-duplex de GPT-Live à Codex et à l’application de bureau ChatGPT

OpenAI intègre le contrôle vocal full-duplex de GPT-Live à Codex et à l’application de bureau ChatGPT

Auteur: VentureBeat AI·

Points clés

  • OpenAI a intégré son modèle vocal full-duplex GPT-Live à l’application de bureau ChatGPT, avec une intégration à Codex et ChatGPT Work pour la première fois.
  • Les développeurs peuvent utiliser des commandes vocales pour lancer plusieurs tâches de codage simultanées, comme des enquêtes sur des bugs, des revues de pull requests et la génération de tests unitaires, sans interrompre leur flux de travail.
  • L’intégration dissocie la couche vocale en temps réel des moteurs d’exécution, permettant à GPT-Live de maintenir une conversation fluide pendant que des modèles d’arrière-plan prennent en charge les charges de calcul lourdes.
  • L’accès aux fonctionnalités de bureau activées par la voix est limité aux abonnés payants des offres Plus, Pro, Business, Enterprise et Education, et les systèmes sous-jacents restent entièrement fermés et non auto-hébergeables.
  • Cette sortie soulève des questions pratiques pour les équipes d’ingénierie sur l’adaptation des normes de revue de code, des politiques de sécurité d’entreprise et des pistes d’audit, alors que des agents déclenchés par la voix peuvent modifier des dépôts et lancer des pipelines de build.
OpenAI intègre le contrôle vocal full-duplex de GPT-Live à Codex et à l’application de bureau ChatGPT

Deux semaines après avoir présenté son modèle d’IA audio GPT-Live doté de capacités full-duplex — permettant d’écouter et de parler simultanément — OpenAI intègre directement cette technologie aux flux de travail des développeurs.

L’entreprise a annoncé que GPT-Live alimente désormais l’application de bureau ChatGPT sur macOS et Windows, avec une intégration aux systèmes agentiques, notamment Codex et ChatGPT Work, qui sont des expériences distinctes disponibles dans l’application de bureau ChatGPT.

OpenAI avait initialement lancé GPT-Live le 8 juillet 2026, dévoilant un modèle audio continu capable d’écouter et de parler en même temps. Cette conception supprime les tours de parole rigides tout en déléguant le raisonnement complexe à des modèles d’arrière-plan tels que GPT-5.5. La dernière version étend cette couche conversationnelle aux tâches techniques, permettant aux ingénieurs logiciel d’orchestrer des travaux de codage multithread, d’examiner des pull requests et de déboguer des applications à l’aide de commandes vocales naturelles.

La mise à jour pourrait ouvrir une nouvelle ère du développement logiciel sans les mains — et même de sessions de codage collectives en direct et en présentiel — pour les plus de 10 millions d’utilisateurs actifs hebdomadaires de Codex et ChatGPT Work. Codex est le nom donné aux modèles et à l’environnement d’OpenAI axés sur le codage, même si l’entreprise l’a élargi cette année pour en faire une plateforme de productivité plus générale. Un porte-parole d’OpenAI a déclaré à VentureBeat qu’il s’agit de la première intégration de l’activation vocale dans ces outils de codage agentiques. Cette initiative intervient alors que le marché du codage assisté par IA est devenu de plus en plus concurrentiel, avec GitHub Copilot, Claude d’Anthropic et Gemini de Google qui étendent tous leurs capacités de développement autonome — mais aucun n’a encore introduit la voix full-duplex comme interface de contrôle principale pour les agents de codage.

OpenAI a publié une vidéo promotionnelle mettant en scène ses employés Jason Liu, ingénieur de l’expérience développeur Codex, et Guinness Chen, membre de l’équipe technique Codex, s’adressant à la même session de l’application de bureau ChatGPT dans une même pièce. Chacun donnait des instructions différentes et conversait simultanément avec le même modèle.

Fonctionnement de l’intégration

Au cœur du dispositif, l’intégration dissocie la couche vocale en temps réel des moteurs d’exécution sous-jacents. GPT-Live maintient une conversation fluide — en insérant des accusés de réception verbaux naturels comme « got it » sans interrompre l’utilisateur — tout en transmettant les charges de calcul lourdes à des modèles de raisonnement en arrière-plan.

Sur macOS, l’application de bureau intègre les fonctionnalités « Appshots » et de contexte d’écran, permettant à ChatGPT Voice d’analyser la fenêtre au premier plan ainsi que les fichiers locaux, les structures de bases de code et les plugins actifs. Cette architecture crée une dynamique de programmation en binôme dans laquelle les développeurs discutent des problèmes de manière conversationnelle pendant que les agents exécutent les tâches de façon asynchrone.

Au lieu d’interrompre les sessions de codage pour saisir des instructions détaillées ou changer de fenêtre, les développeurs peuvent diriger le système entièrement sans les mains. Le moteur full-duplex décide dynamiquement quand parler, faire une pause ou invoquer des outils, tout en conservant l’état de la conversation alors même que des agents en arrière-plan traitent des modifications de code complexes.

Codage et builds complexes pilotés par la voix

La capacité centrale de cette mise à jour est l’exécution multitâche dans les environnements Codex et ChatGPT Work. Les ingénieurs logiciel peuvent lancer plusieurs fils de tâches simultanés à partir d’une seule instruction vocale. Par exemple, un développeur qui prépare la livraison d’une fonctionnalité peut demander au système d’enquêter sur un bug d’authentification ouvert, d’examiner une pull request de migration d’API en attente et de générer les tests unitaires manquants simultanément.

L’application de bureau coordonne ces actions dans des contextes disparates, en suivant les problèmes à travers les conversations Slack, les dépôts GitHub et les bases de code locales. Les développeurs peuvent également convertir verbalement des maquettes de design en code fonctionnel, en répartissant les tâches entre les couches frontend, backend et de test.

Avec la prise en charge des projets multi-dossiers (build 26.715) et l’exécution à distance via iOS, les ingénieurs peuvent vérifier l’avancement des tâches, répondre aux demandes des agents et réorienter les travaux actifs sans changer d’application ni gérer les processus individuels ligne par ligne.

Modèle de licence propriétaire

La version de bureau à commande vocale d’OpenAI fonctionne selon un modèle propriétaire, commercial et destiné aux entreprises. L’accès est limité aux abonnés payants des offres Plus, Pro, Business, Enterprise et Education.

Pour les développeurs individuels et les départements d’ingénierie des entreprises, cela signifie que les poids des modèles, les pipelines de traitement vocal et les architectures d’état des agents restent entièrement fermés. Les organisations ne peuvent ni modifier ni auto-héberger les systèmes sous-jacents. Les tâches lancées via ChatGPT Voice consomment directement les allocations d’utilisation standard des quotas existants des plans Codex et ChatGPT Work, les actions déclenchées par la voix étant traitées de la même manière que les charges de travail agentiques classiques. Cette approche fermée contraste avec les modèles de codage à poids ouverts proposés par des concurrents tels que Code Llama de Meta et Coder de DeepSeek, même si ces alternatives n’ont pas encore égalé les capacités intégrées vocales et agentiques qu’OpenAI déploie.

Réactions de la communauté

Les communautés de développeurs ont immédiatement relevé les implications de l’arrivée de la voix continue full-duplex dans les flux de travail de codage autonome. En réaction à l’annonce de la build 26.715 — qui détaille l’intégration vocale et la prise en charge des projets multi-dossiers — le journaliste d’AI Insider @ChrisGPT a noté sur X : « Today OpenAI will release voice and remote guidance for codex ! One step closer to personal AGI ».

Les premiers retours techniques font état d’un fort enthousiasme pour l’orchestration de tâches agentiques complexes sans les mains, en particulier lorsqu’un développeur s’éloigne de son poste de travail ou gère des pipelines de build à distance. Cette sortie soulève également des questions pratiques pour les équipes d’ingénierie quant à la manière dont les normes de revue de code, les politiques de sécurité d’entreprise et les pistes d’audit devront éventuellement évoluer à mesure que des agents initiés par la voix acquièrent la capacité de modifier des dépôts et de déclencher des pipelines de build sans supervision traditionnelle au clavier.