ActualitésMacroLe mode vocal GPT-Live d'OpenAI ajoute les pièces jointes, les Projets et l'intégration multi-fonctionnalités

Le mode vocal GPT-Live d'OpenAI ajoute les pièces jointes, les Projets et l'intégration multi-fonctionnalités

Auteur: CryptoBriefing·

Points clés

  • GPT-Live emploie une architecture vocale full-duplex qui permet une écoute et une parole simultanées, prenant en charge des comportements conversationnels naturels tels que les interruptions en milieu de phrase et les dialogues superposés.
  • Le modèle phare GPT-Live-1 est disponible pour les abonnés payants avec des capacités complètes, tandis que les utilisateurs du palier gratuit reçoivent GPT-Live-1 mini avec une capacité de traitement réduite.
  • GPT-Live peut acheminer les tâches nécessitant une puissance de calcul importante vers des modèles plus puissants tels que GPT-5.5 tout en maintenant une couche vocale réactive en temps réel.
  • Les sessions vocales prennent désormais en charge les pièces jointes, le traitement d'images, les fonctionnalités de mémoire, la recherche web et l'intégration avec la fonctionnalité Projets sur les environnements Work, Codex et de bureau.
  • La bibliothèque ChatGPT ne prend actuellement pas en charge la recherche directe de fichiers ni l'ajout de fichiers pendant les sessions vocales, ce qui représente une limitation subsistante dans le système mis à jour.
Le mode vocal GPT-Live d'OpenAI ajoute les pièces jointes, les Projets et l'intégration multi-fonctionnalités

OpenAI a lancé GPT-Live le 8 juillet 2026, en établissant cette nouvelle famille de modèles vocaux comme option par défaut pour ChatGPT. La mise à jour intègre les pièces jointes, l'intégration de Projets, la mémoire et les capacités de recherche dans une partie du produit qui fonctionnait auparavant en grande partie de manière isolée.

Les utilisateurs peuvent désormais maintenir une conversation vocale avec ChatGPT tout en partageant simultanément des documents, éliminant ainsi la nécessité de passer en mode texte pour les tâches basées sur le contenu. Ce changement adresse un point de friction de longue date dans les assistants IA, où les interactions vocales ont généralement été traitées comme une surface distincte plutôt que comme une couche intégrée pouvant accéder aux mêmes outils et au même contexte disponibles dans les flux de travail textuels.

Architecture vocale full-duplex

GPT-Live est une famille de modèles vocaux full-duplex, ce qui signifie que le système peut écouter et parler simultanément plutôt qu'alterner les tours de parole. Cela permet des comportements conversationnels naturels tels que les interruptions en milieu de phrase et les dialogues superposés, que les assistants vocaux traditionnels basés sur des tours de parole ne pouvaient pas gérer sans couper ou redémarrer les réponses. Le modèle phare est GPT-Live-1, disponible pour les abonnés payants avec l'ensemble complet de fonctionnalités. Une variante plus légère, GPT-Live-1 mini, est proposée aux utilisateurs du palier gratuit et partage la même architecture conversationnelle, mais avec une capacité de traitement réduite.

GPT-Live peut déléguer les tâches nécessitant une puissance de calcul importante à des modèles plus puissants, notamment GPT-5.5, tout en maintenant une couche vocale réactive. Cette architecture de routage reflète une tendance industrielle plus large dans laquelle des interfaces légères à faible latence orchestrent le travail effectué par des modèles backend plus lourds, un choix de conception qui équilibre la réactivité en temps réel avec une capacité de raisonnement approfondi.

Pièces jointes et intégration des Projets

L'ajout le plus significatif sur le plan opérationnel est la prise en charge des pièces jointes pendant les sessions vocales en direct. Les utilisateurs peuvent joindre des fichiers en cours de conversation et ChatGPT peut traiter ce contenu en temps réel. La mise à jour introduit également le traitement d'images, les fonctionnalités de mémoire et la recherche web au sein des sessions vocales.

GPT-Live se connecte désormais à la fonctionnalité Projets de ChatGPT, qui permet aux utilisateurs de maintenir un contexte persistant entre les sessions grâce aux fichiers stockés, aux préférences et aux instructions personnalisées. Cette intégration s'étend aux environnements Work, Codex et de bureau. Pour les utilisateurs qui s'appuient sur ChatGPT sur plusieurs surfaces — conversationnelle, codage et centrée sur les documents — l'intégration des Projets transforme efficacement la voix, passant d'un mode d'interaction autonome à un point d'entrée partagé capable de puiser dans la même base de connaissances que les autres interfaces.

Une limitation subsiste : la bibliothèque ChatGPT, qui stocke les documents séparément des Projets, ne prend actuellement pas en charge la recherche directe de fichiers ni l'ajout de fichiers pendant une session vocale.

Évolution depuis le mode vocal avancé

GPT-Live représente une maturation incrémentale de ce qu'OpenAI appelait précédemment le mode vocal avancé (Advanced Voice Mode), plutôt qu'une réinvention fondamentale. Le mode vocal avancé avait introduit une prosodie plus naturelle et une gamme émotionnelle élargie à la parole de ChatGPT, mais fonctionnait encore sur un système basé sur des tours de parole. GPT-Live ajoute une connectivité structurelle, reliant la voix à l'écosystème produit plus large, incluant la recherche, la mémoire, les téléchargements de fichiers et l'intégration des Projets. Cette trajectoire reflète une poussée plus large parmi les fournisseurs d'IA conversationnelle visant à unifier la voix, le texte et les entrées multimodales sous un seul modèle de session, plutôt que de maintenir des capacités parallèles avec des ensembles de fonctionnalités cloisonnés.