NoticiasMacroEl modo de voz GPT-Live de OpenAI añade archivos adjuntos, proyectos e integración entre funciones

El modo de voz GPT-Live de OpenAI añade archivos adjuntos, proyectos e integración entre funciones

Autor: CryptoBriefing·

Puntos clave

  • GPT-Live emplea una arquitectura de voz de dúplex completo que permite escuchar y hablar simultáneamente, facilitando comportamientos conversacionales naturales como interrupciones a mitad de frase y diálogos superpuestos.
  • El modelo insignia GPT-Live-1 está disponible para suscriptores de pago con capacidades completas, mientras que los usuarios gratuitos reciben GPT-Live-1 mini con una capacidad de procesamiento reducida.
  • GPT-Live puede enrutar tareas computacionalmente exigentes a modelos más potentes como GPT-5.5 manteniendo una capa de voz responsiva en tiempo real.
  • Las sesiones de voz ahora admiten archivos adjuntos, procesamiento de imágenes, funciones de memoria, búsqueda web e integración con la función Projects en entornos de Work, Codex y de escritorio.
  • La ChatGPT Library actualmente no admite la búsqueda directa de archivos ni la incorporación de archivos durante las sesiones de voz, lo que representa una limitación persistente en el sistema actualizado.
El modo de voz GPT-Live de OpenAI añade archivos adjuntos, proyectos e integración entre funciones

OpenAI lanzó GPT-Live el 8 de julio de 2026, estableciéndolo como la nueva familia de modelos de voz predeterminada para ChatGPT. La actualización incorpora archivos adjuntos, integración de proyectos, memoria y capacidades de búsqueda a una parte del producto que anteriormente funcionaba de manera aislada en gran medida.

Los usuarios ahora pueden mantener una conversación por voz con ChatGPT mientras comparten documentos simultáneamente, eliminando la necesidad de cambiar al modo de texto para tareas basadas en contenido. El cambio aborda un punto de fricción recurrente en los asistentes de IA, donde las interacciones por voz se han tratado típicamente como un área de superficie separada en lugar de una capa integrada que puede acceder a las mismas herramientas y contexto disponibles en los flujos de trabajo basados en texto.

Arquitectura de voz de dúplex completo

GPT-Live es una familia de modelos de voz de dúplex completo, lo que significa que el sistema puede escuchar y hablar al mismo tiempo en lugar de alternar turnos. Esto permite comportamientos conversacionales naturales, como interrupciones a mitad de frase y diálogos superpuestos, algo que los asistentes de voz tradicionales basados en turnos no podían manejar sin cortar o reiniciar las respuestas. El modelo insignia es GPT-Live-1, disponible para suscriptores de pago con el conjunto completo de funciones. Una variante más ligera, GPT-Live-1 mini, se ofrece a los usuarios gratuitos y comparte la misma arquitectura conversacional, pero con una capacidad de procesamiento reducida.

GPT-Live puede delegar tareas computacionalmente intensivas a modelos más potentes, incluido GPT-5.5, manteniendo al mismo tiempo una capa de voz responsiva. Esta arquitectura de enrutamiento refleja una tendencia más amplia en la industria en la que interfaces ligeras y de baja latencia orquestan el trabajo realizado por modelos backend más pesados, una decisión de diseño que equilibra la capacidad de respuesta en tiempo real con la capacidad de razonamiento profundo.

Archivos adjuntos e integración con Projects

La incorporación más significativa a nivel operativo es la compatibilidad con archivos adjuntos durante las sesiones de voz en vivo. Los usuarios pueden adjuntar archivos a mitad de una conversación y hacer que ChatGPT procese ese contenido en tiempo real. La actualización también introduce procesamiento de imágenes, funciones de memoria y búsqueda web dentro de las sesiones de voz.

GPT-Live ahora se conecta a la función Projects de ChatGPT, que permite a los usuarios mantener un contexto persistente entre sesiones a través de archivos almacenados, preferencias e instrucciones personalizadas. Esta integración se extiende a los entornos de Work, Codex y de escritorio. Para los usuarios que dependen de ChatGPT en múltiples entornos —conversacional, programación y centrado en documentos— la integración con Projects convierte efectivamente la voz de un modo de interacción independiente en un punto de entrada compartido que puede extraer información de la misma base de conocimiento que otras interfaces.

Queda una limitación: la ChatGPT Library, que almacena documentos de forma separada a Projects, actualmente no admite la búsqueda directa de archivos ni la incorporación de archivos durante una sesión de voz.

Evolución desde Advanced Voice Mode

GPT-Live representa una maduración incremental de lo que OpenAI anteriormente llamaba Advanced Voice Mode, más que una reinventación fundamental. Advanced Voice Mode introdujo una prosodia más natural y un mayor rango emocional en la voz de ChatGPT, pero seguía operando con un sistema basado en turnos. GPT-Live añade conectividad estructural, vinculando la voz con el ecosistema más amplio del producto, incluida la búsqueda, la memoria, la carga de archivos y la integración con Projects. La trayectoria refleja un impulso más amplio entre los proveedores de IA conversacional para unificar las entradas de voz, texto y multimodales bajo un único modelo de sesión, en lugar de mantener capacidades paralelas con conjuntos de funciones inconexos.