НовостиМакроГолосовой режим GPT-Live от OpenAI получил поддержку вложений, проектов и кросс-функциональной интеграции

Голосовой режим GPT-Live от OpenAI получил поддержку вложений, проектов и кросс-функциональной интеграции

Автор: CryptoBriefing·

Ключевые выводы

  • GPT-Live использует архитектуру полного дуплекса, обеспечивающую одновременное слушание и говорение, поддерживая естественные модели поведения в разговоре, такие как перебивание в середине фразы и перекрывающийся диалог.
  • Флагманская модель GPT-Live-1 доступна платным подписчикам с полным набором возможностей, тогда как бесплатные пользователи получают GPT-Live-1 mini с уменьшенным вычислительным запасом.
  • GPT-Live может маршрутизировать вычислительно интенсивные задачи на более мощные модели, такие как GPT-5.5, сохраняя при этом отзывчивый голосовой слой в реальном времени.
  • Голосовые сессии теперь поддерживают вложения файлов, обработку изображений, функции памяти, веб-поиск и интеграцию с Projects в средах Work, Codex и настольных приложениях.
  • ChatGPT Library в настоящее время не поддерживает прямой поиск или добавление файлов во время голосовых сессий, что остаётся ограничением обновлённой системы.
Голосовой режим GPT-Live от OpenAI получил поддержку вложений, проектов и кросс-функциональной интеграции

OpenAI запустила GPT-Live 8 июля 2026 года, сделав его новым семейством голосовых моделей по умолчанию для ChatGPT. Обновление добавляет вложения файлов, интеграцию с проектами, память и возможности поиска в ту часть продукта, которая ранее функционировала преимущественно изолированно.

Пользователи теперь могут вести голосовой разговор с ChatGPT, одновременно передавая документы, что устраняет необходимость переключаться в текстовый режим для работы с контентом. Это изменение решает давнюю проблему AI-ассистентов, где голосовое взаимодействие традиционно рассматривалось как отдельная область, а не как интегрированный слой с доступом к тем же инструментам и контексту, что доступны в текстовых рабочих процессах.

Архитектура полного дуплекса

GPT-Live — это семейство голосовых моделей полного дуплекса, то есть система может слушать и говорить одновременно, а не поочерёдно. Это позволяет реализовать естественные модели поведения в разговоре, такие как перебивание в середине фразы и перекрывающийся диалог, с которыми традиционные голосовые ассистенты на основе поочерёдных реплик не могли справиться без обрыва или перезапуска ответов. Флагманская модель — GPT-Live-1, доступная платным подписчикам с полным набором функций. Облегчённый вариант, GPT-Live-1 mini, предлагается бесплатным пользователям и использует ту же разговорную архитектуру, но с уменьшенным запасом возможностей.

GPT-Live может делегировать вычислительно интенсивные задачи более мощным моделям, включая GPT-5.5, сохраняя при этом отзывчивый голосовой слой. Эта архитектура маршрутизации отражает более широкую отраслевую тенденцию, в которой лёгкие интерфейсы с низкой задержкой координируют работу, выполняемую более тяжёлыми серверными моделями, — проектное решение, балансирующее ответ в реальном времени с глубокими возможностями рассуждения.

Вложения файлов и интеграция с проектами

Наиболее значимым с операциональной точки зрения нововведением стала поддержка вложений файлов во время живых голосовых сессий. Пользователи могут прикреплять файлы прямо в процессе разговора и получать обработку этого контента в ChatGPT в реальном времени. Обновление также добавляет обработку изображений, функции памяти и веб-поиск в рамках голосовых сессий.

GPT-Live теперь подключается к функции Projects в ChatGPT, которая позволяет пользователям сохранять постоянный контекст между сессиями за счёт хранимых файлов, предпочтений и пользовательских инструкций. Эта интеграция охватывает среды Work, Codex и настольные приложения. Для пользователей, работающих с ChatGPT в нескольких средах — разговорной, программной и ориентированной на документы — интеграция с Projects фактически превращает голос из самостоятельного режима взаимодействия в общую точку входа, способную обращаться к той же базе знаний, что и другие интерфейсы.

Одно ограничение сохраняется: ChatGPT Library, в которой документы хранятся отдельно от Projects, в настоящее время не поддерживает прямой поиск или добавление файлов во время голосовой сессии.

Эволюция из Advanced Voice Mode

GPT-Live представляет собой поэтапное развитие того, что OpenAI ранее называла Advanced Voice Mode, а не фундаментальное переосмысление. Advanced Voice Mode привнесла в речь ChatGPT более естественную просодию и эмоциональный диапазон, но по-прежнему работала на системе поочерёдных реплик. GPT-Live добавляет структурную связность, подключая голос к более широкой экосистеме продукта, включая поиск, память, загрузку файлов и интеграцию с Projects. Эта траектория отражает более широкую тенденцию среди провайдеров разговорного AI по объединению голоса, текста и мультимодального ввода в рамках единой модели сессии, вместо поддержания параллельных возможностей с разрозненными наборами функций.