AktualnościAkcjeOpenAI wprowadza pełnodupleksowe sterowanie głosowe GPT-Live do Codex i aplikacji desktopowej ChatGPT

OpenAI wprowadza pełnodupleksowe sterowanie głosowe GPT-Live do Codex i aplikacji desktopowej ChatGPT

Autor: VentureBeat AI·

Najważniejsze informacje

  • OpenAI osadziło swój pełnodupleksowy model głosowy GPT-Live w aplikacji desktopowej ChatGPT, po raz pierwszy integrując go z Codex i ChatGPT Work.
  • Deweloperzy mogą używać poleceń głosowych do uruchamiania wielu równoległych zadań programistycznych, takich jak badanie błędów, przeglądy pull requestów i generowanie testów jednostkowych, bez przerywania pracy.
  • Integracja oddziela warstwę głosu działającą w czasie rzeczywistym od silników wykonawczych, pozwalając GPT-Live utrzymywać płynną rozmowę, podczas gdy modele działające w tle obsługują ciężkie obciążenia obliczeniowe.
  • Dostęp do desktopowych funkcji głosowych jest ograniczony do płatnych subskrybentów planów Plus, Pro, Business, Enterprise i Education, a bazowe systemy pozostają w pełni zamknięte i nie mogą być hostowane samodzielnie.
  • Premiera rodzi praktyczne pytania dla zespołów inżynieryjnych dotyczące dostosowania standardów przeglądu kodu, firmowych polityk bezpieczeństwa i ścieżek audytu, gdy agenci inicjowani głosem zyskują możliwość modyfikowania repozytoriów i uruchamiania potoków kompilacji.
OpenAI wprowadza pełnodupleksowe sterowanie głosowe GPT-Live do Codex i aplikacji desktopowej ChatGPT

Dwa tygodnie po zaprezentowaniu swojego modelu audio AI GPT-Live z funkcjami pełnego dupleksu — umożliwiającymi jednoczesne słuchanie i mówienie — OpenAI osadza tę technologię bezpośrednio w przepływach pracy deweloperów.

Firma ogłosiła, że GPT-Live zasila teraz aplikację desktopową ChatGPT na macOS i Windows, integrując się z systemami agentowymi, w tym Codex i ChatGPT Work, które są oddzielnymi doświadczeniami dostępnymi w aplikacji desktopowej ChatGPT.

OpenAI początkowo uruchomiło GPT-Live 8 lipca 2026 r., prezentując ciągły model audio zdolny do jednoczesnego słuchania i mówienia. Konstrukcja eliminuje sztywne naprzemienne zabieranie głosu, delegując złożone rozumowanie do modeli działających w tle, takich jak GPT-5.5. Najnowsza wersja rozszerza tę warstwę konwersacyjną na zadania techniczne, pozwalając inżynierom oprogramowania organizować wielowątkowe prace programistyczne, przeglądać pull requesty i debugować aplikacje za pomocą naturalnych poleceń głosowych.

Aktualizacja może zapoczątkować nową erę tworzenia oprogramowania bez użycia rąk — a nawet grupowych sesji programowania na żywo, prowadzonych osobiście — dla ponad 10 milionów aktywnych tygodniowo użytkowników Codex i ChatGPT Work. Codex to nazwa modeli i środowiska OpenAI skoncentrowanych na kodowaniu, choć firma rozszerzyła go w tym roku w szerszą platformę produktywności. Rzecznik OpenAI powiedział VentureBeat, że jest to pierwszy raz, gdy aktywacja głosowa została zintegrowana z tymi agentowymi narzędziami programistycznymi. Posunięcie następuje w momencie, gdy rynek kodowania wspomaganego przez AI stał się coraz bardziej zatłoczony: GitHub Copilot, Claude firmy Anthropic i Gemini firmy Google rozwijają autonomiczne możliwości programistyczne, ale żaden z nich nie wprowadził jeszcze pełnodupleksowego głosu jako podstawowego interfejsu sterowania agentami kodującymi.

OpenAI opublikowało materiał promocyjny z udziałem pracowników Jasona Liu, inżyniera doświadczeń deweloperskich Codex, oraz Guinnessa Chena, członka personelu technicznego Codex, którzy w jednym pomieszczeniu rozmawiali z tą samą sesją aplikacji desktopowej ChatGPT. Każdy z nich wydawał różne instrukcje i jednocześnie prowadził rozmowę z tym samym modelem.

Jak działa integracja

U podstaw integracja oddziela warstwę głosu działającą w czasie rzeczywistym od bazowych silników wykonawczych. GPT-Live utrzymuje płynną rozmowę — wstawiając naturalne potwierdzenia werbalne, takie jak „got it”, bez przerywania użytkownikowi — jednocześnie przekazując ciężkie obciążenia obliczeniowe do modeli rozumowania działających w tle.

Na macOS aplikacja desktopowa zawiera funkcje „Appshots” oraz kontekst ekranu, umożliwiając ChatGPT Voice analizowanie okna znajdującego się na pierwszym planie wraz z lokalnymi plikami, strukturami baz kodu i aktywnymi wtyczkami. Taka architektura tworzy dynamikę programowania w parach, w której deweloperzy omawiają problemy w sposób konwersacyjny, a agenci wykonują zadania asynchronicznie.

Zamiast przerywać sesje kodowania, aby wpisywać szczegółowe instrukcje lub przełączać okna, deweloperzy mogą sterować systemem całkowicie bez użycia rąk. Silnik pełnodupleksowy dynamicznie decyduje, kiedy mówić, kiedy zrobić pauzę lub kiedy wywołać narzędzia, utrzymując stan rozmowy nawet wtedy, gdy agenci w tle przetwarzają złożone modyfikacje kodu.

Kodowanie sterowane głosem i złożone kompilacje

Główną możliwością w tej aktualizacji jest wykonywanie wielu zadań w środowiskach Codex i ChatGPT Work. Inżynierowie oprogramowania mogą uruchamiać wiele równoległych wątków zadań za pomocą jednego wypowiedzianego polecenia. Na przykład deweloper przygotowujący wydanie funkcji może polecić systemowi jednoczesne zbadanie otwartego błędu uwierzytelniania, przegląd oczekującego pull requestu dotyczącego migracji API oraz wygenerowanie brakujących testów jednostkowych.

Aplikacja desktopowa koordynuje te działania w różnych kontekstach, śledząc problemy w rozmowach na Slacku, repozytoriach GitHub i lokalnych bazach kodu. Deweloperzy mogą także werbalnie przekształcać makiety projektowe w działający kod, rozdzielając zadania między warstwy frontend, backend i testowania.

Dzięki obsłudze projektów wielokatalogowych (build 26.715) oraz zdalnemu wykonywaniu przez iOS, inżynierowie mogą sprawdzać postęp zadań, odpowiadać na zapytania agentów i przekierowywać aktywne prace bez przełączania aplikacji ani zarządzania poszczególnymi procesami linia po linii.

Własnościowy model licencjonowania

Desktopowa wersja OpenAI z obsługą głosu działa w ramach własnościowego, komercyjnego modelu korporacyjnego. Dostęp jest ograniczony do płatnych subskrybentów planów Plus, Pro, Business, Enterprise i Education.

Dla indywidualnych deweloperów i firmowych działów inżynieryjnych oznacza to, że wagi modeli, potoki przetwarzania głosu oraz architektury stanu agentów pozostają w pełni zamknięte. Organizacje nie mogą modyfikować ani samodzielnie hostować bazowych systemów. Zadania inicjowane przez ChatGPT Voice zużywają standardowe przydziały użycia bezpośrednio z istniejących limitów planów Codex i ChatGPT Work, traktując działania uruchamiane głosem identycznie jak standardowe obciążenia agentowe. Zamknięte podejście kontrastuje z modelami kodowania o otwartych wagach oferowanymi przez konkurentów, takich jak Code Llama firmy Meta i Coder firmy DeepSeek, choć te alternatywy nie dorównały jeszcze zintegrowanym możliwościom głosowo-agentowym wdrażanym przez OpenAI.

Reakcje społeczności

Społeczności deweloperskie natychmiast zwróciły uwagę na konsekwencje wprowadzenia ciągłego, pełnodupleksowego głosu do autonomicznych przepływów kodowania. Reagując na ogłoszenie wydania build 26.715 — które opisuje integrację głosową i obsługę projektów wielokatalogowych — dziennikarz AI Insider @ChrisGPT napisał na X: „Today OpenAI will release voice and remote guidance for codex ! One step closer to personal AGI”.

Wczesne opinie techniczne wskazują na szeroki entuzjazm wobec możliwości organizowania złożonych zadań agentowych bez użycia rąk, zwłaszcza podczas odchodzenia od stacji roboczej lub zdalnego zarządzania potokami kompilacji. Premiera rodzi również praktyczne pytania dla zespołów inżynieryjnych o to, jak standardy przeglądu kodu, firmowe polityki bezpieczeństwa i ścieżki audytu mogą wymagać dostosowania, gdy agenci inicjowani głosem zyskują możliwość modyfikowania repozytoriów i uruchamiania potoków kompilacji bez tradycyjnego nadzoru realizowanego za pomocą klawiatury.