AktualnościMakroTryb głosowy GPT-Live od OpenAI zyskuje załączniki plików, projekty i integrację między funkcjami

Tryb głosowy GPT-Live od OpenAI zyskuje załączniki plików, projekty i integrację między funkcjami

Autor: CryptoBriefing·

Najważniejsze informacje

  • GPT-Live wykorzystuje architekturę głosową pełnego dupleksu, umożliwiając jednoczesne słuchanie i mówienie, co wspiera naturalne zachowania konwersacyjne, takie jak przerywanie w trakcie wypowiedzi oraz nakładające się dialogi.
  • Flagowy model GPT-Live-1 jest dostępny dla płatnych subskrybentów z pełnymi możliwościami, podczas gdy użytkownicy darmowi otrzymują GPT-Live-1 mini ze zmniejszonym zakresem przetwarzania.
  • GPT-Live może kierować zadania obliczeniowo wymagające do bardziej wydajnych modeli, takich jak GPT-5.5, przy jednoczesnym utrzymaniu responsywnej warstwy głosowej w czasie rzeczywistym.
  • Sesje głosowe obsługują teraz załączniki plików, przetwarzanie obrazów, funkcje pamięci, wyszukiwanie w sieci oraz integrację z funkcją Projekty w środowiskach Work, Codex i desktop.
  • ChatGPT Library obecnie nie obsługuje bezpośredniego wyszukiwania plików ani dodawania plików podczas sesji głosowych, co stanowi pozostałe ograniczenie w zaktualizowanym systemie.
Tryb głosowy GPT-Live od OpenAI zyskuje załączniki plików, projekty i integrację między funkcjami

OpenAI uruchomiło GPT-Live 8 lipca 2026 r., ustanawiając go jako nową domyślną rodzinę modeli głosowych dla ChatGPT. Aktualizacja wprowadza załączniki plików, integrację projektów, pamięć oraz możliwości wyszukiwania do części produktu, która wcześniej funkcjonowała w dużej mierze w izolacji.

Użytkownicy mogą teraz prowadzić rozmowę głosową z ChatGPT, jednocześnie udostępniając dokumenty, co eliminuje konieczność przełączania się w tryb tekstowy do zadań opartych na treści. Zmiana ta rozwiązuje długotrwały punkt tarcia w asystentach AI, gdzie interakcje głosowe były zazwyczaj traktowane jako oddzielna warstwa powierzchniowa, a nie zintegrowana warstwa mogąca korzystać z tych samych narzędzi i kontekstu, które są dostępne w przepływach pracy opartych na tekście.

Architektura głosowa pełnego dupleksu

GPT-Live to rodzina modeli głosowych pełnego dupleksu, co oznacza, że system może słuchać i mówić jednocześnie, zamiast naprzemiennie zamieniać się rolami. Pozwala to na naturalne zachowania konwersacyjne, takie jak przerywanie w trakcie wypowiedzi oraz nakładające się dialogi, których tradycyjne, oparte na turbach asystenty głosowe nie mogły obsłużyć bez ucinania lub ponownego rozpoczynania odpowiedzi. Flagowym modelem jest GPT-Live-1, dostępny dla płatnych subskrybentów z pełnym zestawem funkcji. Lżejsza odmiana, GPT-Live-1 mini, jest oferowana użytkownikom darmowym i dzieli tę samą architekturę konwersacyjną, ale z ograniczonym zakresem możliwości.

GPT-Live może delegować zadania obliczeniowo intensywne do bardziej wydajnych modeli, w tym GPT-5.5, przy jednoczesnym utrzymaniu responsywnej warstwy głosowej. Ta architektura routingu odzwierciedla szerszy trend branżowy, w którym lekkie interfejsy o niskich opóźnieniach koordynują pracę wykonywaną przez cięższe modele backendowe — wybór projektowy, który równoważy odpowiedź w czasie rzeczywistym z głębokimi możliwościami wnioskowania.

Załączniki plików i integracja z Projektami

Najbardziej znaczącym operacyjnie dodatkiem jest obsługa załączników plików podczas sesji głosowych na żywo. Użytkownicy mogą dołączać pliki w trakcie rozmowy i sprawić, by ChatGPT przetwarzał tę zawartość w czasie rzeczywistym. Aktualizacja wprowadza również przetwarzanie obrazów, funkcje pamięci oraz wyszukiwanie w sieci w ramach sesji głosowych.

GPT-Live łączy się teraz z funkcją Projekty w ChatGPT, która umożliwia użytkownikom utrzymanie trwałego kontekstu między sesjami poprzez przechowywane pliki, preferencje i niestandardowe instrukcje. Integracja ta obejmuje środowiska Work, Codex i desktop. Dla użytkowników, którzy korzystają z ChatGPT na wielu płaszczyznach — konwersacyjnej, programistycznej i zorientowanej na dokumenty — integracja z Projektami skutecznie przekształca głos z samodzielnego trybu interakcji w współdzielony punkt wejścia, który może czerpać z tej samej bazy wiedzy co inne interfejsy.

Pozostaje jedno ograniczenie: ChatGPT Library, która przechowuje dokumenty oddzielnie od Projektów, obecnie nie obsługuje bezpośredniego wyszukiwania plików ani dodawania plików podczas sesji głosowej.

Ewolucja z trybu Advanced Voice Mode

GPT-Live stanowi przyrostowe dojrzewanie tego, co OpenAI wcześniej nazywało Advanced Voice Mode, a nie fundamentalną reinwencję. Advanced Voice Mode wprowadził bardziej naturalną prozodię i szerszy zakres emocjonalny do mowy ChatGPT, ale nadal działał w systemie opartym na turbach. GPT-Live dodaje łączność strukturalną, łącząc głos z szerszym ekosystemem produktu, w tym z wyszukiwaniem, pamięcią, przesyłaniem plików i integracją z Projektami. Ta trajektoria odzwierciedla szerszy nurt wśród dostawców konwersacyjnej AI zmierzających do zjednoczenia głosu, tekstu i danych wejściowych multimodalnych w ramach jednego modelu sesji, zamiast utrzymywania równoległych możliwości z rozłącznymi zestawami funkcji.