OpenAI integriert ChatGPT Voice in die Desktop-App für sprachgesteuerte KI-Agenten-Workflows
Wichtige Erkenntnisse
- •OpenAIs ChatGPT Voice für Desktop ermöglicht es Nutzern, KI-Agenten zu steuern und mehrstufige Computeraufgaben per gesprochenem Befehl in den Umgebungen ChatGPT Work und Codex auszuführen.
- •Die Funktion basiert auf OpenAIs GPT-Live-Sprachmodellfamilie, die Anfang desselben Monats wie diese Ankündigung eingeführt wurde.
- •Unter macOS integriert sich die Funktion mit Appshots, um auf Bildschirminhalte einschließlich Alt-Text zuzugreifen, sodass ChatGPT kontextbewusstere Unterstützung bieten kann.
- •Die Desktop-Version unterscheidet sich von der früheren mobilen Version dadurch, dass sie direkte Aufgabenausführung unterstützt und nicht nur sprachbasierte Konversation.
- •Anthropic hat den Sprachmodus für Claude ebenfalls auf Produktivitätsanwendungen ausgeweitet, was darauf hindeutet, dass sprachgesteuerte KI-Agenten zu einem Wettbewerbsfeld unter führenden KI-Anbietern werden.

OpenAI hat seiner ChatGPT-Desktop-App Sprachfunktionen hinzugefügt, mit denen Nutzer KI-Agenten steuern und komplexe Computeraufgaben per gesprochenem Befehl ausführen lassen können. Die am Donnerstag angekündigte Funktion nutzt OpenAIs GPT-Live-Sprachmodellfamilie, die das Unternehmen Anfang dieses Monats eingeführt hat. Die Veröffentlichung erfolgt zu einer Zeit, in der KI-Labore darum konkurrieren, über textbasierte Chatbots hinauszugehen und agentische Systeme zu entwickeln, die im Namen eines Nutzers Aktionen innerhalb von Softwareumgebungen ausführen können.
Sprachsteuerung wird auf Desktop-Workflows ausgeweitet
ChatGPT Voice funktioniert nun sowohl in den Umgebungen ChatGPT Work als auch Codex. Das Update ermöglicht es Nutzern, mehrstufige Anweisungen zu diktieren, die KI-Agenten autonom ausführen können, und verschiebt die Funktion damit von sprachbasierter Konversation hin zur auf dem Desktop ausgeführten Aufgabenbearbeitung.
In einem Demovideo zeigte OpenAI einen Entwickler, der mit einem einzigen gesprochenen Befehl einen neuen Thread erstellt, einen Pull Request anlegt und die Ursache eines Fehlers identifiziert. Das System kann außerdem Fähigkeiten zur Computernutzung einsetzen, um Websites und Anwendungen als Teil eines vom Nutzer angeforderten Workflows zu navigieren. Fähigkeiten zur Computernutzung – bei denen ein KI-Modell ähnlich wie ein menschlicher Nutzer mit grafischen Oberflächen interagieren kann – sind ein Schwerpunkt mehrerer KI-Labore, und die Sprachintegration macht diese Agenten zugänglich, ohne dass detaillierte Prompts getippt werden müssen.
Unter macOS arbeitet die Funktion mit Appshots zusammen, wodurch die App auf Bildschirminhalte einschließlich Alt-Text zugreifen kann, damit ChatGPT Unterstützung mit zusätzlichen visuellen und kontextuellen Informationen bieten kann. Die Desktop-Version ist eine umfassendere Umsetzung als die frühere Smartphone-Version von ChatGPT Voice, die den Gesprächsfluss und den Umgang mit Unterbrechungen verbesserte, dem Assistenten jedoch keine direkten Aktionen auf dem Gerät ermöglichte.
Desktop-Funktionen im Vergleich zu mobilen Sprachtools
Die Smartphone-Version von ChatGPT Voice war vor allem für natürliche Gespräche und nicht für die Ausführung von Befehlen konzipiert. Im Gegensatz dazu können Nutzer in der Desktop-Version komplexe Anweisungen mit mehreren Schritten sprechen und mündlich reagieren, wenn ChatGPT zusätzliche Eingaben benötigt, um eine Aufgabe fortzusetzen. Diese Unterscheidung ist wichtig, weil Desktop-Umgebungen typischerweise komplexere Workflows über mehrere Anwendungen hinweg umfassen als mobile Geräte, wodurch die sprachgesteuerte Agentensteuerung für den professionellen Einsatz potenziell größere Wirkung entfalten kann.
OpenAI erklärte außerdem, dass Nutzer über Remote-Zugriff aus der iOS-App heraus auf ChatGPT Voice in Codex zugreifen können. ChatGPT Voice für Desktop wird von OpenAIs GPT-Live-Sprachmodellen unterstützt und funktioniert mit ChatGPT Work und Codex in der Desktop-App.
Auch Anthropic hat den Sprachmodus für Claude aktualisiert. Dessen Sprachfunktionen können die Modelle Opus, Sonnet und Haiku des Unternehmens nutzen, um Aufgaben in Produktivitätsanwendungen wie Gmail, Calendar, Slack, Notion und Canva zu erledigen. OpenAI und Anthropic bauen beide Sprachtools als Schnittstelle für KI-gestützte Arbeit aus. Das deutet darauf hin, dass sprachgesteuerte Agenten unter führenden KI-Anbietern zu einem Wettbewerbsfeld werden und nicht nur eine Nischenfunktion bleiben.
Auswirkungen auf Produktivitätstools
Sprachgesteuerte KI-Agenten verschieben die KI-Interaktion weiter weg von rein textbasierten Prompts hin zu freihändigem, konversationellem Computing. Für Entwickler und Wissensarbeiter könnte die Funktion Reibungsverluste in Workflows reduzieren, die mehrere Schritte erfordern, da Nutzer Befehle erteilen können, während sie weiter an der Tastatur arbeiten oder sich ganz vom Computer entfernt befinden.
Die Möglichkeit, mehrere Agenten über eine einzige gesprochene Anweisung zu koordinieren, könnte auch in Projektmanagement- und Debugging-Workflows eingesetzt werden. OpenAIs Entscheidung, ChatGPT Voice in die Desktop-App zu bringen, zeigt, dass das Unternehmen Sprache als zentrale Interaktionsmethode für professionelle Nutzer und Unternehmenskunden positioniert, anstatt sie auf informelle mobile Gespräche zu beschränken.
Die Desktop-Version kann komplexe mehrstufige Befehle ausführen, Websites navigieren, mehrere KI-Agenten koordinieren und bei Bedarf zusätzliche Nutzereingaben anfordern. Unter macOS ermöglicht die Unterstützung von Appshots ChatGPT den Zugriff auf Bildschirminhalte für kontextbewusstere Unterstützung. Nutzer können außerdem Codex-Sprachfunktionen über Remote-Zugriff aus der iOS-App verwenden.
OpenAIs ChatGPT Voice für Desktop wird weltweit eingeführt. Mit Stand Juli 2026 markiert die Veröffentlichung einen breiteren Schritt hin zur Nutzung von Sprache als praktischem Werkzeug für komplexe professionelle Workflows und bringt OpenAIs Desktop-Sprachfunktionen in Konkurrenz zum Sprachmodus von Anthropic für Claude.