NachrichtenAktienOpenAI bringt GPT-Live-Vollduplex-Sprachsteuerung in Codex und die ChatGPT-Desktop-App

OpenAI bringt GPT-Live-Vollduplex-Sprachsteuerung in Codex und die ChatGPT-Desktop-App

Autor: VentureBeat AI·

Wichtige Erkenntnisse

  • OpenAI hat sein Vollduplex-Sprachmodell GPT-Live in die ChatGPT-Desktop-App eingebettet und erstmals mit Codex und ChatGPT Work integriert.
  • Entwickler können Sprachbefehle verwenden, um mehrere gleichzeitige Codierungsaufgaben zu initiieren, wie Fehleruntersuchungen, Pull-Request-Überprüfungen und Unit-Test-Generierung, ohne ihren Workflow zu unterbrechen.
  • Die Integration entkoppelt die Echtzeit-Sprachebene von den Ausführungs-Engines, sodass GPT-Live flüssige Konversation aufrechterhalten kann, während Hintergrundmodelle rechenintensive Arbeitslasten verarbeiten.
  • Der Zugriff auf die sprachaktivierten Desktop-Funktionen ist auf zahlende Abonnenten in den Plänen Plus, Pro, Business, Enterprise und Education beschränkt, und die zugrunde liegenden Systeme bleiben vollständig geschlossen und können nicht selbst gehostet werden.
  • Der Release wirft praktische Fragen für Engineering-Teams auf zur Anpassung von Code-Review-Standards, Unternehmenssicherheitsrichtlinien und Audit-Trails, da sprachinitiierte Agenten die Fähigkeit erhalten, Repositorys zu modifizieren und Build-Pipelines auszulösen.
OpenAI bringt GPT-Live-Vollduplex-Sprachsteuerung in Codex und die ChatGPT-Desktop-App

Zwei Wochen nach der Vorstellung seines GPT-Live-Audiomodells mit Vollduplex-Fähigkeiten – das gleichzeitiges Zuhören und Sprechen ermöglicht – bettet OpenAI die Technologie direkt in Entwickler-Workflows ein.

Das Unternehmen kündigte an, dass GPT-Live nun die ChatGPT-Desktop-Anwendung auf macOS und Windows antreibt und mit agentengestützten Systemen einschließlich Codex und ChatGPT Work integriert wird, die separate Erlebnisse innerhalb der ChatGPT-Desktop-App sind.

OpenAI hatte GPT-Live ursprünglich am 8. Juli 2026 eingeführt und ein kontinuierliches Audiomodell vorgestellt, das gleichzeitig zuhören und sprechen kann. Das Design eliminiert starre Wechselsprache und delegiert komplexe Schlussfolgerungen an Hintergrundmodelle wie GPT-5.5. Die neueste Veröffentlichung erweitert diese Konversationsschicht auf technische Aufgaben und ermöglicht Softwareingenieuren, mehrsträngige Codierungsaufgaben zu orchestrieren, Pull-Requests zu überprüfen und Anwendungen mit natürlichen Sprachbefehlen zu debuggen.

Das Update könnte eine neue Ära der freihändigen Softwareentwicklung einläuten – und sogar persönliche Gruppen-Coding-Sessions für die mehr als 10 Millionen wöchentlich aktiven Nutzer von Codex und ChatGPT Work. Codex ist der Name für OpenAIs auf Codierung fokussierte Modelle und Werkzeuge, die das Unternehmen dieses Jahr jedoch zu einer breiteren Produktivitätsplattform ausgebaut hat. Ein OpenAI-Sprecher sagte VentureBeat, dass dies das erste Mal ist, dass Sprachaktivierung in diese agentengestützten Codierungswerkzeuge integriert wurde. Der Schritt kommt zu einem Zeitpunkt, da der Markt für KI-gestütztes Codieren zunehmend umkämpft wird, wobei GitHub Copilot, Anthropics Claude und Googles Gemini alle ihre autonomen Entwicklungsfähigkeiten ausbauen – jedoch hat bisher keiner Vollduplex-Sprache als primäre Steuerungsschnittstelle für Coding-Agenten eingeführt.

OpenAI veröffentlichte ein Werbevideo mit den Mitarbeitern Jason Liu, Codex Developer Experience Engineer, und Guinness Chen, Codex Technical Staff Member, die in einem Raum mit derselben ChatGPT-Desktop-App-Sitzung sprachen. Jeder erteilte unterschiedliche Anweisungen und unterhielt sich gleichzeitig mit demselben Modell.

Funktionsweise der Integration

Im Kern entkoppelt die Integration die Echtzeit-Sprachebene von den zugrunde liegenden Ausführungs-Engines. GPT-Live führt eine flüssige Konversation – es fügt natürliche verbale Bestätigungen wie „got it" ein, ohne den Benutzer zu unterbrechen – und überträgt rechenintensive Arbeitslasten an Hintergrund-Reasoning-Modelle.

Unter macOS integriert die Desktop-Anwendung „Appshots"- und Bildschirmkontext-Funktionen, die es ChatGPT Voice ermöglichen, das vorderste Fenster zusammen mit lokalen Dateien, Codebasis-Strukturen und aktiven Plugins zu analysieren. Diese Architektur schafft eine Pair-Programming-Dynamik, bei der Entwickler Probleme conversationell besprechen, während Agenten Aufgaben asynchron ausführen.

Anstatt Codierungssitzungen zu unterbrechen, um detaillierte Anweisungen einzugeben oder Fenster zu wechseln, können Entwickler das System vollständig freihändig steuern. Die Vollduplex-Engine entscheidet dynamisch, wann sie sprechen, pausieren oder Werkzeuge aufrufen soll, und behält den Konversationsstatus bei, selbst wenn Hintergrund-Agenten komplexe Codeänderungen verarbeiten.

Sprachgesteuertes Codieren und komplexe Builds

Die zentrale Fähigkeit in diesem Update ist die Multitask-Ausführung über Codex- und ChatGPT Work-Umgebungen hinweg. Softwareingenieure können mehrere gleichzeitige Aufgabenstränge aus einem einzigen gesprochenen Befehl initiieren. Beispielsweise kann ein Entwickler, der ein Feature ausliefern möchte, das System anweisen, einen offenen Authentifizierungsfehler zu untersuchen, einen ausstehenden Pull-Request für eine API-Migration zu überprüfen und gleichzeitig fehlende Unit-Tests zu generieren.

Die Desktop-Anwendung koordiniert diese Aktionen über unterschiedliche Kontexte hinweg und verfolgt Probleme durch Slack-Konversationen, GitHub-Repositorys und lokale Codebasen. Entwickler können auch Design-Mockups verbal in funktionierenden Code umwandeln und Aufgaben über Frontend-, Backend- und Testing-Ebenen aufteilen.

Mit Unterstützung für Multi-Ordner-Projekte (Build 26.715) und Remote-Ausführung über iOS können Ingenieure den Aufgabenfortschritt überprüfen, Agenten-Aufforderungen beantworten und aktive Aufträge umleiten, ohne Anwendungen zu wechseln oder einzelne Prozesse Zeile für Zeile zu verwalten.

Proprietäres Lizenzmodell

OpenAIs sprachaktivierter Desktop-Release arbeitet unter einem proprietären, kommerziellen Enterprise-Modell. Der Zugriff ist auf zahlende Abonnenten in den Plänen Plus, Pro, Business, Enterprise und Education beschränkt.

Für einzelne Entwickler und Unternehmens-Engineering-Abteilungen bedeutet dies, dass Modellgewichte, Sprachverarbeitungs-Pipelines und Agent-Status-Architekturen vollständig geschlossen bleiben. Organisationen können die zugrunde liegenden Systeme weder modifizieren noch selbst hosten. Aufgaben, die über ChatGPT Voice initiiert werden, verbrauchen Standardnutzungszuweisungen direkt aus den bestehenden Kontingenten der Codex- und ChatGPT Work-Pläne und behandeln sprachgesteuerte Aktionen identisch mit Standard-Agenten-Workloads. Der geschlossene Ansatz steht im Gegensatz zu Open-Weight-Codierungsmodellen von Mitbewerbern wie Metas Code Llama und DeepSeeks Coder, obwohl diese Alternativen noch nicht die integrierten Sprach-Agenten-Fähigkeiten erreicht haben, die OpenAI bereitstellt.

Reaktionen der Community

Entwicklergemeinden wiesen sofort auf die Implikationen hin, kontinuierliche Vollduplex-Sprache in autonome Coding-Workflows zu integrieren. Als Reaktion auf die Ankündigung des Builds 26.715 – die Einzelheiten zur Sprachintegration und Unterstützung für Multi-Ordner-Projekte enthält – bemerkte der AI-Insider-Journalist @ChrisGPT auf X: „Today OpenAI will release voice and remote guidance for codex ! One step closer to personal AGI".

Frühes technisches Feedback zeigt weit verbreitete Begeisterung für die freihändige Orchestrierung komplexer Agenten-Aufgaben, insbesondere beim Verlassen des Arbeitsplatzes oder bei der Remote-Verwaltung von Build-Pipelines. Der Release wirft auch praktische Fragen für Engineering-Teams auf, wie Code-Review-Standards, Unternehmenssicherheitsrichtlinien und Audit-Trails angepasst werden müssen, wenn sprachinitiierte Agenten die Fähigkeit erhalten, Repositorys zu modifizieren und Build-Pipelines ohne traditionelle tastaturvermittelte Überwachung auszulösen.