NieuwsMacroZakelijke AI gaat verder dan chat nu agenten 5x zoveel tokens gebruiken als mensen

Zakelijke AI gaat verder dan chat nu agenten 5x zoveel tokens gebruiken als mensen

Auteur: Blockonomi·

Belangrijkste punten

  • OpenRouter meldde dat het agenttokengebruik tegen 10 augustus over zeven dagen gemiddeld ongeveer 7,3 biljoen bedroeg, tegenover ongeveer 1,4 biljoen mensgestuurde tokens.
  • AI-agenten verbruikten meer dan vijf keer zoveel tokens als mensen in het verkeer dat via OpenRouter werd gerouteerd.
  • Volgens OpenAI genereerden frontier-bedrijven 8,3 keer zoveel outputtokens per actieve gebruiker als gangbare bedrijven, tegen 2,6 keer in januari.
  • In juni genereerde Codex 64% van de gecombineerde outputtokens van Codex en ChatGPT bij zakelijke klanten.
  • Andreessen Horowitz meldde dat meer dan 85% van het agenttokengebruik inmiddels afkomstig is van gecachte prompts, wat de rol van prompt-caching bij werkbelasting met herhaalde context onderstreept.
Zakelijke AI gaat verder dan chat nu agenten 5x zoveel tokens gebruiken als mensen

Zakelijke kunstmatige intelligentie verschuift van gesprek naar uitvoering, nu geautomatiseerde systemen aanzienlijk meer modelcapaciteit verbruiken dan gewone menselijke gebruikers.

OpenRouter registreerde tegen 10 augustus, op basis van een zeven-daags gemiddelde, ongeveer 7,3 biljoen agenttokens, ruwweg 14 keer het niveau van begin februari. Mensgestuurd gebruik bereikte in dezelfde periode ongeveer 1,4 biljoen tokens, een stijging van 2,8 keer ten opzichte van begin februari. Daarmee verbruikten AI-agenten meer dan vijf keer zoveel tokens als mensen in het verkeer dat via het platform wordt gerouteerd.

Tokens — de tekstbrokken die taalmodellen lezen en genereren — zijn bovendien de eenheid waarmee de meeste aanbieders API-gebruik meten en factureren, waardoor deze verhouding een directe maatstaf vormt voor waar inferentie-rekenkracht naartoe gaat. OpenRouter, een routeringsdienst die verzoeken van ontwikkelaars doorstuurt naar modellen van meerdere aanbieders, onderscheidt agentactiviteit aan de hand van signalen zoals toolaanroepen, gespreksbeurten en timingpatronen. De cijfers betreffen het verkeer via OpenRouter en niet de gehele markt voor generatieve AI, maar ze laten zien hoe snel geautomatiseerde werkbelasting opschaalt. Anders dan een chatbot die één prompt beantwoordt, kunnen AI-agenten informatie inspecteren, tools aanroepen, output testen, stappen bijstellen en acties herhalen voordat zij een taak afronden.

Zakelijke AI verschuift van chat naar geautomatiseerde workflows

Het Enterprise Signals-rapport van OpenAI wijst op dezelfde omslag binnen bedrijven, vooral bij de zwaarste gebruikers. Frontier-bedrijven, gedefinieerd als de bovenste 10% zakelijke AI-gebruikers, genereerden 8,3 keer zoveel outputtokens per actieve gebruiker als gangbare bedrijven.

Dat verschil bedroeg in januari 2,6 keer, wat duidt op een groeiende kloof tussen gewoon zakelijk gebruik en de meest intensieve gebruikers. In juni produceerde Codex, de softwareontwikkelingsagent van OpenAI, 64% van de gecombineerde outputtokens van Codex en ChatGPT bij zakelijke klanten.

Het aantal wekelijks actieve Codex-gebruikers was sinds februari met een factor 108 toegenomen in de juridische sector, tegenover een factor 41 in verkoop en werving. Deze mix wijst erop dat zakelijk gebruik zich uitbreidt van chat naar programmeren, documentcreatie, onderzoek en andere workflows met meerdere stappen.

OpenAI meldde bovendien dat 21% van de actieve gebruikers bij frontier-bedrijven wekelijks Plugins gebruikte, tegenover 9% bij gangbare bedrijven. Dit verschil versterkt de verschuiving naar systemen die tools kunnen gebruiken, bestanden kunnen aanmaken en taken kunnen afronden in plaats van uitsluitend vragen te beantwoorden.

Codex, Plugins en caching drijven de omslag voorbij chat aan

Andreessen Horowitz, onder verwijzing naar gegevens van OpenRouter, meldde dat meer dan 85% van het agenttokengebruik inmiddels afkomstig is van gecachte prompts. Met prompt-caching kunnen systemen eerder verwerkte context hergebruiken in plaats van identieke input bij herhaalde aanroepen opnieuw te berekenen.

Volgens OpenAI kan caching latentie en inputkosten verlagen, waardoor werkbelasting met herhaalde context goedkoper wordt om te exploiteren. Omdat inferentie doorgaans per token wordt gefactureerd, heeft het hergebruik van context in plaats van herberekening ervan rechtstreeks invloed op de kosten van de lange, repetitieve aanroepreeksen die agenten uitvoeren. Deze werkbelastingen vereisen desondanks infrastructuur die grote contexten kan opslaan en snel kan hergebruiken, naast de GPU's die de inferentie verzorgen.

Dat vergroot het belang van geheugencapaciteit en bandbreedte nu bedrijven complexere taken aan geautomatiseerde systemen delegeren. De verschuiving vormt daarnaast een test voor traditionele workflowsoftware.

A16z stelde dat de groeiende adoptie van agenten producten die zijn opgebouwd rond vaste automatiseringsstappen onder druk kan zetten, nu gebruikers systemen omarmen die taken redenerend uitwerken. Toch bewijzen veranderingen in webverkeer op zichzelf nog geen verdringing, terwijl Zapier, Make en n8n — platforms die zakelijke apps koppelen om taken met meerdere stappen te automatiseren — eveneens AI-functies toevoegen.

Al met al zorgen AI-agenten voor een grotere tokenvraag nu zakelijke software namens gebruikers langere ketens van werk uitvoert. Naarmate dit patroon zich uitbreidt, wordt zakelijke AI minder bepaald door chatvolume en meer door de hoeveelheid werk die aan software wordt gedelegeerd, en zijn de maatstaven die nu al in zicht zijn — het aandeel van agenten in het tokenverkeer, het outputverschil bij frontier-bedrijven en het aandeel gecachte prompts — precies degene die laten zien hoe ver dit gaat.