La IA empresarial va más allá del chat a medida que los agentes usan 5 veces más tokens que los humanos
Puntos clave
- •OpenRouter informó que el uso de tokens agénticos promedió unos 7,3 billones en siete días al 10 de agosto, frente a unos 1,4 billones de tokens impulsados por humanos.
- •Los agentes de IA consumieron más de cinco veces la cantidad de tokens que los humanos en el tráfico enrutado a través de OpenRouter.
- •OpenAI señaló que las empresas frontera generaron 8,3 veces más tokens de salida por usuario activo que las empresas típicas, frente a 2,6 veces en enero.
- •Para junio, Codex generaba el 64% de los tokens de salida combinados de Codex y ChatGPT entre los clientes empresariales.
- •Andreessen Horowitz señaló que más del 85% del uso de tokens agénticos proviene ahora de prompts en caché, lo que destaca el papel del almacenamiento en caché de prompts en las cargas de trabajo con contexto repetido.

La inteligencia artificial empresarial está pasando de la conversación a la ejecución, a medida que los sistemas automatizados consumen mucha más capacidad de modelo que los usuarios humanos corrientes.
OpenRouter registró unos 7,3 billones de tokens agénticos en promedio de siete días al 10 de agosto, unas 14 veces el nivel observado a principios de febrero. El uso impulsado por humanos alcanzó unos 1,4 billones de tokens en el mismo período, un aumento de 2,8 veces respecto de principios de febrero. Esto dejó a los agentes de IA consumiendo más de cinco veces la cantidad de tokens que los humanos en el tráfico enrutado a través de la plataforma.
Los tokens —los fragmentos de texto que los modelos de lenguaje leen y generan— son también la unidad con la que la mayoría de los proveedores mide y factura el uso de la API, por lo que esta proporción es una medida directa de hacia dónde se dirige el cómputo de inferencia. OpenRouter, un servicio de enrutamiento que envía las solicitudes de los desarrolladores a modelos de múltiples proveedores, distingue la actividad agéntica mediante señales como llamadas a herramientas, turnos de conversación y patrones de tiempo. Las cifras reflejan el tráfico de OpenRouter y no todo el mercado de IA generativa, pero indican la rapidez con la que escalan las cargas de trabajo automatizadas. A diferencia de un chatbot que responde a un único prompt, los agentes de IA pueden inspeccionar información, llamar a herramientas, probar resultados, revisar pasos y repetir acciones antes de completar el trabajo.
La IA empresarial pasa del chat a los flujos de trabajo automatizados
El informe Enterprise Signals de OpenAI apunta a la misma transición dentro de las empresas, especialmente entre los usuarios más intensivos. Las empresas frontera, definidas como el 10% superior de usuarios de IA empresarial, generaron 8,3 veces más tokens de salida por usuario activo que las empresas típicas.
Esa brecha era de 2,6 veces en enero, lo que muestra una diferencia creciente entre la adopción empresarial ordinaria y los usuarios más intensivos. Para junio, Codex, el agente de OpenAI para el desarrollo de software, producía el 64% de los tokens de salida combinados de Codex y ChatGPT entre los clientes empresariales.
Los usuarios activos semanales de Codex habían aumentado 108 veces en el sector legal desde febrero, frente a 41 veces en ventas y reclutamiento. Esta mezcla sugiere que el uso empresarial se expande más allá del chat hacia la programación, la creación de documentos, la investigación y otros flujos de trabajo de múltiples pasos.
OpenAI también informó que el 21% de los usuarios activos de las empresas frontera usaba Plugins semanalmente, frente al 9% en las empresas típicas. Esa diferencia refuerza el giro hacia sistemas capaces de usar herramientas, crear archivos y completar tareas, en lugar de solo responder preguntas.
Codex, Plugins y el almacenamiento en caché impulsan el cambio más allá del chat
Andreessen Horowitz, citando datos de OpenRouter, señaló que más del 85% del uso de tokens agénticos proviene ahora de prompts en caché. El almacenamiento en caché de prompts permite a los sistemas reutilizar contexto previamente procesado en lugar de recalcular entradas idénticas durante llamadas repetidas.
Según OpenAI, el almacenamiento en caché puede reducir la latencia y los costos de entrada, lo que abarata la operación de cargas de trabajo con contexto repetido. Como la inferencia generalmente se factura por token, reutilizar el contexto en lugar de recalcularlo afecta directamente el costo de las largas secuencias de llamadas repetitivas que ejecutan los agentes. Sin embargo, esas cargas de trabajo aún requieren infraestructura capaz de almacenar y reutilizar rápidamente contextos grandes junto con las GPU que gestionan la inferencia.
Esto aumenta la importancia de la capacidad de memoria y del ancho de banda a medida que las empresas delegan asignaciones más complejas a sistemas automatizados. El cambio también pone a prueba el software tradicional de flujos de trabajo.
A16z sostuvo que la creciente adopción de agentes podría presionar a los productos construidos en torno a pasos de automatización fijos, a medida que los usuarios adoptan sistemas que razonan a través de las tareas. Aun así, los cambios en el tráfico web por sí solos no prueban un desplazamiento, mientras que Zapier, Make y n8n —plataformas que conectan aplicaciones de negocio para automatizar tareas de múltiples pasos— también están añadiendo funciones de IA.
En general, los agentes de IA están generando más demanda de tokens a medida que el software empresarial ejecuta cadenas de trabajo más largas en nombre de los usuarios. A medida que ese patrón se expande, la IA empresarial se define cada vez menos por el volumen de chat y más por la cantidad de trabajo delegado al software, y las métricas ya visibles —la participación de los agentes en el tráfico de tokens, la brecha de salida de las empresas frontera y la proporción de prompts en caché— serán las que muestren hasta dónde llega.