ECONOMÍA DE MODELOS
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.

El 6 de febrero de 2026 podría haber sido el último día en que los humanos consumieron más tokens que los agentes de IA. Según el análisis de Peter Walker, de OpenRouter, desde esa fecha el consumo de tokens por parte de agentes autónomos se multiplicó por 14, mientras que el uso humano creció apenas 2,8 veces. Los agentes de IA se están convirtiendo en los principales clientes de la infraestructura de IA.
Salto exponencial en consumo agéntico
Desde febrero de 2026, el consumo de tokens por agentes en OpenRouter pasó de 0,51 billones (trillions) a 7,3 billones, un aumento de aproximadamente 14 veces. El uso humano, en el mismo período, creció solo 2,8 veces. Esta disparidad revela que los agentes funcionan de forma cada vez más autónoma durante períodos más largos, generando procesos adicionales de IA en el camino.
Sin embargo, casi el 70% del uso agéntico proviene de prompts cacheados, que se facturan a tasas mucho menores. Esto significa que los costos reales no están creciendo tan rápido como sugieren las cifras brutas de tokens, según reporta The Decoder.
Modelos open-weight y tendencia general
OpenRouter tiene un sesgo hacia modelos de pesos abiertos (open-weight), que tienden a ser menos eficientes en tokens que los modelos de OpenAI o Anthropic. Aun así, Walker sugiere que la tendencia probablemente sea similar en los grandes laboratorios.
La inflación de tokens ya había comenzado con los modelos de razonamiento, que "piensan" más tiempo antes de responder incluso cuando no deberían. Ahora, con agentes que orquestan múltiples llamadas a modelos, el patrón se acelera.
Por qué importa
Esta inversión en la dinámica de consumo marca un cambio estructural: la IA se está convirtiendo en su propio mercado más grande. Los agentes autónomos no solo usan más infraestructura, sino que la usan de forma distinta: cadenas largas, llamadas recursivas, cacheo masivo.
Para empresas que están implementando sistemas agénticos, esto tiene implicaciones directas en arquitectura y costos. El cacheo eficiente se vuelve crítico: puede representar la diferencia entre un proyecto viable y uno que explota el presupuesto. También plantea preguntas sobre pricing: los modelos de facturación actuales se diseñaron pensando en usuarios humanos, no en agentes que llaman a otros agentes miles de veces por minuto.
Si esta curva continúa, estamos entrando en una economía de IA donde los principales clientes de infraestructura de modelos ya no son personas escribiendo prompts, sino sistemas autónomos coordinando workflows complejos. Eso cambia todo: desde cómo se optimizan los modelos hasta cómo se piensan los límites de rate y las políticas de uso.
// FUENTES
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Inherent dice que su IA 'compañera' supera a Anthropic y OpenAI en replicar papers científicos
La startup británica de ex-DeepMind afirma que su agente Faraday replicó hallazgos científicos mejor que Claude Opus 4.8 y GPT-5.5, usando un modelo 100 veces más chico y apostando a reinforcement learning en vez de escala bruta.