MODELOS DE IA
x.ai lanza Grok 4.6, el modelo que iguala a GPT-5.6 en benchmarks de agentes
Grok 4.6 empata con GPT-5.6 Sol en el índice AA Intelligence y supera a Fable 5 Max en varios benchmarks de código. x.ai lo posiciona como alternativa a US$2/millón de tokens de entrada, mientras expande capacidades en agentes de larga duración.

x.ai lanzó hoy Grok 4.6, su modelo de lenguaje más avanzado, con foco en agentes de larga duración y trabajo visual e interactivo. Según la publicación oficial, iguala a GPT-5.6 Sol en el AA Intelligence Index —un índice compuesto de nueve benchmarks— con 61 puntos, y compite directamente con Fable 5 Max de Anthropic en varias métricas de código y trabajo técnico.
El modelo está disponible desde hoy en Cursor, Grok Build y vía API, con precios desde US$2 por millón de tokens de entrada y US$6 por millón de salida, la mitad que la variante rápida. x.ai ofrece el doble de uso incluido durante la primera semana en Grok Build y Cursor.
Rendimiento en benchmarks
Grok 4.6 muestra mejoras consistentes frente a su predecesor (Grok 4.5) y se ubica entre los mejores modelos del mercado en tareas de código y agentes:
- AA Intelligence Index: 61 (mismo que GPT-5.6 Sol, debajo de Fable 5 Max con 62)
- GDPVal-AA v2: 1753 (vs. 1728 de GPT-5.6 Sol)
- CursorBench v3.2: 69,9% (supera a GPT-5.6 Sol con 67,2%, detrás de Fable 5 Max con 70,5%)
- DeepSWE v1.1: 65,9% (debajo de GPT-5.6 Sol con 73% y Fable 5 Max con 70%)
- FrontierCode v1.1 Extended: 61,3% (supera a GPT-5.6 Sol con 60,6%)
En APEX-Agents, un benchmark de agentes multi-paso, Grok 4.6 alcanza 57,5%, mejorando 10 puntos porcentuales frente a Grok 4.5 (47,1%) pero quedando debajo de Fable 5 Max (59,2%).
Entrenamiento y arquitectura
x.ai extendió el proceso de entrenamiento suplementario de Grok 4.6 con datos generados por modelo para razonamiento y conceptos técnicos avanzados, datos de ingeniería de alta calidad, y un optimizador mejorado. Luego usó Grok 4.5 para regenerar las trayectorias de supervised fine-tuning (SFT) en dominios como STEM, ingeniería de software y trabajo de conocimiento, filtrando trazas problemáticas con controles basados en modelo.
La fase de reinforcement learning (RL) cubrió tareas agénticas en optimización de kernels, desarrollo web, diseño asistido por computadora y otros entornos específicos. Según x.ai, el modelo muestra auto-verificación en trayectorias largas, revisando su propio trabajo antes de avanzar.
Aplicaciones y seguridad
x.ai destaca que Grok 4.6 convierte ideas de producto amplias en versiones funcionales: investiga dominios desconocidos, estructura la aplicación, implementa interacciones clave y refina el resultado en varias rondas de feedback. El modelo produce primeras versiones más sólidas en proyectos visuales e interactivos que Grok 4.5.
La compañía afirma haber calibrado las salvaguardas en línea con las capacidades expandidas, con foco en maximizar utilidad y seguridad en casos de uso legítimos como parcheo de vulnerabilidades, ciclos de diseño ingenieril y asistencia a investigación en IA. x.ai realizó su suite más amplia de testing pre-despliegue y tercerización de pruebas.
Por qué importa
Grok 4.6 refuerza la tendencia de commoditización en LLMs de frontera: un modelo que empata con GPT-5.6 Sol en el índice compuesto principal a la mitad del precio de referencia de OpenAI marca presión a la baja en costos de inferencia. Para empresas que evalúan plataformas de IA, esto amplía el menú de alternativas técnicamente competitivas más allá de OpenAI y Anthropic.
El énfasis en agentes de larga duración es estratégico. Los casos de uso más valiosos en producto y desarrollo —generar aplicaciones completas, investigar dominios, refinar diseños— requieren modelos que mantengan coherencia y calidad en decenas o cientos de pasos. Grok 4.6 compite directamente en ese terreno, donde los benchmarks tradicionales de respuesta única subestiman la utilidad real.
Para equipos técnicos que construyen sobre LLMs, la ecuación costo-rendimiento de Grok 4.6 en tareas de código (CursorBench, FrontierCode) lo convierte en candidato natural para pruebas de concepto y cargas de trabajo de desarrollo. La disponibilidad inmediata en Cursor y via API (además de OpenRouter, Vercel, Cloudflare) reduce la fricción de adopción. La pregunta es si x.ai puede sostener paridad técnica en el próximo ciclo de lanzamientos, cuando OpenAI y Anthropic actualicen sus modelos tope.
// FUENTES
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.