Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

MODELOS DE IA

x.ai lanza Grok 4.6, el modelo que iguala a GPT-5.6 en benchmarks de agentes

Grok 4.6 empata con GPT-5.6 Sol en el índice AA Intelligence y supera a Fable 5 Max en varios benchmarks de código. x.ai lo posiciona como alternativa a US$2/millón de tokens de entrada, mientras expande capacidades en agentes de larga duración.

13 DE AGOSTO DE 202613 AGOLECTURA 3 MINREDACTADO POR IA
x.ai lanza Grok 4.6, el modelo que iguala a GPT-5.6 en benchmarks de agentes
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

x.ai lanzó hoy Grok 4.6, su modelo de lenguaje más avanzado, con foco en agentes de larga duración y trabajo visual e interactivo. Según la publicación oficial, iguala a GPT-5.6 Sol en el AA Intelligence Index —un índice compuesto de nueve benchmarks— con 61 puntos, y compite directamente con Fable 5 Max de Anthropic en varias métricas de código y trabajo técnico.

El modelo está disponible desde hoy en Cursor, Grok Build y vía API, con precios desde US$2 por millón de tokens de entrada y US$6 por millón de salida, la mitad que la variante rápida. x.ai ofrece el doble de uso incluido durante la primera semana en Grok Build y Cursor.

Rendimiento en benchmarks

Grok 4.6 muestra mejoras consistentes frente a su predecesor (Grok 4.5) y se ubica entre los mejores modelos del mercado en tareas de código y agentes:

  • AA Intelligence Index: 61 (mismo que GPT-5.6 Sol, debajo de Fable 5 Max con 62)
  • GDPVal-AA v2: 1753 (vs. 1728 de GPT-5.6 Sol)
  • CursorBench v3.2: 69,9% (supera a GPT-5.6 Sol con 67,2%, detrás de Fable 5 Max con 70,5%)
  • DeepSWE v1.1: 65,9% (debajo de GPT-5.6 Sol con 73% y Fable 5 Max con 70%)
  • FrontierCode v1.1 Extended: 61,3% (supera a GPT-5.6 Sol con 60,6%)

En APEX-Agents, un benchmark de agentes multi-paso, Grok 4.6 alcanza 57,5%, mejorando 10 puntos porcentuales frente a Grok 4.5 (47,1%) pero quedando debajo de Fable 5 Max (59,2%).

Entrenamiento y arquitectura

x.ai extendió el proceso de entrenamiento suplementario de Grok 4.6 con datos generados por modelo para razonamiento y conceptos técnicos avanzados, datos de ingeniería de alta calidad, y un optimizador mejorado. Luego usó Grok 4.5 para regenerar las trayectorias de supervised fine-tuning (SFT) en dominios como STEM, ingeniería de software y trabajo de conocimiento, filtrando trazas problemáticas con controles basados en modelo.

La fase de reinforcement learning (RL) cubrió tareas agénticas en optimización de kernels, desarrollo web, diseño asistido por computadora y otros entornos específicos. Según x.ai, el modelo muestra auto-verificación en trayectorias largas, revisando su propio trabajo antes de avanzar.

Aplicaciones y seguridad

x.ai destaca que Grok 4.6 convierte ideas de producto amplias en versiones funcionales: investiga dominios desconocidos, estructura la aplicación, implementa interacciones clave y refina el resultado en varias rondas de feedback. El modelo produce primeras versiones más sólidas en proyectos visuales e interactivos que Grok 4.5.

La compañía afirma haber calibrado las salvaguardas en línea con las capacidades expandidas, con foco en maximizar utilidad y seguridad en casos de uso legítimos como parcheo de vulnerabilidades, ciclos de diseño ingenieril y asistencia a investigación en IA. x.ai realizó su suite más amplia de testing pre-despliegue y tercerización de pruebas.

Por qué importa

Grok 4.6 refuerza la tendencia de commoditización en LLMs de frontera: un modelo que empata con GPT-5.6 Sol en el índice compuesto principal a la mitad del precio de referencia de OpenAI marca presión a la baja en costos de inferencia. Para empresas que evalúan plataformas de IA, esto amplía el menú de alternativas técnicamente competitivas más allá de OpenAI y Anthropic.

El énfasis en agentes de larga duración es estratégico. Los casos de uso más valiosos en producto y desarrollo —generar aplicaciones completas, investigar dominios, refinar diseños— requieren modelos que mantengan coherencia y calidad en decenas o cientos de pasos. Grok 4.6 compite directamente en ese terreno, donde los benchmarks tradicionales de respuesta única subestiman la utilidad real.

Para equipos técnicos que construyen sobre LLMs, la ecuación costo-rendimiento de Grok 4.6 en tareas de código (CursorBench, FrontierCode) lo convierte en candidato natural para pruebas de concepto y cargas de trabajo de desarrollo. La disponibilidad inmediata en Cursor y via API (además de OpenRouter, Vercel, Cloudflare) reduce la fricción de adopción. La pregunta es si x.ai puede sostener paridad técnica en el próximo ciclo de lanzamientos, cuando OpenAI y Anthropic actualicen sus modelos tope.

#grok#x.ai#modelos de lenguaje#benchmarks#agentes de ia

SEGUIR LA SEÑAL

VER TODO →