MODELOS OPEN SOURCE
DeepSeek V4 Flash iguala a GPT-5.6 Luna con 60% menos de costo
El nuevo modelo de razonamiento de DeepSeek alcanza 50 puntos en el Intelligence Index —mismo nivel que los líderes propietarios— a $0.14 por millón de tokens de entrada. Con pesos abiertos bajo licencia MIT y 284B parámetros totales.

DeepSeek lanzó en julio de 2026 la versión V4 Flash 0731, un modelo de razonamiento con pesos abiertos que alcanza 50 puntos en el Artificial Analysis Intelligence Index, ubicándose en el puesto 3 de 101 modelos evaluados. Según el análisis publicado por Artificial Analysis, ese score lo pone a la par de los modelos propietarios más avanzados, pero a una fracción del precio habitual: $0.14 por millón de tokens de entrada y $0.28 por millón de salida.
Arquitectura y capacidades
El modelo cuenta con 284B parámetros totales y activa 13B por token durante la inferencia. Soporta ventanas de contexto de 1M tokens (equivalente a ~1500 páginas A4) y genera únicamente texto a partir de entradas de texto. Los pesos están disponibles en Hugging Face bajo licencia MIT, lo que permite uso comercial sin restricciones mayores.
En los nueve benchmarks que componen el Intelligence Index v4.1 —incluyendo GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, GPQA Diamond y Humanity's Last Exam— DeepSeek V4 Flash superó ampliamente la mediana de 25 puntos de modelos comparables. Durante la evaluación generó 210M tokens, una verbosidad alta frente a la mediana de 100M.
Precio competitivo en su clase
El costo total de ejecutar el Intelligence Index sobre este modelo fue de $72.02. En comparación, la mediana de precios de entrada para modelos de similar inteligencia es $0.43 por millón de tokens (DeepSeek cobra $0.14) y la de salida es $1.20 (DeepSeek cobra $0.28). Eso representa un ahorro de ~67% en entrada y ~77% en salida.
Artificial Analysis ubica a DeepSeek V4 Flash en el puesto 22 de 101 en precio, clasificándolo como «competitively priced». Además, el modelo ofrece cache hit a $0.003 por millón de tokens (98% de descuento), el precio más bajo en esa métrica entre los modelos listados.
Por qué importa
La aparición de un modelo open source que empata en inteligencia con los líderes propietarios, mientras cobra menos de un tercio del precio promedio, cambia la ecuación de adopción. Para equipos que están evaluando LLMs en producción —especialmente en latitudes donde el precio del token pesa fuerte en el P&L— tener acceso a pesos bajo MIT significa control total del deployment, latencia y privacidad.
Si tu stack ya incluye modelos de razonamiento para tareas complejas (análisis de documentos largos, troubleshooting técnico, síntesis de datasets), DeepSeek V4 Flash es una alternativa seria que podés hostear o consumir vía API sin quedar atado a un proveedor propietario. La ventana de 1M tokens es otro diferencial: procesás contratos, transcripciones o repositorios completos sin partir el contexto.
En un mercado donde OpenAI, Anthropic y Google dominan por benchmark, un jugador chino que publica pesos completos y bate récords de eficiencia obliga a toda la industria a recalibrar precio y accesibilidad. Para empresas de habla hispana que recién empiezan a escalar IA, esto significa que la barrera de entrada técnica y financiera acaba de bajar un escalón más.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.