MODELOS MULTIMODALES
Deepseek lanza Flash Vision, un modelo experimental que iguala a Opus 4.8
La firma china Deepseek presentó V4-Flash-Vision-Exp, su primer modelo con capacidad de visión. En benchmarks internos de agentes, alcanza el rendimiento de Claude Opus 4.8. Procesa hasta 600 imágenes por request.

Deepseek lanzó V4-Flash-Vision-Exp, un modelo multimodal experimental que suma visión a su línea Flash. Según The Decoder, en los benchmarks internos de la compañía el modelo alcanza un rendimiento muy cercano a Claude Opus 4.8 en tareas de agentes, posicionándose como alternativa directa en aplicaciones que combinan razonamiento visual y uso de herramientas.
Qué hace diferente a Flash Vision
El modelo extiende Deepseek-V4-Flash con procesamiento de imágenes sin sacrificar el rendimiento en texto, razonamiento y conocimiento general de la versión base. Está diseñado específicamente para workflows de agentes: describe imágenes, extrae texto de capturas de pantalla, analiza diagramas y opera con distintos frameworks.
Soporta JPEG, PNG, GIF y WebP, y determina el formato real del archivo en lugar de confiar en la extensión o el MIME type declarado. La normalización automática lleva las imágenes a aproximadamente 800 × 800 píxeles según el aspect ratio, y cada imagen consume como máximo 384 tokens, independientemente de la resolución original.
Integración y límites técnicos
Flash Vision es compatible con las APIs de Chat Completions de OpenAI y el endpoint Messages de Anthropic. Deepseek liberó también la versión 0.1.1 de su framework Harness, que soporta el modelo desde el lanzamiento.
Las imágenes se pueden enviar de tres formas: embebidas en Base64, mediante URL pública (hasta 32 MiB) o a través de la nueva Files API gratuita, que permite subir un archivo una vez y referenciarlo por ID en múltiples requests con límite de 64 MiB. Un campo opcional «detail» reduce la imagen a 512 × 512 píxeles cuando no se necesita alta resolución.
Una request puede incluir hasta 600 imágenes. El tamaño máximo por lado es de 8.192 píxeles, que baja a 4.096 píxeles si la request contiene 15 o más imágenes. Las imágenes solo van en mensajes de usuario. El pricing sigue las tarifas de V4-Flash.
Por qué importa
La paridad con Opus 4.8 en benchmarks de agentes muestra que los modelos chinos ya compiten de igual a igual en capacidades multimodales avanzadas, no solo en texto. Esto redistribuye opciones para equipos que construyen agentes visuales o automatizan workflows que involucran capturas, diagramas o interfaces gráficas.
Para empresas que evalúan infraestructura de IA, la combinación de precio competitivo, límites generosos (600 imágenes por request) y compatibilidad con APIs estándar hace que Flash Vision sea una alternativa concreta frente a modelos occidentales, especialmente en aplicaciones donde el costo por token de imagen pesa.
La velocidad de iteración —modelo experimental público en menos de un mes desde V4-Flash— también señala que el ciclo de desarrollo en visión está acelerando, y que las empresas que adoptan IA van a tener que revisar sus stacks con mayor frecuencia.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.