Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

MODELOS MULTIMODALES

Deepseek lanza Flash Vision, un modelo experimental que iguala a Opus 4.8

La firma china Deepseek presentó V4-Flash-Vision-Exp, su primer modelo con capacidad de visión. En benchmarks internos de agentes, alcanza el rendimiento de Claude Opus 4.8. Procesa hasta 600 imágenes por request.

22 DE AGOSTO DE 2026HACE 6 DÍASLECTURA 3 MINREDACTADO POR IA
Deepseek lanza Flash Vision, un modelo experimental que iguala a Opus 4.8
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Deepseek lanzó V4-Flash-Vision-Exp, un modelo multimodal experimental que suma visión a su línea Flash. Según The Decoder, en los benchmarks internos de la compañía el modelo alcanza un rendimiento muy cercano a Claude Opus 4.8 en tareas de agentes, posicionándose como alternativa directa en aplicaciones que combinan razonamiento visual y uso de herramientas.

Qué hace diferente a Flash Vision

El modelo extiende Deepseek-V4-Flash con procesamiento de imágenes sin sacrificar el rendimiento en texto, razonamiento y conocimiento general de la versión base. Está diseñado específicamente para workflows de agentes: describe imágenes, extrae texto de capturas de pantalla, analiza diagramas y opera con distintos frameworks.

Soporta JPEG, PNG, GIF y WebP, y determina el formato real del archivo en lugar de confiar en la extensión o el MIME type declarado. La normalización automática lleva las imágenes a aproximadamente 800 × 800 píxeles según el aspect ratio, y cada imagen consume como máximo 384 tokens, independientemente de la resolución original.

Integración y límites técnicos

Flash Vision es compatible con las APIs de Chat Completions de OpenAI y el endpoint Messages de Anthropic. Deepseek liberó también la versión 0.1.1 de su framework Harness, que soporta el modelo desde el lanzamiento.

Las imágenes se pueden enviar de tres formas: embebidas en Base64, mediante URL pública (hasta 32 MiB) o a través de la nueva Files API gratuita, que permite subir un archivo una vez y referenciarlo por ID en múltiples requests con límite de 64 MiB. Un campo opcional «detail» reduce la imagen a 512 × 512 píxeles cuando no se necesita alta resolución.

Una request puede incluir hasta 600 imágenes. El tamaño máximo por lado es de 8.192 píxeles, que baja a 4.096 píxeles si la request contiene 15 o más imágenes. Las imágenes solo van en mensajes de usuario. El pricing sigue las tarifas de V4-Flash.

Por qué importa

La paridad con Opus 4.8 en benchmarks de agentes muestra que los modelos chinos ya compiten de igual a igual en capacidades multimodales avanzadas, no solo en texto. Esto redistribuye opciones para equipos que construyen agentes visuales o automatizan workflows que involucran capturas, diagramas o interfaces gráficas.

Para empresas que evalúan infraestructura de IA, la combinación de precio competitivo, límites generosos (600 imágenes por request) y compatibilidad con APIs estándar hace que Flash Vision sea una alternativa concreta frente a modelos occidentales, especialmente en aplicaciones donde el costo por token de imagen pesa.

La velocidad de iteración —modelo experimental público en menos de un mes desde V4-Flash— también señala que el ciclo de desarrollo en visión está acelerando, y que las empresas que adoptan IA van a tener que revisar sus stacks con mayor frecuencia.

#deepseek#modelos multimodales#agentes#visión por computadora#benchmarks

SEGUIR LA SEÑAL

VER TODO →