Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

MODELOS DE FRONTERA

Alibaba lanza Qwen3.8-Max, un modelo abierto de 2.4 billones de parámetros

El gigante chino presentó Qwen3.8-Max, diseñado para ejecutar tareas complejas de forma autónoma durante días. En pruebas internas construyó software, reprodujo papers y administró un e-commerce simulado durante un año fiscal completo.

4 DE AGOSTO DE 20264 AGOLECTURA 4 MINREDACTADO POR IA
Alibaba lanza Qwen3.8-Max, un modelo abierto de 2.4 billones de parámetros
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Alibaba acaba de poner sobre la mesa un modelo que desafía la lógica predominante en IA: no se trata solo de responder prompts más rápido, sino de completar proyectos complejos de forma autónoma durante días o semanas. Qwen3.8-Max alcanza 2.4 billones de parámetros totales (95 mil millones activos por consulta) y es el primer modelo de la serie Qwen-Max cuyos pesos se liberarán públicamente la semana que viene, según informó The Decoder.

Lo notable no es solo el tamaño: el foco está en tareas de largo horizonte, esas que requieren planificación, iteración y ajustes a lo largo de cientos de interacciones. El equipo de Qwen presentó cinco casos de estudio que ponen a prueba esa capacidad, desde desarrollo de software hasta diseño de chips y gestión comercial.

Programó durante 16 días sin intervención humana

En el primer caso, Qwen3.8-Max construyó oh-my-cli, una herramienta de línea de comandos, trabajando de forma completamente autónoma durante 16 días. El modelo recibía solicitudes de usuarios, las convertía en issues de GitHub, se las asignaba a sí mismo, escribía el código, ejecutaba tests y mejoraba los resultados de forma iterativa. Al 30 de julio de 2026 acumulaba 265 commits, 127 pull requests y 151 issues, todo sin intervención humana.

En un segundo experimento, el modelo recibió el paper académico "Unified Data Selection for LLM Reasoning" pero sin código de partida. Su trabajo: reproducir los resultados y superarlos. En aproximadamente cinco días y 125 horas de cómputo, escribió 7,600 líneas de código y ejecutó 33 trabajos de entrenamiento en GPU. Primero replicó los seis resultados principales del paper. Luego testeó 18 ideas propias en cuatro rondas y superó el método original por 2.7 puntos en el benchmark de matemáticas AIME24.

De diseño de chips a simulación comercial de un año

Uno de los casos más llamativos involucra diseño de circuitos criptográficos. Qwen3.8-Max partió de un diseño funcional pero ineficiente que usaba 8,298 compuertas lógicas y lo redujo a 678 compuertas en unas 500 iteraciones. Tras un pase de layout automatizado con OpenROAD, el área física del chip se redujo de 106×106 a 46×46 micrómetros: 81% menos superficie. El equipo destaca que el modelo siguió haciendo cambios estructurales profundos incluso después de cientos de iteraciones, en lugar de conformarse con ajustes superficiales.

Pero quizás el test más ambicioso es E-Commerce-Bench, una simulación de un año fiscal completo en retail online basada en datos anonimizados de Taobao y Tmall. El modelo arranca con 100,000 yuanes de capital y debe administrar múltiples tiendas en paralelo: comprar productos, negociar con proveedores en lenguaje natural, ajustar precios, gestionar devoluciones y sortear crisis como tifones o disrupciones logísticas. Entre los proveedores simulados hay 152 estafadores que el modelo debe detectar.

Qwen3.8-Max cerró el año con 416,252 yuanes, cuadruplicando el capital inicial. Eso representa 38% más que el segundo lugar (GLM 5.2) y más del doble que su predecesor Qwen3.7-Max. Invirtió agresivamente en el primer semestre y capturó más de 100,000 yuanes de ganancia neta durante la temporada de fiestas.

Capacidades multimodales y benchmarks competitivos

En tareas multimodales, Qwen3.8-Max procesa documentos de más de 200 páginas y videos de más de 100 horas. El equipo también lanzó RecreationBench, un benchmark que requiere reconstruir aplicaciones funcionales sin acceso al código fuente, solo mediante observación e interacción (clicks y teclado) en Ubuntu, macOS, Windows, Android y web.

En las tablas de benchmarks internos publicadas por Alibaba, Qwen3.8-Max se ubica cerca o por encima de Claude Opus 4.8, Claude Fable 5 y GPT-5.6 Sol en múltiples categorías. En PaperBench alcanzó un score de 93, el más alto registrado hasta ahora.

Por qué importa

Que un modelo chino de pesos abiertos compita de igual a igual con los modelos propietarios occidentales de frontera cambia varias ecuaciones a la vez. Primero, democratiza el acceso a capacidades que hasta hace poco estaban reservadas para quienes podían pagar APIs premium o construir infraestructura propia a gran escala.

Segundo, redefine qué significa "modelo productivo". Si un LLM puede ejecutar proyectos de software de principio a fin, negociar con proveedores simulados o diseñar componentes de hardware de forma autónoma, la frontera entre herramienta de asistencia y agente económico se vuelve cada vez más difusa.

Para equipos que están evaluando cómo incorporar IA en operaciones reales —no solo en demos o prototipos—, la disponibilidad de modelos open-weight con estas capacidades significa que ya no dependen exclusivamente de proveedores cerrados para casos de uso complejos. Eso abre la puerta a personalizaciones profundas, auditorías de comportamiento y experimentos que serían imposibles con una API de caja negra.

#modelos abiertos#alibaba#qwen#tareas autónomas#open source

SEGUIR LA SEÑAL

VER TODO →