Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

HARDWARE PROPIO

OpenAI presenta Jalapeño: su chip de inferencia propio supera 3× en latencia

El primer chip personalizado de OpenAI para inferencia muestra hasta 3.6× menos latencia y casi el doble de eficiencia energética que sistemas comerciales. Funciona con modelos propios y de terceros, incluyendo DeepSeek R1.

26 DE AGOSTO DE 2026HACE 2 DÍASLECTURA 4 MINREDACTADO POR IA
OpenAI presenta Jalapeño: su chip de inferencia propio supera 3× en latencia
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

OpenAI publicó los primeros benchmarks de Jalapeño, su chip de inferencia personalizado, mostrando avances significativos en velocidad y eficiencia energética. Según OpenAI, el chip entrega entre 1.5 y 1.9 veces más trabajo de IA por watt en throughput máximo y entre 1.7 y 3.6 veces menor latencia end-to-end comparado con sistemas comerciales líderes. Los resultados cubren modelos desarrollados dentro y fuera de la compañía, incluyendo GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T.

Qué muestra el benchmark público

OpenAI evaluó Jalapeño usando InferenceX, un benchmark público de SemiAnalysis que mide el proceso completo de servir una solicitud de IA. La comparación se hizo contra sistemas comerciales disponibles en diferentes escenarios de uso, desde alto throughput hasta cargas interactivas de baja latencia.

En Kimi K2.5 1T, el modelo público más grande testeado, Jalapeño entregó aproximadamente 1.5× mayor rendimiento pico por watt y 3.4× menor latencia end-to-end que el sistema de comparación. Para cargas altamente interactivas —críticas en agentes que ejecutan múltiples pasos en secuencia— el chip logró entre 2.1 y 4.1 veces más rendimiento.

OpenAI normalizó los resultados usando el rating de potencia publicado de cada acelerador. Jalapeño está especificado en 700 watts, aunque en las pruebas su consumo sostenido se mantuvo en o bajo 550 watts.

Arquitectura diseñada para inferencia de lenguaje

Jalapeño fue concebido preguntándose qué hardware sería óptimo si su trabajo principal fuera servir modelos de lenguaje modernos y futuros, especialmente agentes interactivos. La inferencia en modelos de lenguaje pasa por fases distintas: prefill (procesamiento del prompt, intensivo en cómputo) y decode (generación token por token, limitado por ancho de banda de memoria).

El chip minimiza el movimiento de datos y los retrasos de comunicación. El estado del modelo, incluyendo el KV cache usado durante la generación de respuestas, puede mantenerse local mientras el sistema activa la combinación correcta de cómputo, memoria y red para cada fase.

La red es integral a la arquitectura: su gran dominio permite que toda la carga de trabajo permanezca dentro de un sistema conectado, minimizando movimiento de datos y manteniendo la solicitud completa rápida y eficiente de principio a fin. El resultado es un acelerador balanceado que puede soportar arquitecturas de modelos cambiantes y adaptarse conforme cambia el balance entre prefill y decode —característica definitoria de cargas de trabajo agénticas.

IA ayudó a diseñar el chip

Los propios modelos de OpenAI aceleraron el desarrollo de Jalapeño. Generaciones anteriores ayudaron al equipo a diseñar y levantar el chip; los modelos más recientes están acelerando cómo lo optimizan y programan. Esto permitió ir de diseño inicial a tapeout en nueve meses, explorando implementaciones y acortando ciclos de diseño, medición y verificación.

En pruebas internas, la ventaja de Jalapeño se amplió aún más con modelos frontier de OpenAI, sugiriendo que la arquitectura se vuelve más valiosa conforme las cargas de trabajo crecen en tamaño y exigencia.

Por qué importa

Jalapeño representa un cambio hacia el control vertical del stack completo de IA: modelos, productos, software de serving, chips, memoria, networking y sistemas diseñados juntos. Ese enfoque integrado permite usar lo aprendido de cargas de trabajo reales para mejorar cada capa.

Para usuarios finales, esto puede traducirse en respuestas más rápidas, agentes más responsivos y acceso más confiable conforme crece la demanda. Para empresas que están adoptando IA, es una señal de que la eficiencia en inferencia —no solo en entrenamiento— se está convirtiendo en una ventaja competitiva medible.

OpenAI describe Jalapeño como el inicio de una plataforma multigeneracional. En los meses que vienen planean escalarlo para entregar productos más rápidos, capaces y eficientes. Si esas mejoras se trasladan a precio o capacidad, puede cambiar la economía de desplegar agentes y aplicaciones interactivas a escala.

#jalapeño#openai#chips#inferencia#hardware

SEGUIR LA SEÑAL

VER TODO →