HARDWARE PROPIO
OpenAI presenta Jalapeño: su chip de inferencia propio supera 3× en latencia
El primer chip personalizado de OpenAI para inferencia muestra hasta 3.6× menos latencia y casi el doble de eficiencia energética que sistemas comerciales. Funciona con modelos propios y de terceros, incluyendo DeepSeek R1.

OpenAI publicó los primeros benchmarks de Jalapeño, su chip de inferencia personalizado, mostrando avances significativos en velocidad y eficiencia energética. Según OpenAI, el chip entrega entre 1.5 y 1.9 veces más trabajo de IA por watt en throughput máximo y entre 1.7 y 3.6 veces menor latencia end-to-end comparado con sistemas comerciales líderes. Los resultados cubren modelos desarrollados dentro y fuera de la compañía, incluyendo GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T.
Qué muestra el benchmark público
OpenAI evaluó Jalapeño usando InferenceX, un benchmark público de SemiAnalysis que mide el proceso completo de servir una solicitud de IA. La comparación se hizo contra sistemas comerciales disponibles en diferentes escenarios de uso, desde alto throughput hasta cargas interactivas de baja latencia.
En Kimi K2.5 1T, el modelo público más grande testeado, Jalapeño entregó aproximadamente 1.5× mayor rendimiento pico por watt y 3.4× menor latencia end-to-end que el sistema de comparación. Para cargas altamente interactivas —críticas en agentes que ejecutan múltiples pasos en secuencia— el chip logró entre 2.1 y 4.1 veces más rendimiento.
OpenAI normalizó los resultados usando el rating de potencia publicado de cada acelerador. Jalapeño está especificado en 700 watts, aunque en las pruebas su consumo sostenido se mantuvo en o bajo 550 watts.
Arquitectura diseñada para inferencia de lenguaje
Jalapeño fue concebido preguntándose qué hardware sería óptimo si su trabajo principal fuera servir modelos de lenguaje modernos y futuros, especialmente agentes interactivos. La inferencia en modelos de lenguaje pasa por fases distintas: prefill (procesamiento del prompt, intensivo en cómputo) y decode (generación token por token, limitado por ancho de banda de memoria).
El chip minimiza el movimiento de datos y los retrasos de comunicación. El estado del modelo, incluyendo el KV cache usado durante la generación de respuestas, puede mantenerse local mientras el sistema activa la combinación correcta de cómputo, memoria y red para cada fase.
La red es integral a la arquitectura: su gran dominio permite que toda la carga de trabajo permanezca dentro de un sistema conectado, minimizando movimiento de datos y manteniendo la solicitud completa rápida y eficiente de principio a fin. El resultado es un acelerador balanceado que puede soportar arquitecturas de modelos cambiantes y adaptarse conforme cambia el balance entre prefill y decode —característica definitoria de cargas de trabajo agénticas.
IA ayudó a diseñar el chip
Los propios modelos de OpenAI aceleraron el desarrollo de Jalapeño. Generaciones anteriores ayudaron al equipo a diseñar y levantar el chip; los modelos más recientes están acelerando cómo lo optimizan y programan. Esto permitió ir de diseño inicial a tapeout en nueve meses, explorando implementaciones y acortando ciclos de diseño, medición y verificación.
En pruebas internas, la ventaja de Jalapeño se amplió aún más con modelos frontier de OpenAI, sugiriendo que la arquitectura se vuelve más valiosa conforme las cargas de trabajo crecen en tamaño y exigencia.
Por qué importa
Jalapeño representa un cambio hacia el control vertical del stack completo de IA: modelos, productos, software de serving, chips, memoria, networking y sistemas diseñados juntos. Ese enfoque integrado permite usar lo aprendido de cargas de trabajo reales para mejorar cada capa.
Para usuarios finales, esto puede traducirse en respuestas más rápidas, agentes más responsivos y acceso más confiable conforme crece la demanda. Para empresas que están adoptando IA, es una señal de que la eficiencia en inferencia —no solo en entrenamiento— se está convirtiendo en una ventaja competitiva medible.
OpenAI describe Jalapeño como el inicio de una plataforma multigeneracional. En los meses que vienen planean escalarlo para entregar productos más rápidos, capaces y eficientes. Si esas mejoras se trasladan a precio o capacidad, puede cambiar la economía de desplegar agentes y aplicaciones interactivas a escala.
// FUENTES
SEGUIR LA SEÑAL
VER TODO →Anthropic lanza un estándar para que agentes de IA operen equipamiento físico
El Model Hardware Standard (MHS) permite que agentes como Claude controlen microscopios, brazos robóticos y otros dispositivos de laboratorio sin integraciones custom. Lo que antes tomaba semanas ahora lleva minutos.
LLMs podrían explotar sus propios motores de inferencia para tomar control
Una investigación revela cómo modelos de lenguaje maliciosos podrían ejecutar código arbitrario en las máquinas GPU que los alojan, explotando bugs en vLLM y otros motores de inferencia. El ataque no requiere acceso externo.
Los laboratorios de IA de frontera aún no dicen cómo contener un modelo fuera de control
Ninguna de las principales empresas de IA tiene un plan público sobre qué hacer si un modelo autónomo intenta eludir controles humanos. OpenAI lidera en transparencia; Anthropic y Meta quedan últimos en un estudio independiente que expone el vacío en protocolos de contención.