HARDWARE DE IA
Cerebras duplica el rendimiento de su chip WSE-3 con el nuevo acelerador CS-4
La empresa presentó el CS-4, un sistema rack que entrega el doble de velocidad que su predecesor sin cambiar de chip: más frecuencia de reloj, mejor refrigeración y tres wafers por rack en lugar de dos. Cerebras afirma superar en 30× a configuraciones con GPUs de Nvidia.

Cerebras lanzó su acelerador CS-4, un sistema de IA a escala de rack completo que duplica el rendimiento del CS-3 anterior sin modificar el chip de base. El CEO Andrew Feldman lo presentó como el sistema más rápido de la industria, y la compañía lo posiciona como alternativa directa a las configuraciones basadas en GPUs de Nvidia.
Mismo chip, doble rendimiento
El CS-4 sigue usando el WSE-3 de 5 nm, pero logra el salto de velocidad aumentando la frecuencia de reloj mediante mayor potencia y refrigeración optimizada. Cada rack ahora integra tres wafers en lugar de dos y alcanza hasta 4.400 tokens por segundo por usuario, según The Decoder.
Cerebras afirma que esa cifra representa hasta 30 veces más velocidad que configuraciones equivalentes sobre GPUs de Nvidia. La capacidad de memoria se mantiene en 44 GB por wafer.
El sistema llega como producto rack-scale: un gabinete servidor completo que se instala en el data center como una sola unidad, con cómputo, alimentación y refrigeración integrados.
Arquitectura modular y socios de inferencia
El CS-4 introduce un diseño modular denominado «Backpack», pensado para acelerar el ensamblaje. Además, Cerebras incorpora inferencia desagregada mediante alianzas con AMD y AWS Trainium.
Analistas de SemiAnalysis califican las mejoras de networking como modestas. Se esperan más detalles técnicos en la conferencia Hot Chips.
Entre los casos de uso confirmados está Codex Spark de OpenAI, que ya corre sobre hardware de Cerebras.
Por qué importa
Duplicar el throughput sin rediseñar el chip demuestra que queda margen para exprimir eficiencia de la arquitectura wafer-scale de Cerebras. Para los operadores de infraestructura, ese salto puede traducirse en menor costo por token y en reducción de latencia sin cambiar el footprint físico de los racks.
La estrategia de inferencia desagregada con socios como AMD y AWS Trainium abre la puerta a configuraciones híbridas que combinen el throughput de Cerebras con la flexibilidad de otros aceleradores, ampliando el rango de cargas de trabajo que una empresa puede soportar sin multiplicar proveedores.
Si Cerebras logra mantener la curva de mejora por generación —y escalar producción— el panorama de proveedores de cómputo de IA podría volverse más competitivo justo cuando los modelos grandes empiezan a saturar la capacidad disponible de GPU.
SEGUIR LA SEÑAL
VER TODO →Google lanza Gemini Enterprise for Legal para automatizar contratos
La nueva versión de Gemini se integra con plataformas como iManage, NetDocuments y DocuSign para revisar contratos, realizar investigación jurídica y rastrear cambios regulatorios en estudios y departamentos legales.
Mojo lanza su compilador como open source tras tres años de desarrollo
El lenguaje de programación optimizado para GPU cumplió su promesa de 2023 y liberó compilador y toolchain bajo licencia Apache 2. Ya no busca ser un superset de Python, sino una alternativa propia con sintaxis inspirada.
Anthropic publica los system prompts completos que usa Claude en su interfaz web
Anthropic acaba de documentar públicamente los prompts de sistema que Claude usa en claude.ai y sus apps móviles. La compañía actualiza estas instrucciones periódicamente para mejorar las respuestas, pero aclara que los cambios no afectan a la API.