SAN FRANCISCO, 18 de agosto de 2026, 20:13 PDT — Cerebras Systems (NASDAQ:CBRS) presentó el CS-4, un rack de IA de tres obleas que ofrece 750 petaflops sparse-FP16. Los primeros envíos están programados para este trimestre.
- CS-4 proporciona seis veces la capacidad de cómputo declarada de un sistema CS-3.
- Cada WSE-3 Turbo duplica el cómputo y el ancho de banda de memoria por oblea.
- No se revelaron los precios ni los benchmarks de producción independientes.
El aumento de seis veces en el rack proviene de dos cambios. Cada oblea es el doble de rápida, mientras que el nuevo diseño Nexus agrupa tres motores de oblea en un solo rack de potencia activa.
Eso es importante para los agentes de IA, donde cada paso de razonamiento añade retraso. Cerebras dice que el CS-4 puede dedicar más cómputo a la verificación y uso de herramientas sin hacer que los usuarios esperen más tiempo.
| Especificación del sistema | CS-3 | CS-4 | Cambio |
|---|---|---|---|
| Motores de oblea por sistema | 1 WSE-3 | 3 WSE-3 Turbo | Triple cantidad |
| Cómputo de IA | 125 PFLOPS | 750 PFLOPS | 6x |
| Ancho de banda de memoria | 21.6 PB/s | 129.6 PB/s | 6x |
| Ancho de banda de la red interna | 26.7 PB/s | 160.5 PB/s | Aproximadamente 6x |
| Ancho de banda de E/S del sistema | 1.2 Tbit/s | 7.2 Tbit/s | 6x |
| Latencia de E/S | 5 microsegundos | Tan bajo como 2 microsegundos | 60% menor |
El WSE-3 Turbo mantiene los cuatro billones de transistores, 900,000 núcleos y 44GB de SRAM de la oblea anterior. Cerebras en su lugar aumenta la velocidad de operación mediante una entrega de energía más cercana y un ensamblaje rediseñado de refrigeración, E/S y control.
| Especificación por oblea | WSE-3 | WSE-3 Turbo | Cambio |
|---|---|---|---|
| Transistores | 4 billones | 4 billones | Sin cambios |
| Núcleos optimizados para IA | 900,000 | 900,000 | Sin cambios |
| SRAM en chip | 44GB | 44GB | Sin cambios |
| Cómputo de IA | 125 PFLOPS | 250 PFLOPS | 2x |
| Ancho de banda de memoria | 21.6 PB/s | 43.2 PB/s | 2x |
| E/S fuera de chip | 1.2 Tbit/s | 2.4 Tbit/s | 2x |
En la prueba GPT-OSS-120B de Cerebras, el CS-4 produjo más de 4,400 tokens por segundo para cada usuario. La empresa afirmó velocidades hasta 30 veces superiores a las de los sistemas GPU. Los resultados reales varían según el modelo, contexto, precisión y configuración de servicio.
“En IA, la velocidad es productividad”, dijo el director ejecutivo Andrew Feldman. Argumentó que la inferencia rápida ya no requiere un modelo más pequeño y menos capaz. Esas afirmaciones aún necesitan pruebas independientes amplias.
Las tres “mochilas” montadas en la parte trasera del rack combinan cada oblea con refrigeración líquida directa, conversión de energía y E/S. Cerebras dice que el diseño tiene un 50% menos de componentes y utiliza un 60% más de fabricación automatizada que su predecesor.
| Medida de despliegue | Generación CS-3 anterior | Plataforma Nexus CS-4 |
|---|---|---|
| Empaquetado de cómputo | Sistema de un solo wafer | Tres módulos pluggables a escala de wafer |
| Tiempo de instalación | Días | Horas |
| Conteo relativo de componentes | Línea base | 50% menos |
| Escala de modelo soportada | Hasta 24 billones de parámetros | Más de 50 billones de parámetros |
| Disponibilidad | Envío | Primeros envíos este trimestre |
| Precio público de lista | No revelado | No revelado |
Los enlaces directos de wafer conectan racks sin un switch intermedio. La latencia de wafer a wafer cae a dos microsegundos, soportando modelos de más de 50 billones de parámetros. Ethernet RoCE v2 estándar sigue disponible.
La E/S programable también soporta inferencia desagregada. Un motor separado maneja el procesamiento de prompts y luego pasa la generación de tokens al CS-4. Cerebras nombró a AMD (NASDAQ:AMD) Helios y Amazon (NASDAQ:AMZN) Web Services Trainium como socios planificados del ecosistema.
CS-4 llega mientras Cerebras se orienta hacia ingresos en la nube. Las ventas en la nube del segundo trimestre alcanzaron unos $126 millones, mientras que los ingresos por hardware cayeron a $54.1 millones desde $70.3 millones el año anterior. El margen bruto ajustado descendió a 40.6%.
El nuevo rack podría reactivar la demanda de hardware y reducir los costos operativos en la nube. También aumenta la presión de ejecución. Cerebras debe fabricar, enfriar y desplegar sistemas lo suficientemente rápido para soportar la capacidad contratada, incluyendo cargas de trabajo de OpenAI.
Las afirmaciones competitivas siguen siendo definidas por los proveedores. Nvidia (NASDAQ:NVDA) y AMD publican el rendimiento usando diferentes precisiones, modelos y configuraciones de rack, haciendo que las comparaciones de petaflops en los titulares no sean confiables sin pruebas equiparadas.
Riesgos: El tiempo de envío es una proyección a futuro y el precio sigue siendo desconocido. La ventaja de 30 veces sobre GPU proviene de pruebas de Cerebras, no de un benchmark neutral de producción.
La ganancia verificada más clara del CS-4 es arquitectónica. Combina tres wafers más rápidos, servicio modular y enlaces de menor latencia. Si eso se traduce en márgenes duraderos ahora depende de los despliegues.