Cerebras CS-4 Ofrece Seis Veces la Potencia de Cómputo del CS-3 en un Nuevo Rack de IA

Cerebras CS-4 Ofrece Seis Veces la Potencia de Cómputo del CS-3 en un Nuevo Rack de IA

agosto 19, 2026

SAN FRANCISCO, 18 de agosto de 2026, 20:13 PDT — Cerebras Systems (NASDAQ:CBRS) presentó el CS-4, un rack de IA de tres obleas que ofrece 750 petaflops sparse-FP16. Los primeros envíos están programados para este trimestre.

  • CS-4 proporciona seis veces la capacidad de cómputo declarada de un sistema CS-3.
  • Cada WSE-3 Turbo duplica el cómputo y el ancho de banda de memoria por oblea.
  • No se revelaron los precios ni los benchmarks de producción independientes.

El aumento de seis veces en el rack proviene de dos cambios. Cada oblea es el doble de rápida, mientras que el nuevo diseño Nexus agrupa tres motores de oblea en un solo rack de potencia activa.

Eso es importante para los agentes de IA, donde cada paso de razonamiento añade retraso. Cerebras dice que el CS-4 puede dedicar más cómputo a la verificación y uso de herramientas sin hacer que los usuarios esperen más tiempo.

Especificación del sistemaCS-3CS-4Cambio
Motores de oblea por sistema1 WSE-33 WSE-3 TurboTriple cantidad
Cómputo de IA125 PFLOPS750 PFLOPS6x
Ancho de banda de memoria21.6 PB/s129.6 PB/s6x
Ancho de banda de la red interna26.7 PB/s160.5 PB/sAproximadamente 6x
Ancho de banda de E/S del sistema1.2 Tbit/s7.2 Tbit/s6x
Latencia de E/S5 microsegundosTan bajo como 2 microsegundos60% menor

El WSE-3 Turbo mantiene los cuatro billones de transistores, 900,000 núcleos y 44GB de SRAM de la oblea anterior. Cerebras en su lugar aumenta la velocidad de operación mediante una entrega de energía más cercana y un ensamblaje rediseñado de refrigeración, E/S y control.

Especificación por obleaWSE-3WSE-3 TurboCambio
Transistores4 billones4 billonesSin cambios
Núcleos optimizados para IA900,000900,000Sin cambios
SRAM en chip44GB44GBSin cambios
Cómputo de IA125 PFLOPS250 PFLOPS2x
Ancho de banda de memoria21.6 PB/s43.2 PB/s2x
E/S fuera de chip1.2 Tbit/s2.4 Tbit/s2x

En la prueba GPT-OSS-120B de Cerebras, el CS-4 produjo más de 4,400 tokens por segundo para cada usuario. La empresa afirmó velocidades hasta 30 veces superiores a las de los sistemas GPU. Los resultados reales varían según el modelo, contexto, precisión y configuración de servicio.

“En IA, la velocidad es productividad”, dijo el director ejecutivo Andrew Feldman. Argumentó que la inferencia rápida ya no requiere un modelo más pequeño y menos capaz. Esas afirmaciones aún necesitan pruebas independientes amplias.

Las tres “mochilas” montadas en la parte trasera del rack combinan cada oblea con refrigeración líquida directa, conversión de energía y E/S. Cerebras dice que el diseño tiene un 50% menos de componentes y utiliza un 60% más de fabricación automatizada que su predecesor.

Medida de despliegueGeneración CS-3 anteriorPlataforma Nexus CS-4
Empaquetado de cómputoSistema de un solo waferTres módulos pluggables a escala de wafer
Tiempo de instalaciónDíasHoras
Conteo relativo de componentesLínea base50% menos
Escala de modelo soportadaHasta 24 billones de parámetrosMás de 50 billones de parámetros
DisponibilidadEnvíoPrimeros envíos este trimestre
Precio público de listaNo reveladoNo revelado

Los enlaces directos de wafer conectan racks sin un switch intermedio. La latencia de wafer a wafer cae a dos microsegundos, soportando modelos de más de 50 billones de parámetros. Ethernet RoCE v2 estándar sigue disponible.

La E/S programable también soporta inferencia desagregada. Un motor separado maneja el procesamiento de prompts y luego pasa la generación de tokens al CS-4. Cerebras nombró a AMD (NASDAQ:AMD) Helios y Amazon (NASDAQ:AMZN) Web Services Trainium como socios planificados del ecosistema.

CS-4 llega mientras Cerebras se orienta hacia ingresos en la nube. Las ventas en la nube del segundo trimestre alcanzaron unos $126 millones, mientras que los ingresos por hardware cayeron a $54.1 millones desde $70.3 millones el año anterior. El margen bruto ajustado descendió a 40.6%.

El nuevo rack podría reactivar la demanda de hardware y reducir los costos operativos en la nube. También aumenta la presión de ejecución. Cerebras debe fabricar, enfriar y desplegar sistemas lo suficientemente rápido para soportar la capacidad contratada, incluyendo cargas de trabajo de OpenAI.

Las afirmaciones competitivas siguen siendo definidas por los proveedores. Nvidia (NASDAQ:NVDA) y AMD publican el rendimiento usando diferentes precisiones, modelos y configuraciones de rack, haciendo que las comparaciones de petaflops en los titulares no sean confiables sin pruebas equiparadas.

Riesgos: El tiempo de envío es una proyección a futuro y el precio sigue siendo desconocido. La ventaja de 30 veces sobre GPU proviene de pruebas de Cerebras, no de un benchmark neutral de producción.

La ganancia verificada más clara del CS-4 es arquitectónica. Combina tres wafers más rápidos, servicio modular y enlaces de menor latencia. Si eso se traduce en márgenes duraderos ahora depende de los despliegues.