Le Cerebras CS-4 offre six fois la puissance de calcul du CS-3 dans un nouveau rack IA

Le Cerebras CS-4 offre six fois la puissance de calcul du CS-3 dans un nouveau rack IA

août 19, 2026

SAN FRANCISCO, 18 août 2026, 20:13 PDT — Cerebras Systems (NASDAQ:CBRS) a dévoilé le CS-4, un rack IA à trois wafers délivrant 750 pétaflops sparse-FP16. Les premières livraisons sont prévues ce trimestre.

  • Le CS-4 offre six fois la puissance de calcul annoncée d’un système CS-3.
  • Chaque WSE-3 Turbo double la puissance de calcul et la bande passante mémoire par wafer.
  • Les prix et les benchmarks de production indépendants n’ont pas été communiqués.

Le gain de puissance par rack par six provient de deux changements. Chaque wafer est deux fois plus rapide, tandis que le nouveau design Nexus regroupe trois moteurs wafer dans un seul rack d’alimentation actif.

C’est important pour les agents IA, où chaque étape de raisonnement ajoute un délai. Cerebras affirme que le CS-4 peut consacrer plus de calcul à la vérification et à l’utilisation d’outils sans faire attendre davantage les utilisateurs.

Spécifications systèmeCS-3CS-4Changement
Moteurs wafer par système1 WSE-33 WSE-3 TurboNombre multiplié par trois
Puissance de calcul IA125 PFLOPS750 PFLOPS6x
Bande passante mémoire21,6 PB/s129,6 PB/s6x
Bande passante du réseau sur puce26,7 PB/s160,5 PB/sEnviron 6x
Bande passante E/S système1,2 Tbit/s7,2 Tbit/s6x
Latence E/S5 microsecondesJusqu’à 2 microsecondes60% de moins

Le WSE-3 Turbo conserve les quatre mille milliards de transistors, 900 000 cœurs et 44 Go de SRAM du wafer précédent. Cerebras augmente plutôt la vitesse de fonctionnement grâce à une alimentation électrique rapprochée et à une refonte de l’assemblage refroidissement, E/S et contrôle.

Spécifications par waferWSE-3WSE-3 TurboChangement
Transistors4 mille milliards4 mille milliardsInchangé
Cœurs optimisés IA900 000900 000Inchangé
SRAM sur puce44 Go44 GoInchangé
Puissance de calcul IA125 PFLOPS250 PFLOPS2x
Bande passante mémoire21,6 PB/s43,2 PB/s2x
E/S hors puce1,2 Tbit/s2,4 Tbit/s2x

Dans le test GPT-OSS-120B de Cerebras, le CS-4 a produit plus de 4 400 tokens par seconde pour chaque utilisateur. L’entreprise a revendiqué des vitesses jusqu’à 30 fois supérieures à celles des systèmes GPU. Les résultats réels varient selon le modèle, le contexte, la précision et la configuration de service.

« Dans l’IA, la vitesse c’est la productivité », a déclaré le PDG Andrew Feldman. Il a soutenu qu’une inférence rapide ne nécessite plus un modèle plus petit et moins performant. Ces affirmations doivent encore être largement testées de manière indépendante.

Les trois « sacs à dos » montés à l’arrière du rack combinent chaque wafer avec un refroidissement liquide direct, une conversion de puissance et des E/S. Cerebras affirme que le design comporte 50% de composants en moins et utilise 60% de fabrication automatisée en plus que son prédécesseur.

Mesure de déploiementGénération CS-3 précédentePlateforme Nexus CS-4
Conditionnement du calculSystème à une seule trancheTrois modules enfichables à l’échelle de la tranche
Temps d’installationJoursHeures
Nombre relatif de composantsRéférence50 % de moins
Échelle de modèle prise en chargeJusqu’à 24 000 milliards de paramètresPlus de 50 000 milliards de paramètres
DisponibilitéExpéditionPremières livraisons ce trimestre
Prix public affichéNon divulguéNon divulgué

Les liaisons directes entre tranches connectent les racks sans commutateur intermédiaire. La latence entre tranches tombe à deux microsecondes, permettant de prendre en charge des modèles de plus de 50 000 milliards de paramètres. L’Ethernet RoCE v2 standard reste disponible.

L’E/S programmable prend également en charge l’inférence désagrégée. Un moteur séparé gère le traitement des prompts, puis transmet la génération de tokens au CS-4. Cerebras a nommé AMD (NASDAQ:AMD) Helios et Amazon (NASDAQ:AMZN) Web Services Trainium comme partenaires écosystémiques prévus.

Le CS-4 arrive alors que Cerebras se tourne vers les revenus du cloud. Les ventes cloud du deuxième trimestre ont atteint environ 126 millions de dollars, tandis que les revenus matériels sont tombés à 54,1 millions de dollars contre 70,3 millions un an plus tôt. La marge brute ajustée a chuté à 40,6 %.

Le nouveau rack pourrait relancer la demande matérielle et réduire les coûts d’exploitation du cloud. Cela augmente également la pression d’exécution. Cerebras doit fabriquer, refroidir et déployer les systèmes assez rapidement pour soutenir la capacité contractuelle, y compris les charges de travail OpenAI.

Les affirmations concurrentielles restent définies par les fournisseurs. Nvidia (NASDAQ:NVDA) et AMD publient des performances utilisant différentes précisions, modèles et configurations de racks, rendant les comparaisons de petaflops en gros titres peu fiables sans tests équivalents.

Risques : Le calendrier des livraisons est prospectif et les prix restent inconnus. L’avantage de 30 fois sur le GPU provient des tests Cerebras, et non d’un benchmark de production neutre.

Le gain le plus clairement vérifié du CS-4 est architectural. Il combine trois tranches plus rapides, une maintenance modulaire et des liaisons à plus faible latence. Le fait que cela se traduise par des marges durables dépend désormais des déploiements.