SAN FRANCISCO, 18 août 2026, 20:13 PDT — Cerebras Systems (NASDAQ:CBRS) a dévoilé le CS-4, un rack IA à trois wafers délivrant 750 pétaflops sparse-FP16. Les premières livraisons sont prévues ce trimestre.
- Le CS-4 offre six fois la puissance de calcul annoncée d’un système CS-3.
- Chaque WSE-3 Turbo double la puissance de calcul et la bande passante mémoire par wafer.
- Les prix et les benchmarks de production indépendants n’ont pas été communiqués.
Le gain de puissance par rack par six provient de deux changements. Chaque wafer est deux fois plus rapide, tandis que le nouveau design Nexus regroupe trois moteurs wafer dans un seul rack d’alimentation actif.
C’est important pour les agents IA, où chaque étape de raisonnement ajoute un délai. Cerebras affirme que le CS-4 peut consacrer plus de calcul à la vérification et à l’utilisation d’outils sans faire attendre davantage les utilisateurs.
| Spécifications système | CS-3 | CS-4 | Changement |
|---|---|---|---|
| Moteurs wafer par système | 1 WSE-3 | 3 WSE-3 Turbo | Nombre multiplié par trois |
| Puissance de calcul IA | 125 PFLOPS | 750 PFLOPS | 6x |
| Bande passante mémoire | 21,6 PB/s | 129,6 PB/s | 6x |
| Bande passante du réseau sur puce | 26,7 PB/s | 160,5 PB/s | Environ 6x |
| Bande passante E/S système | 1,2 Tbit/s | 7,2 Tbit/s | 6x |
| Latence E/S | 5 microsecondes | Jusqu’à 2 microsecondes | 60% de moins |
Le WSE-3 Turbo conserve les quatre mille milliards de transistors, 900 000 cœurs et 44 Go de SRAM du wafer précédent. Cerebras augmente plutôt la vitesse de fonctionnement grâce à une alimentation électrique rapprochée et à une refonte de l’assemblage refroidissement, E/S et contrôle.
| Spécifications par wafer | WSE-3 | WSE-3 Turbo | Changement |
|---|---|---|---|
| Transistors | 4 mille milliards | 4 mille milliards | Inchangé |
| Cœurs optimisés IA | 900 000 | 900 000 | Inchangé |
| SRAM sur puce | 44 Go | 44 Go | Inchangé |
| Puissance de calcul IA | 125 PFLOPS | 250 PFLOPS | 2x |
| Bande passante mémoire | 21,6 PB/s | 43,2 PB/s | 2x |
| E/S hors puce | 1,2 Tbit/s | 2,4 Tbit/s | 2x |
Dans le test GPT-OSS-120B de Cerebras, le CS-4 a produit plus de 4 400 tokens par seconde pour chaque utilisateur. L’entreprise a revendiqué des vitesses jusqu’à 30 fois supérieures à celles des systèmes GPU. Les résultats réels varient selon le modèle, le contexte, la précision et la configuration de service.
« Dans l’IA, la vitesse c’est la productivité », a déclaré le PDG Andrew Feldman. Il a soutenu qu’une inférence rapide ne nécessite plus un modèle plus petit et moins performant. Ces affirmations doivent encore être largement testées de manière indépendante.
Les trois « sacs à dos » montés à l’arrière du rack combinent chaque wafer avec un refroidissement liquide direct, une conversion de puissance et des E/S. Cerebras affirme que le design comporte 50% de composants en moins et utilise 60% de fabrication automatisée en plus que son prédécesseur.
| Mesure de déploiement | Génération CS-3 précédente | Plateforme Nexus CS-4 |
|---|---|---|
| Conditionnement du calcul | Système à une seule tranche | Trois modules enfichables à l’échelle de la tranche |
| Temps d’installation | Jours | Heures |
| Nombre relatif de composants | Référence | 50 % de moins |
| Échelle de modèle prise en charge | Jusqu’à 24 000 milliards de paramètres | Plus de 50 000 milliards de paramètres |
| Disponibilité | Expédition | Premières livraisons ce trimestre |
| Prix public affiché | Non divulgué | Non divulgué |
Les liaisons directes entre tranches connectent les racks sans commutateur intermédiaire. La latence entre tranches tombe à deux microsecondes, permettant de prendre en charge des modèles de plus de 50 000 milliards de paramètres. L’Ethernet RoCE v2 standard reste disponible.
L’E/S programmable prend également en charge l’inférence désagrégée. Un moteur séparé gère le traitement des prompts, puis transmet la génération de tokens au CS-4. Cerebras a nommé AMD (NASDAQ:AMD) Helios et Amazon (NASDAQ:AMZN) Web Services Trainium comme partenaires écosystémiques prévus.
Le CS-4 arrive alors que Cerebras se tourne vers les revenus du cloud. Les ventes cloud du deuxième trimestre ont atteint environ 126 millions de dollars, tandis que les revenus matériels sont tombés à 54,1 millions de dollars contre 70,3 millions un an plus tôt. La marge brute ajustée a chuté à 40,6 %.
Le nouveau rack pourrait relancer la demande matérielle et réduire les coûts d’exploitation du cloud. Cela augmente également la pression d’exécution. Cerebras doit fabriquer, refroidir et déployer les systèmes assez rapidement pour soutenir la capacité contractuelle, y compris les charges de travail OpenAI.
Les affirmations concurrentielles restent définies par les fournisseurs. Nvidia (NASDAQ:NVDA) et AMD publient des performances utilisant différentes précisions, modèles et configurations de racks, rendant les comparaisons de petaflops en gros titres peu fiables sans tests équivalents.
Risques : Le calendrier des livraisons est prospectif et les prix restent inconnus. L’avantage de 30 fois sur le GPU provient des tests Cerebras, et non d’un benchmark de production neutre.
Le gain le plus clairement vérifié du CS-4 est architectural. Il combine trois tranches plus rapides, une maintenance modulaire et des liaisons à plus faible latence. Le fait que cela se traduise par des marges durables dépend désormais des déploiements.