SAN FRANCISCO, 18 sierpnia 2026, 20:13 PDT — Cerebras Systems (NASDAQ:CBRS) zaprezentowało CS-4, stojak AI z trzema waflami, oferujący 750 petaflopsów sparse-FP16. Pierwsze dostawy zaplanowano na ten kwartał.
- CS-4 zapewnia sześciokrotnie większą moc obliczeniową niż jeden system CS-3.
- Każdy WSE-3 Turbo podwaja moc obliczeniową i przepustowość pamięci na wafel.
- Ceny i niezależne testy wydajności nie zostały ujawnione.
Sześciokrotny wzrost wydajności stojaka wynika z dwóch zmian. Każdy wafel jest dwa razy szybszy, a nowy projekt Nexus łączy trzy silniki waflowe w jednym aktywnym stojaku zasilającym.
To ma znaczenie dla agentów AI, gdzie każdy krok rozumowania dodaje opóźnienie. Cerebras twierdzi, że CS-4 może poświęcić więcej mocy obliczeniowej na weryfikację i korzystanie z narzędzi bez wydłużania czasu oczekiwania użytkowników.
| Specyfikacja systemu | CS-3 | CS-4 | Zmiana |
|---|---|---|---|
| Silniki waflowe na system | 1 WSE-3 | 3 WSE-3 Turbo | Trzykrotnie więcej |
| Moc obliczeniowa AI | 125 PFLOPS | 750 PFLOPS | 6x |
| Przepustowość pamięci | 21,6 PB/s | 129,6 PB/s | 6x |
| Przepustowość magistrali na chipie | 26,7 PB/s | 160,5 PB/s | Około 6x |
| Przepustowość I/O systemu | 1,2 Tbit/s | 7,2 Tbit/s | 6x |
| Opóźnienie I/O | 5 mikrosekund | Już od 2 mikrosekund | O 60% niższe |
WSE-3 Turbo zachowuje cztery biliony tranzystorów, 900 000 rdzeni i 44 GB SRAM z poprzedniego wafla. Cerebras zwiększa natomiast prędkość działania dzięki bliższemu dostarczaniu zasilania oraz przeprojektowanemu chłodzeniu, I/O i zespołowi sterującemu.
| Specyfikacja na wafel | WSE-3 | WSE-3 Turbo | Zmiana |
|---|---|---|---|
| Tranzystory | 4 biliony | 4 biliony | Bez zmian |
| Rdzenie zoptymalizowane pod AI | 900 000 | 900 000 | Bez zmian |
| SRAM na chipie | 44GB | 44GB | Bez zmian |
| Moc obliczeniowa AI | 125 PFLOPS | 250 PFLOPS | 2x |
| Przepustowość pamięci | 21,6 PB/s | 43,2 PB/s | 2x |
| Off-chip I/O | 1,2 Tbit/s | 2,4 Tbit/s | 2x |
W teście GPT-OSS-120B firmy Cerebras, CS-4 generował ponad 4400 tokenów na sekundę dla każdego użytkownika. Firma twierdziła, że prędkości są do 30 razy większe niż w systemach GPU. Rzeczywiste wyniki zależą od modelu, kontekstu, precyzji i konfiguracji serwowania.
„W AI prędkość to produktywność” – powiedział dyrektor generalny Andrew Feldman. Twierdził, że szybka inferencja nie wymaga już mniejszego, mniej wydajnego modelu. Te twierdzenia wymagają jednak szerokich, niezależnych testów.
Trzy „plecaki” zamontowane z tyłu stojaka łączą każdy wafel z bezpośrednim chłodzeniem cieczą, konwersją zasilania i I/O. Cerebras twierdzi, że projekt ma o 50% mniej komponentów i wykorzystuje o 60% więcej zautomatyzowanej produkcji niż jego poprzednik.
| Miara wdrożenia | Poprzednia generacja CS-3 | Platforma CS-4 Nexus |
|---|---|---|
| Pakowanie obliczeniowe | System jednopłytkowy | Trzy podłączane plecaki w skali wafla |
| Czas instalacji | Dni | Godziny |
| Względna liczba komponentów | Wartość bazowa | O 50% mniej |
| Obsługiwana skala modelu | Do 24 bilionów parametrów | Ponad 50 bilionów parametrów |
| Dostępność | Wysyłka | Pierwsze dostawy w tym kwartale |
| Publiczna cena katalogowa | Nieujawniona | Nieujawniona |
Bezpośrednie połączenia Wafer Links łączą szafy bez pośredniczącego przełącznika. Opóźnienie między płytkami spada do dwóch mikrosekund, obsługując modele powyżej 50 bilionów parametrów. Standardowy Ethernet RoCE v2 pozostaje dostępny.
Programowalne I/O obsługuje również rozdzielone wnioskowanie. Oddzielny silnik obsługuje przetwarzanie promptów, a następnie przekazuje generowanie tokenów do CS-4. Cerebras wymienił AMD (NASDAQ:AMD) Helios i Amazon (NASDAQ:AMZN) Web Services Trainium jako planowanych partnerów ekosystemu.
CS-4 pojawia się, gdy Cerebras przechodzi na przychody z chmury. Sprzedaż chmurowa w drugim kwartale osiągnęła około 126 mln dolarów, podczas gdy przychody ze sprzętu spadły do 54,1 mln dolarów z 70,3 mln rok wcześniej. Skorygowana marża brutto spadła do 40,6%.
Nowa szafa może ożywić popyt na sprzęt i obniżyć koszty operacyjne chmury. Zwiększa też presję na realizację. Cerebras musi produkować, chłodzić i wdrażać systemy wystarczająco szybko, by obsłużyć zakontraktowaną pojemność, w tym obciążenia OpenAI.
Twierdzenia konkurencyjne pozostają zdefiniowane przez dostawców. Nvidia (NASDAQ:NVDA) i AMD publikują wyniki wydajności przy użyciu różnych precyzji, modeli i konfiguracji szaf, przez co porównania petaflopów w nagłówkach są niewiarygodne bez dopasowanych testów.
Ryzyka: Terminy wysyłek są prognozowane, a ceny pozostają nieznane. 30-krotna przewaga GPU pochodzi z testów Cerebras, a nie z neutralnego benchmarku produkcyjnego.
Najbardziej zweryfikowaną korzyścią CS-4 jest architektura. Łączy trzy szybsze płytki, modułową obsługę serwisową i połączenia o niższym opóźnieniu. Czy przełoży się to na trwałe marże, zależy teraz od wdrożeń.