NEWS

Cerebras CS-4

Die WSE-3 auf Steroiden für mehr Inference-Leistung

Portrait des Authors


Die WSE-3 auf Steroiden für mehr Inference-Leistung
0

Werbung

Die Wafer-Scale-Engine von Cerebras war rückblickend nicht nur technologisch gesehen ein faszinierendes Wagnis, sondern hat sich aufgrund der Entwicklungen und Ausrichtungen am KI-Markt zu einem echten Glücksgriff entwickelt. Sowohl AMD als auch NVIDIA machten sich auf die Suche nach Hardware, welche das Inferencing deutlich beschleunigen sollte. Während NVIDIA sich hier exklusiv die Nutzungsrechte der LPUs von Groq sicherte und diese in seine Systeme integrieren möchte, hat AMD eine Zusammenarbeit mit Cerebras angekündigt.

Cerebras hat nun die vierte Generation des Cerebras-Systems, das CS-4, vorgestellt. Jedes CS-4 verwendet dabei drei WSEs (Wafer Scale Engines), die Cerebras hier Wafer Scale Engine 3 Turbo getauft hat. Der Name verrät es bereits. Bei der WSE-3 Turbo handelt es sich im Grunde um den Vorgänger WSE-3, der durch verschiedene Maßnahmen optimiert und damit beschleunigt wurde.

Der wesentliche Unterschied ist nicht die Größe des Prozessors oder die Anzahl der Recheneinheiten. Die WSE-3 Turbo besitzt weiterhin 900.000 KI-Kerne, 44 GB SRAM und besteht aus 4 Billionen Transistoren. Die Fertigung findet auch weiterhin in 5 nm bei TSMC statt. Stattdessen wurde offenbar die Betriebsfrequenz beziehungsweise die Auslegung des Chips auf höhere Taktraten optimiert.

Cerebras gibt eine Verdopplung der Rechenleistung von 125 auf 250 PFLOPS an, ohne dass sich die Zahl der AI-Kerne verändert. Hier greift man aber wohl auf einen Trick zurück und gibt die Rechenleistung mit dünn besetzten Matrizen (Sparsity) an. 

Die Speicherbandbreite steigt von 21 auf 43,2 PB/s und damit sogar geringfügig stärker als die angegebene Rechenleistung. Bei der Fabric-Bandbreite liegt nun bei 428 Pbit/s gegenüber den 214 Pbit/s der Standard-WSE-3. Die Turbo-Variante erhöht damit die Rechenleistung maßgeblich durch eine Beschleunigung der internen Datenpfade, aber wohl auch durch den Takt.

Interessant ist deshalb vor allem, was unverändert bleibt: Fertigung bei TSMC in 5 nm, 46.225 mm² große Waferfläche, 4 Billionen Transistoren, 900.000 AI-Kerne und 44 GB SRAM. Die Turbo-Version ist somit keine neue Architektur oder ein größerer WSE, sondern vielmehr eine höher getaktete beziehungsweise auf höhere Leistung ausgelegte Variante der WSE-3.

Das CS-4 besteht, wie zuvor besprochen, aus drei WSE-3 Turbo. Die aufwendige Kühlung und Stromversorgung einer Wafer Scale Engine haben wir mit der ersten Generation bereits ausführlich besprochen. Die drei WSE-3 Turbo sind über einen eigenen I/O-Interconnect miteinander verbunden. Diese kommt auf eine Bandbreite von 7,2 TBit/s und weist eine Latenz von nur 2 ms auf.

Wafer Scale Engines von Cerebras

WSE-1 WSE-2WSE-3WSE-3 Turbo
Fertigung 16 nm 7 nm5 nm5 nm
Chipgröße 46.225 mm² 46.225 mm²46.225 mm²46.225 mm²
Anzahl der Transistoren 1,2 Billionen 2,6 Billionen4 Billionen4 Billionen
AI-Kerne 400.000 850.000900.000900.000
SRAM 18 GB 40 GB44 GB44 GB
SRAM-Bandbreite 9 PB/s 20 PB/s21 PB/s43,2 PB/s
On-Chip-Fabric 100 PBit/s 220 PBit/s214 PBit/s428 PBit/s
I/O-Bandbreite - -2,4 Tbit/s7,2 Tbit/s
Systemleistung - 23 kW23 kW-

Durch den gigantischen SRAM derart nahe an den KI-Kernen kann das CS-4 enorm große Modelle mit 10 Trillionen Parametern aufnehmen und soll dabei dennoch geringe Latenzen und einen hohen Token-Output erreichen. OpenAIs GPT-OSS lief auf dem CS-3 mit 2.308 Tokens/s, auf dem CS-4 sollen des 4.465 Tokens/s sein.

Der CS-4 ist für den Einsatz in heterogenen KI-Infrastrukturen ausgelegt und unterstützt nativ sogenannte disaggregierte Inferenz. Dabei werden die beiden wesentlichen Phasen der Inferenz auf unterschiedliche Rechenplattformen verteilt.

In der ersten Phase, dem Prefill, verarbeitet eine darauf spezialisierte Recheneinheit den eingehenden Prompt und bereitet den für die weitere Verarbeitung benötigten Modellzustand vor. Dieser wird anschließend an den CS-4 übertragen, der die Decoding-Phase übernimmt und daraus mit möglichst geringer Latenz die Antwort generiert.

Durch diese Aufteilung lässt sich der CS-4 mit unterschiedlichen Plattformen für die Prefill-Verarbeitung kombinieren. Cerebras nennt unter anderem AMD Helios und AWS Trainium als mögliche Systeme. GPU- oder ASIC-basierte Infrastruktur kann damit für das Prefill eingesetzt werden, während der CS-4 auf die schnelle Decoding-Verarbeitung spezialisiert ist. Ziel ist eine heterogene Inferenzarchitektur, bei der die jeweiligen Recheneinheiten entsprechend ihrer Stärken eingesetzt werden. Einen ähnlichen Ansatz verfolgt auch NVIDIA mit den LPUs von Groq.

Noch in diesem Quartal will Cerebras die ersten CS-4-Systeme ausliefern.

Update: Cerebras auf der Hot Chips

Auch Cerebras präsentierte auf der Hot-Chips-Konferenz. Über die wichtigsten technischen Daten haben wir bereits mit der offiziellen Vorstellung berichtet.

Aber Cerebras gab auch einen Ausblick auf die weitere Roadmap. CS-4 stellt dabei ein kleineres Update mit übertakteten WSE-3 Turbo dar. CS-5 soll bereits im kommenden Jahr scheinen. Die gezeigte Folie zeigt für den CS-5 eine deutliche Steigerung bei der Inference-Leistung gegenüber dem gerade vorgestellten CS-4. Wichtig ist allerdings, dass Cerebras die CS-5-Werte ausdrücklich als Zielwerte für 2027 bezeichnet – es handelt sich also um Projektionen und nicht um bereits gemessene Systemwerte.

Beim CS-4 nennt Cerebras für GPT-OSS-120B mehr als 4.400 Tokens/s pro Nutzer. Für CS-5 werden bei kleineren beziehungsweise mittelgroßen Open-Source-Modellen wie Gemma 4 31B und GPT-OSS-120B bis zu 10.000 Tokens/s pro Nutzer angepeilt. Das entspricht gegenüber den rund 4.400 Tokens/s des CS-4 einer deutlichen Steigerung.

Interessanter ist der zweite Wert: Für sehr große Frontier-Modelle wie Kimi oder GPT-5.6 Sol sollen mit dem CS-5 bis zu 5.000 Tokens/s pro Nutzer erreicht werden. Der CS-4 liegt bei Modellen dieser Größenordnung laut Cerebras bei mehr als 1.000 Tokens/s, wobei dieser Wert für Modelle mit mehr als 10 Billionen Parametern als interne Projektion angegeben wird. Gegenüber diesem Wert würde der CS-5 also etwa fünfmal schneller werden.

Für CS-6 plant Cerebras dann auch technologisch eine deutliche Weiterentwicklung. So will man den auf dem Wafer befindlichen SRAM um 3D-gestapelten DRAM erweitern. Auf den Wafer mit den KI-Kernen und dem SRAM wird also ein weiterer, kompletter Wafer mit DRAM gesetzt. Ähnlich wie beim 3D V-Cache der ersten Generation dürfte dies eine Herausforderung für die Kühlung sein. Wie Cerebras die Problematik löst, werden wir in einigen Jahren sehen.

Die vollständige Präsentation von Cerebras auf der Hot Chips findet ihr hier:

Back to top