NEWS

Hot Chips 2026

AMD und NVIDIA sprechen (ein wenig) über GPU-Architekturen

Portrait des Authors


AMD und NVIDIA sprechen (ein wenig) über GPU-Architekturen
5

Werbung

Neben einer Berichterstattung zur zukünftigen Entwicklung von HBM bei Samsung und SK Hynix mit Fokus auf die Fertigung, präsentierten gestern hauptsächlich die CPU- und GPU-Hersteller auf der Hot-Chips-Konferenz. So sprach Intel über neue Details zur kommenden Xeon-Generation Diamond Rapids mit UCIe-S anstatt EMIB, was auch für die Core Series 3 aka Wildcat Lake von Bedeutung war und den Inferencing-Beschleuniger Crescent Island auf Basis der Xe3P-Architektur.

Aber AMD und NVIDIA sprachen auch über die eigenen, zukünftigen GPU-Architekturen, die natürlich als KI-Beschleuniger eingesetzt werden. Dabei sei erwähnt, dass AMD im Rahmen der eigenen Advancing AI 2026 die Instinct-MI400-Serie und dazugehörige Architektur bereits vorstellte.

Die MI455X basiert auf einem modularen Chiplet-Design aus acht Accelerator-Complex-Dies im TSMC-N2-Verfahren, ergänzt um Fabric-and-Cache-Dies sowie I/O-Dies im N3P-Prozess. Nach AMD-Angaben stellt der Baustein 256 aktive Work-Group-Processors bereit, verfügt über 192 MB globalen L2-Cache und ist mit zwölf HBM4-Speicherstapeln bestückt, die 432 GB Kapazität bei 23,3 TB/s Bandbreite liefern. Die Anbindung erfolgt unter anderem über PCIe Gen 6 sowie 72 UALoE-Lanes mit 3,6 TB/s Durchsatz.

Bei der Gehäusetechnik setzt AMD auf 3D-Hybrid-Bonding für die gestapelten Rechen-Dies sowie auf CoWoS-L-Advanced-Packaging, um Compute-, Speicher- und I/O-Bausteine mit geringer Latenz auf einem gemeinsamen Package zu verbinden. Der Chip bildet den Kern der Compute-Trays im Rack-System „Helios", in dem jeweils vier MI455X-Module über einen einzelnen AMD-EPYC-Prozessor der Venice-Generation angebunden sind.

Die MI455X ist Teil einer CDNA-5-Architektur, die AMD als die umfassendste Überarbeitung seiner Server-GPU-Architektur seit über einem Jahrzehnt bezeichnet. Der Chip wird bei TSMC in 2- und 3-Nanometer-Verfahren gefertigt und enthält rund 320 Milliarden Transistoren. Mit dem Produkt positioniert sich AMD im Wettbewerb um KI-Rechenzentren gegen Nvidias Rubin-Generation; entsprechende System- und Netzwerktechnik wurde bereits im Sommer 2026 im Rahmen der "Advancing AI"-Veranstaltung des Unternehmens vorgestellt.

NVIDIAs Rubin-Architektur

Die Rubin-GPU ist der zentrale Baustein der neuen Vera-Rubin-Plattform. Der Chip setzt sich aus zwei über die firmeneigene NV-HBI-Verbindung gekoppelten Compute-Dies zusammen und integriert unter anderem verbesserte Tensor-Cores der fünften Generation, ein HBM4-Speicherinterface, eine PCIe-Gen-6-Anbindung sowie Hardwarefunktionen für vertrauliches Rechnen (Confidential Computing).

Auffällig an den von NVIDIA präsentierten Effizienzwerten ist deren Bezugsgröße: Die genannten 2 Zettaflops NVFP4-Inferenzleistung, 1,4 Zettaflops Trainingsleistung sowie 11 Petabyte HBM4-Speicher bei 800 Petabyte pro Sekunde Bandbreite gelten nicht für einen einzelnen Chip, sondern für ein gesamtes, 100 MW großes KI-Cluster. NVIDIA positioniert die Rubin-GPU damit explizit als Baustein eines rack- beziehungsweise fabrikweiten Systems, das gegenüber der Vorgängerarchitektur Blackwell eine deutlich höhere Energieeffizienz pro Recheneinheit erzielen soll.

Zwei weitere vorgestellte Maßnahmen zielen auf die Effizienz auf Rack- und Rechenzentrumsebene. Beim Kühlkonzept ersetzt NVIDIA klassische Kältemaschinen (Chiller) durch ein System mit 45 °C warmem Kühlmittel-Vorlauf und trockenen Rückkühlern, was laut Unternehmensangaben Kühlenergie und Wasserverbrauch reduziert, ohne die Rechenleistung einzuschränken.

Zusätzlich stellte NVIDIA eine als "Intelligent Power Smoothing" bezeichnete Funktion vor, die kurzfristige Leistungsspitzen von KI-Workloads über einen rackinternen Energiespeicher abfedert. Bei einem LLM-Trainingslauf auf einem Vera-Rubin-NVL72-Rack senkte dies die gemessene Spitzenleistung um 13 %. In Kombination mit weiteren systemseitigen Optimierungen rechnet NVIDIA mit bis zu 40 % mehr installierbaren GPUs innerhalb eines vorgegebenen Stromlimits.

Die vorgestellten Zahlen entstammen einem Vortrag, der die Rubin-GPU als Teil eines siebenteiligen Chip-Ökosystems der Vera-Rubin-Plattform einordnet, zu dem unter anderem eine neue CPU, NVLink-Switches und Netzwerkkomponenten gehören. Insgesamt reiht sich die Präsentation in eine branchenweite Entwicklung ein, bei der Hersteller von KI-Beschleunigern zunehmend nicht mehr nur reine Rechenleistung, sondern Effizienzkennzahlen auf System- und Rechenzentrumsebene in den Vordergrund stellen.

Ab der zweiten Jahreshälfte 2026 will NVIDIA die Vera-Rubin-Plattform ausliefern. Erste Großkunden haben bereits Systeme zur Validierung der Hardware erhalten.

Back to top