Da trickst aber nVidia etwas.
„Effective FP8 teraFLOPS (TFLOPS) using the sparsity feature.“
Die nehmen in ihren Datasheets FP8 "Sparsity", auch wieder eine only nVidia spezielle Beschleunigungstechnologie, als Grundlage. Diese Technologie funktioniert aber nicht grundsätzlich, sondern nur bei bestimmten KI-Modellen die darauf optimiert sind sog. "Null-Werte" in ihren Matrizen zu streichen, wodurch sich die theoretische Rechnenleistung der Tensor Kerne schlagartig verdoppelt. Bei solchen Modellen sieht eine AMD Karte ähnlicher Leistung eigentlich gar kein Land mehr, die Tensors wischen mit der, wie man so schön sagt "den Boden".
Was nVidia aber dabei ganz galant verschweigt (ist halt eine Marketing Folie), in der KI/AI Berechnung von Standard FP8 Modellen ist "Sparsity" halt nicht die Regel, denn die beruhen zum Großteil immer noch auf ältererFP16/BF16 Quantisierung und da gibts "Sparsity" schlicht nicht! Ergo würde ich in der KI/AI Berechnung bei der RTX2000 Ada Gen. nur noch rein effektiv von
95,9 TFLOPS bei den Tensor Cores ausgehen, was dann nicht mehr so besonders viel ist für eine Karte dieser Preisregion. Zweiter Nachteil: Die taktet halt extrem eingebremst, wichtiger für KI/AI sind aber wirklich die Tensor Cores.
Alternative, man setzt halt auf ultramoderne KI/AI Modelle, basierend auf Flux.2 & Co., da finden sich dann halt auch schon öfters "Sparsity" Modelle, die dann auch wirklich die Tensor Cores im Turbo berechnen lassen. Dann bleibt quasi nur noch derzeit nVidia für so etwas als ernstzunehmende Hardware übrig, denn AMD hat so etwas schlicht gar nicht. Aber auch da wärst du, wenn man jetzt mal meine GTX4060Ti 16GB vs. dieser von dir genannten RTX2000 Ada Gen. ggü. setzt im "Spasity" Modus der neueren Flux.2 Modelle schon bei 353,0 TFLOPS, also fast doppelt so flott via Tensor Cores ggü. der Ada Gen.
Dazu kommt, die GTX4060Ti taktet ungebremst, da Gamerkarte, die RTX2000 Ada. ist eine Workstation Karte, stark eingebremst. Und kostet aktuell ggü. meiner Karte selbst jetzt rund 300 Schleifen mehr.
Klar, für kleine Server wo es um Sparsamkeit geht, bleibt dir da nur diese Ada Gen. Karte. Anders herum: Wie lange möchtest du "länger" rendern um jetzt rein von der Sparsamkeit (weniger Stromverbrauch des Gesamtsystem), diese ca. 300€ Mehrkosten wieder über den Stromverbrauch rein zu holen, ebend genau wenn du das nur hobbymäßig betreibst?
Ich denke mal, dass dürften schon einige Jährchen sein, gerade hobbymäßig. Außerdem, du wärst ja so oder so auch mit der Ada länger am rendern, da ja weniger leistungseffektiv von den Tensoren, ergo länger in Volllast des Systems, was ja auch hier wieder die Stromersparnis noch einmal minimiert. Ich sehe da, ehrlich gesagt, weniger Sinn hinter der "Alternative", klar, vom Marketing her klingts erst einmal toll - wie bei so vielen Sachen.
ps: ..und was viele nV-Nutzer auch nicht wissen, selbst eine ältere GTX3xxx aus der Ampere-Architektur kann "Sparsity"-Modelle effektiv nutzen. Unterschied ist einfach die mathematische Berechnungsfunktion (2:4 statt 1:1), kann jeder für sich selbst bei nVidia in den Datasheets nachlesen. Darüber wäre z.b. eine GTX3070 statt mit 163 TFLOPS schon mit 285 TFLOPS im "Sparsity" Modus unterwegs und würde so manch aktuelle AMD Karte flach beiseite legen.
Also das eine GTX3xxx für AI/KI nicht taugt, halte ich eher für ein Gerücht. Die Dinger taugen sogar sehr gut dafür und haben durchaus ihre Darseinsberechtigung.
pps: Ich habe mal die KI befragt (kein Bock das jetzt bei nV herauszusuchen) was "Sparsity"-Modelle in der Praxis via Tensor Cores so abliefern, nur damit sich jeder selbst mal ein Bild machen kann:
FLIESSKOMMA-MODUS (FP16, BF16, FP8)
--------------------------------------------------------------------
RTX 3060 12GB (112 Tensor Cores):
- FP16 / BF16 mit Sparsity: 101,9 TFLOPS *
- FP8 mit Sparsity: Nicht unterstützt
RTX 2000 Ada 16GB (88 Tensor Cores):
- FP16 / BF16 mit Sparsity: ca. 95,9 TFLOPS *
- FP8 mit Sparsity: 191,9 TFLOPS
RTX 4060 Ti 16GB (136 Tensor Cores):
- FP16 / BF16 mit Sparsity: ca. 176,5 TFLOPS *
- FP8 mit Sparsity: 353,0 TFLOPS
INTEGER-MODUS FUER Q-MODELLE (INT8, Q8, NF4, INT4, Q4)
--------------------------------------------------------------------
RTX 3060 12GB (112 Tensor Cores):
- INT8 / Q8 / NF4 mit Sparsity: 203,8 TOPS
- INT4 / Q4 mit Sparsity: 407,6 TOPS
RTX 2000 Ada 16GB (88 Tensor Cores):
- INT8 / Q8 / NF4 mit Sparsity: 191,9 TOPS
- INT4 / Q4 mit Sparsity: 383,8 TOPS
RTX 4060 Ti 16GB (136 Tensor Cores):
- INT8 / Q8 / NF4 mit Sparsity: 353,0 TOPS
- INT4 / Q4 mit Sparsity: 706,0 TOPS
(
* Anmerkung: da hat die Google-KI, ist halt dumm, meine Berechnungsfrage falsch verstanden, da Sparsity bei FP16/BF16 technisch nicht möglich, Werte sind daher zu FP16/BF16 ohne Sparsity identisch)
..also, so schlecht wie hier behauptet ist eine GTX3060 12GB überhaupt gar nicht für AI/KI.
edit: Falls sich wer wundert warum ich die RTX Karten immer noch GTX nenne, bin da halt was oldskool unterwegs (andere Generation halt) und für mich heißen die immer noch GTX. Falls das wem stört -> SORRY!