Neuer AI-Server

Aber irgendwas hats damit, ich glaube, MTP läuft so nicht.... oder doch? Not sure. Sollte so laufen lt. Claude... nachdem beim Qwen 3.8 27b Q4XL MTP "nur" 5 token/s bringt (von ca. 20 auf ca. 25), ist das schwer auszumachen, hängt wohl auch von Kontextlänge und Thema ab...
Bei schnellen MoE bringt MTP auch nicht zwingend was, auf der 5090 ist z.B. Gemma 4 26b a4b und Qwen 3.6 35b a3b mit MTP sogar ein paar token/s langsamer als ohne.
Wirklich schnell ist MTP am Laptop (Intel Ultra) mit dem Q2XL Gemma 4 26b a4b.. da bringt das massiv was (+80%?).

Ändere mal --spec-draft-p-min von 0.8 auf 0 - je nach Konstellation ist eine Erhöhung kontraproduktiv.



Btw. sehr guter Artikel zum KV Cache optimieren: https://anbeeld.com/articles/kv-cache-quantization-benchmarks-for-long-context

TL;DR

Zwei sinnvolle generelle Optionen.

q8_0 / q6_0 für große Speichereinsparungen mit fast keinem Qualitätsverlust
q6_0 / q5_0 für maximale Einsparungen mit sehr geringen Qualitätsverlust

Aber man sollte schon aufpassen was man für mein Modell nimmt. Qwen z.B. ist recht robust mit kleinen KV Cache, aber Gemma verliert deutlich an Qualität. Siehe: https://localbench.substack.com/p/kv-cache-quantization-benchmark
 
Zuletzt bearbeitet:
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
q8_0 / q6_0 für große Speichereinsparungen mit fast keinem Qualitätsverlust
q6_0 / q5_0 für maximale Einsparungen mit sehr geringen Qualitätsverlust
nachdem flash_attn damit nicht läuft (was ich mich erinnere) bzw. glaube), isses wsl eher nutzlos.
Zumindest mit assymetrischen Varianten läuft flash_attn imho nicht, und das will man eigentlich haben.

q8/q4 hab ich schon mal getestet, hat praktisch imho nicht funktioniert (Fehler geworfen?).
ob q5_0 bzw. q6_0 (symmetrisch) nun in akzeptabler Geschwindigkeit läuft, hängt wohl vom Backend ab... gibt da wohl Unterschiede zwischen Cuda/ROCm/apple ...
 
Zuletzt bearbeitet:

Oh, könnte man damit auch unterschiedliche Generationen verheiraten? Hätte z.B. 2x 3090, 1x 4090 und 1x 5090 im Angebot und dazu mobile 4070 und 3080 in Laptops. :d Bringt einem dafür ein sehr schnelles Netz was (bestimmt, hab ja mein 100Gbit Netz gerade weitgehend zurückgebaut)? ;)

Jedenfalls cool, dass auch Linux und Windows miteinander geht. Da käme bei mir jedenfalls durchaus was zusammen - fehlt nur der Einsatzzweck.
 
@besterino "PAIR erkennt kompatible Rechner im Netzwerk, verbindet sie miteinander und richtet sie für sogenannte agentische Workflows ein. Dabei werden komplexe KI-Aufgaben in kleinere Arbeitsschritte zerlegt, die parallel verarbeitet werden können. Unterstützt werden Nvidia-Grafikkarten ab der GeForce-RTX-20-Serie sowie RTX-Pro-GPUs und DGX-Spark-Systeme. Auch Macs mit Apples M4-Chip oder neueren Prozessoren lassen sich einbinden."
Oh, könnte man damit auch unterschiedliche Generationen verheiraten?

Davon gehe ich aus.


1788622704003.png
 
Zuletzt bearbeitet:
nachdem flash_attn damit nicht läuft (was ich mich erinnere) bzw. glaube), isses wsl eher nutzlos.
Zumindest mit assymetrischen Varianten läuft flash_attn imho nicht, und das will man eigentlich haben.

q8/q4 hab ich schon mal getestet, hat praktisch imho nicht funktioniert (Fehler geworfen?).
ob q5_0 bzw. q6_0 (symmetrisch) nun in akzeptabler Geschwindigkeit läuft, hängt wohl vom Backend ab... gibt da wohl Unterschiede zwischen Cuda/ROCm/apple ...

Flash Attention funktioniert auch bei asymmetrischen KV Cache, das war möglicherweise in alten llama builds noch nicht unterstützt.

Ja Q8/Q4 liefert bei meinen genutzten Modellen auch nur Müll, Q8/Q5_1 ist die kleinste Kombination die mir keine Fehler wirft.
Zwischen Q8_0/Q8_0 vs Q5_0/Q5_0 habe ich bei Dense Modellen wie z.B. Glimmer 30B keinen Geschwindigkeitsvorteil erhalten, nur wie zu erwarten weniger VRAM Verbrauch beim KV Cache.
 
Ich finde es interessant das Qwen 3.8-27b bei einigen von euch schneller ist. Denn bei mir ist es mit 16,55 T/s langsamer als Qwen 3.6-27b mit 33,03 T/s. Nur Vulcan llama.cpp wurde zwischen durch geupdated und LM Studio. Unter Linux.
Gut so sehr stören tut es mich nicht da ich IBM Granite 4 H Tiny sehr gerne zum Vibe Coding benutze. Habe dort 159,26 T/s. Gut is auch nur eine sehr kleine LLM mit 3,94 GB. Für Nutzer mit begrenztem VRAM sehr interessant. Ich denke auch das solch speziallisierten LLMs die Zukunft gehört. Gerade im Privaten/Lokalen Bereich. Da man damit die Hardwarekosten im überschauberen Bereich bleiben.

Hat schon jemand von euch LM Studio Bionic ausprobiert? Ich traue mich nicht so wirklich ran, wegen den Agenten. Nicht das die mir versehentlich die SSD löschen.
 
Komisch, auf welcher Karte? Bei mir sind 3.6 27b und 3.8 27b ähnlich, 3.6 war schon ne Krücke. MTP hilft, aber auch nicht sooo viel bei mir. Evtl. hast beim 3.6er MTP laufen gehabt und jetzt nicht? Mit Themen, bei denen MTP sehr gut funktioniert?
Beitrag automatisch zusammengeführt:

Also bei mir läuft eine AMD Instinct MI50-32GB (Radeon Pro Vega VII) mit Qwen 3.8 27b via Vulkan mit knapp 20 tok/sec im LMStudio unter Windows.
Die Karten wurden letztes Jahr auf eBay für 160€ verramscht, habe 3 Stück. :)
Richtig geil, die Gurken hab ich leider verpasst.
Ist zwar uralt-Vega aber der HBM dürfte rocken... läuft das bei dir mit ROCm oder Vulkan?
 
Richtig geil, die Gurken hab ich leider verpasst.
Ist zwar uralt-Vega aber der HBM dürfte rocken... läuft das bei dir mit ROCm oder Vulkan?
Im Moment und der einfachheit halber mit Vulkan unter Windows, ROCm klappt nur nativ unter Linux (WSL - Windows Subsystem for Linux klappt nicht) und auch da muss man etwas frickeln bzw. ist auf die Comunity angewiesen und läuft nicht out of the box es sei denn, man gibt sich mit einer inzwischen sehr alten Version zufrieden. Angeblich ist die MI50 mit ROCm unter Linux nochmal bis zu 1/3 schneller (kommt aber immer etwas darauf an) als unter Windows mit Vulkan.
 
Vulkan ist eh massiv underrated.
WSL is the cancer. Wenn man irgendwas nicht will, ist es WSL.
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh