Neuer AI-Server

Aber irgendwas hats damit, ich glaube, MTP läuft so nicht.... oder doch? Not sure. Sollte so laufen lt. Claude... nachdem beim Qwen 3.8 27b Q4XL MTP "nur" 5 token/s bringt (von ca. 20 auf ca. 25), ist das schwer auszumachen, hängt wohl auch von Kontextlänge und Thema ab...
Bei schnellen MoE bringt MTP auch nicht zwingend was, auf der 5090 ist z.B. Gemma 4 26b a4b und Qwen 3.6 35b a3b mit MTP sogar ein paar token/s langsamer als ohne.
Wirklich schnell ist MTP am Laptop (Intel Ultra) mit dem Q2XL Gemma 4 26b a4b.. da bringt das massiv was (+80%?).

Ändere mal --spec-draft-p-min von 0.8 auf 0 - je nach Konstellation ist eine Erhöhung kontraproduktiv.



Btw. sehr guter Artikel zum KV Cache optimieren: https://anbeeld.com/articles/kv-cache-quantization-benchmarks-for-long-context

TL;DR

Zwei sinnvolle generelle Optionen.

q8_0 / q6_0 für große Speichereinsparungen mit fast keinem Qualitätsverlust
q6_0 / q5_0 für maximale Einsparungen mit sehr geringen Qualitätsverlust

Aber man sollte schon aufpassen was man für mein Modell nimmt. Qwen z.B. ist recht robust mit kleinen KV Cache, aber Gemma verliert deutlich an Qualität. Siehe: https://localbench.substack.com/p/kv-cache-quantization-benchmark
 
Zuletzt bearbeitet:
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
q8_0 / q6_0 für große Speichereinsparungen mit fast keinem Qualitätsverlust
q6_0 / q5_0 für maximale Einsparungen mit sehr geringen Qualitätsverlust
nachdem flash_attn damit nicht läuft (was ich mich erinnere) bzw. glaube), isses wsl eher nutzlos.
Zumindest mit assymetrischen Varianten läuft flash_attn imho nicht, und das will man eigentlich haben.

q8/q4 hab ich schon mal getestet, hat praktisch imho nicht funktioniert (Fehler geworfen?).
ob q5_0 bzw. q6_0 (symmetrisch) nun in akzeptabler Geschwindigkeit läuft, hängt wohl vom Backend ab... gibt da wohl Unterschiede zwischen Cuda/ROCm/apple ...
 
Zuletzt bearbeitet:

Oh, könnte man damit auch unterschiedliche Generationen verheiraten? Hätte z.B. 2x 3090, 1x 4090 und 1x 5090 im Angebot und dazu mobile 4070 und 3080 in Laptops. :d Bringt einem dafür ein sehr schnelles Netz was (bestimmt, hab ja mein 100Gbit Netz gerade weitgehend zurückgebaut)? ;)

Jedenfalls cool, dass auch Linux und Windows miteinander geht. Da käme bei mir jedenfalls durchaus was zusammen - fehlt nur der Einsatzzweck.
 
@besterino "PAIR erkennt kompatible Rechner im Netzwerk, verbindet sie miteinander und richtet sie für sogenannte agentische Workflows ein. Dabei werden komplexe KI-Aufgaben in kleinere Arbeitsschritte zerlegt, die parallel verarbeitet werden können. Unterstützt werden Nvidia-Grafikkarten ab der GeForce-RTX-20-Serie sowie RTX-Pro-GPUs und DGX-Spark-Systeme. Auch Macs mit Apples M4-Chip oder neueren Prozessoren lassen sich einbinden."
Oh, könnte man damit auch unterschiedliche Generationen verheiraten?

Davon gehe ich aus.


1788622704003.png
 
Zuletzt bearbeitet:
nachdem flash_attn damit nicht läuft (was ich mich erinnere) bzw. glaube), isses wsl eher nutzlos.
Zumindest mit assymetrischen Varianten läuft flash_attn imho nicht, und das will man eigentlich haben.

q8/q4 hab ich schon mal getestet, hat praktisch imho nicht funktioniert (Fehler geworfen?).
ob q5_0 bzw. q6_0 (symmetrisch) nun in akzeptabler Geschwindigkeit läuft, hängt wohl vom Backend ab... gibt da wohl Unterschiede zwischen Cuda/ROCm/apple ...

Flash Attention funktioniert auch bei asymmetrischen KV Cache, das war möglicherweise in alten llama builds noch nicht unterstützt.

Ja Q8/Q4 liefert bei meinen genutzten Modellen auch nur Müll, Q8/Q5_1 ist die kleinste Kombination die mir keine Fehler wirft.
Zwischen Q8_0/Q8_0 vs Q5_0/Q5_0 habe ich bei Dense Modellen wie z.B. Glimmer 30B keinen Geschwindigkeitsvorteil erhalten, nur wie zu erwarten weniger VRAM Verbrauch beim KV Cache.
 
Ich finde es interessant das Qwen 3.8-27b bei einigen von euch schneller ist. Denn bei mir ist es mit 16,55 T/s langsamer als Qwen 3.6-27b mit 33,03 T/s. Nur Vulcan llama.cpp wurde zwischen durch geupdated und LM Studio. Unter Linux.
Gut so sehr stören tut es mich nicht da ich IBM Granite 4 H Tiny sehr gerne zum Vibe Coding benutze. Habe dort 159,26 T/s. Gut is auch nur eine sehr kleine LLM mit 3,94 GB. Für Nutzer mit begrenztem VRAM sehr interessant. Ich denke auch das solch speziallisierten LLMs die Zukunft gehört. Gerade im Privaten/Lokalen Bereich. Da man damit die Hardwarekosten im überschauberen Bereich bleiben.

Hat schon jemand von euch LM Studio Bionic ausprobiert? Ich traue mich nicht so wirklich ran, wegen den Agenten. Nicht das die mir versehentlich die SSD löschen.
 
Komisch, auf welcher Karte? Bei mir sind 3.6 27b und 3.8 27b ähnlich, 3.6 war schon ne Krücke. MTP hilft, aber auch nicht sooo viel bei mir. Evtl. hast beim 3.6er MTP laufen gehabt und jetzt nicht? Mit Themen, bei denen MTP sehr gut funktioniert?
Beitrag automatisch zusammengeführt:

Also bei mir läuft eine AMD Instinct MI50-32GB (Radeon Pro Vega VII) mit Qwen 3.8 27b via Vulkan mit knapp 20 tok/sec im LMStudio unter Windows.
Die Karten wurden letztes Jahr auf eBay für 160€ verramscht, habe 3 Stück. :)
Richtig geil, die Gurken hab ich leider verpasst.
Ist zwar uralt-Vega aber der HBM dürfte rocken... läuft das bei dir mit ROCm oder Vulkan?
 
Richtig geil, die Gurken hab ich leider verpasst.
Ist zwar uralt-Vega aber der HBM dürfte rocken... läuft das bei dir mit ROCm oder Vulkan?
Im Moment und der einfachheit halber mit Vulkan unter Windows, ROCm klappt nur nativ unter Linux (WSL - Windows Subsystem for Linux klappt nicht) und auch da muss man etwas frickeln bzw. ist auf die Comunity angewiesen und läuft nicht out of the box es sei denn, man gibt sich mit einer inzwischen sehr alten Version zufrieden. Angeblich ist die MI50 mit ROCm unter Linux nochmal bis zu 1/3 schneller (kommt aber immer etwas darauf an) als unter Windows mit Vulkan.
 
Komisch, auf welcher Karte? Bei mir sind 3.6 27b und 3.8 27b ähnlich, 3.6 war schon ne Krücke. MTP hilft, aber auch nicht sooo viel bei mir. Evtl. hast beim 3.6er MTP laufen gehabt und jetzt nicht? Mit Themen, bei denen MTP sehr gut funktioniert?
7900XT, wenn ich MTP ausschalte bei 3.8 komme ich nur auf 12,87 T/s.
Bei Granite 4 H ist MTP ausgeschaltet. Ich denke auch bei 3.6. Habe nicht an den Einstellungen rum gespielt.
 
Tiny H, hybrid MoE 7B/1B active. Wobei man sagen muss die sind alle nicht riesig. Das größte 7 GB oder so. Für viele Nutzer die Vibe Coden wollen, interessant.

Das jüngste Update von LM Studio und llama.cpp scheint etwas geändert zu haben. 26,1 T/s bei Qwen 3.8 27b.
 
Ja mehr ist immer besser.
B60 ist der Radiallüfter laut oder leise? Denke drüber nach mir eine Single Slot B50 zu holen.
 
Ist erstaunlich leise (war meine größte Sorge) zumindest die ASRock B60 Blower Variante und bei meinen OpenFrame Case (siehe: https://www.hardwareluxx.de/community/threads/lukü-bilder-kommentare.780754/page-692#post-31246737) - wie das Intel Referenz Design bei der B50 in einem geschlossenen Case ist kann man da nicht ableiten.
Bei ~ 150 W (Volllast bei LLM Aktivität) dreht der kleine 70mm Lüfter gerade mal mit 1.350 rpm, das ist subjektiv ungefähr so laut wie ein 120mm bei 800rpm.
 
Ich geh davon aus, dass die Karten alle "okay" sind... die Gigabyte AI Top ist sehr harmlos...
Die r9700 XFX soll wohl nen scheiß Lüfter haben und besonders laut sein lt. 2 reviews (1x gh, 1x irgendwo reddit), was wirklich dran ist, kein Plan.

Die Blower-Karten sind halt nicht das leiseste, verglichen mit ner 3-Lüfter-200W-tdp Karte (9070, 5070...) natürlich "laut", verglichen zu diversen Historischen Karten, SLI/CF Setups etc. eigentlich überschaubar.
 
Ich sag mal so: Im Rack in einem Silverstone RM4A mit 3 Arctic S12038-8K in der Front hört man meine AsRock R9700 nicht aus den Gehäuse heraus :fresse:
Mit ner Noctua NL-LC1 36 in der Front geht es aber. Immer die Frage, ab wann das eigene Empfinden oder der WAF sich dran stört. verglichen mit ner 7900XTX aber definitiv lauter, für mich aber nicht störend.
 
Hab die ganze Zeit so kack FOMO weil ich keine 2. r9700 geholt hab... jetzt sind die nicht so Preiswert. Hab schon überlegt ne 9070(XT) dazu zu hängen, gleicher Chip, gleich schnell, bremste also nicht und immerhin 48gb VRAM, ist aber auch meh...

Eigetnlich wär diese Arena Modell Funktion spannend (also 2 Modelle am gleichen Thema arbeiten zu lassen, damit man 2 "Meinungen" hat), wenn ich da über meine Popel-Verbindung zwischen GPU und Storage das Modell immer "umladen" muss und den KV Cache neu erstellen, wirst ja alt, die beiden müssten schon zugleich geladen werden können...
Zudem bissl Platz für die RAG Modelle.. mhmh...

Ich hab gelesen, dass man für die Blower-GPUs für genug "Gehäuseüberdruck" sorgen soll (dann sollen sie wohl besser und leiser laufen), klingt eigentlich auch logisch...
 
Hatte vor zwei Wochen Glück und habe noch eine bei Kleinanzeigen geschnappt. Hab mit einer schon vllm genutzt. Ist einfach viel entspannter, weil sich andere um Treiber und Versionen kümmern und der Rumms einfach läuft. Habe aktuell das hier:
Qwen3.8-27B-Quark-AWQ-MXFP4

Anhang anzeigen IMG_0202.jpeg
 
hnnnnnng muss kaufen... darf nicht kaufen...
1789395845700.png

Hm, wie isses vllm als Backend für OpenWebUI einzurichten, oder wie machst dus?
 
Hm, wie isses vllm als Backend für OpenWebUI einzurichten, oder wie machst dus?
Kaufen Du musst :banana:

Spiele mit den Agenten noch rum. War nach Hermes bei Pi.
Aber für normale Fragerei hab ich wie Du Jan.ai.
Das vllm stellt eine Openai kompatible API bereit.
 
Hab die ganze Zeit so kack FOMO weil ich keine 2. r9700 geholt hab... jetzt sind die nicht so Preiswert. Hab schon überlegt ne 9070(XT) dazu zu hängen, gleicher Chip, gleich schnell, bremste also nicht und immerhin 48gb VRAM, ist aber auch meh...
---snip---
Frag mich mal.
In der Bucht verhauen die Chineses dual MI50s mit je 32 GB für 1k€...
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh