Neuer AI-Server

Aber irgendwas hats damit, ich glaube, MTP läuft so nicht.... oder doch? Not sure. Sollte so laufen lt. Claude... nachdem beim Qwen 3.8 27b Q4XL MTP "nur" 5 token/s bringt (von ca. 20 auf ca. 25), ist das schwer auszumachen, hängt wohl auch von Kontextlänge und Thema ab...
Bei schnellen MoE bringt MTP auch nicht zwingend was, auf der 5090 ist z.B. Gemma 4 26b a4b und Qwen 3.6 35b a3b mit MTP sogar ein paar token/s langsamer als ohne.
Wirklich schnell ist MTP am Laptop (Intel Ultra) mit dem Q2XL Gemma 4 26b a4b.. da bringt das massiv was (+80%?).

Ändere mal --spec-draft-p-min von 0.8 auf 0 - je nach Konstellation ist eine Erhöhung kontraproduktiv.



Btw. sehr guter Artikel zum KV Cache optimieren: https://anbeeld.com/articles/kv-cache-quantization-benchmarks-for-long-context

TL;DR

Zwei sinnvolle generelle Optionen.

q8_0 / q6_0 für große Speichereinsparungen mit fast keinem Qualitätsverlust
q6_0 / q5_0 für maximale Einsparungen mit sehr geringen Qualitätsverlust

Aber man sollte schon aufpassen was man für mein Modell nimmt. Qwen z.B. ist recht robust mit kleinen KV Cache, aber Gemma verliert deutlich an Qualität. Siehe: https://localbench.substack.com/p/kv-cache-quantization-benchmark
 
Zuletzt bearbeitet:
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
q8_0 / q6_0 für große Speichereinsparungen mit fast keinem Qualitätsverlust
q6_0 / q5_0 für maximale Einsparungen mit sehr geringen Qualitätsverlust
nachdem flash_attn damit nicht läuft (was ich mich erinnere) bzw. glaube), isses wsl eher nutzlos.
Zumindest mit assymetrischen Varianten läuft flash_attn imho nicht, und das will man eigentlich haben.

q8/q4 hab ich schon mal getestet, hat praktisch imho nicht funktioniert (Fehler geworfen?).
ob q5_0 bzw. q6_0 (symmetrisch) nun in akzeptabler Geschwindigkeit läuft, hängt wohl vom Backend ab... gibt da wohl Unterschiede zwischen Cuda/ROCm/apple ...
 
Zuletzt bearbeitet:

Oh, könnte man damit auch unterschiedliche Generationen verheiraten? Hätte z.B. 2x 3090, 1x 4090 und 1x 5090 im Angebot und dazu mobile 4070 und 3080 in Laptops. :D Bringt einem dafür ein sehr schnelles Netz was (bestimmt, hab ja mein 100Gbit Netz gerade weitgehend zurückgebaut)? ;)

Jedenfalls cool, dass auch Linux und Windows miteinander geht. Da käme bei mir jedenfalls durchaus was zusammen - fehlt nur der Einsatzzweck.
 
@besterino "PAIR erkennt kompatible Rechner im Netzwerk, verbindet sie miteinander und richtet sie für sogenannte agentische Workflows ein. Dabei werden komplexe KI-Aufgaben in kleinere Arbeitsschritte zerlegt, die parallel verarbeitet werden können. Unterstützt werden Nvidia-Grafikkarten ab der GeForce-RTX-20-Serie sowie RTX-Pro-GPUs und DGX-Spark-Systeme. Auch Macs mit Apples M4-Chip oder neueren Prozessoren lassen sich einbinden."
Oh, könnte man damit auch unterschiedliche Generationen verheiraten?

Davon gehe ich aus.


1788622704003.png
 
Zuletzt bearbeitet:
nachdem flash_attn damit nicht läuft (was ich mich erinnere) bzw. glaube), isses wsl eher nutzlos.
Zumindest mit assymetrischen Varianten läuft flash_attn imho nicht, und das will man eigentlich haben.

q8/q4 hab ich schon mal getestet, hat praktisch imho nicht funktioniert (Fehler geworfen?).
ob q5_0 bzw. q6_0 (symmetrisch) nun in akzeptabler Geschwindigkeit läuft, hängt wohl vom Backend ab... gibt da wohl Unterschiede zwischen Cuda/ROCm/apple ...

Flash Attention funktioniert auch bei asymmetrischen KV Cache, das war möglicherweise in alten llama builds noch nicht unterstützt.

Ja Q8/Q4 liefert bei meinen genutzten Modellen auch nur Müll, Q8/Q5_1 ist die kleinste Kombination die mir keine Fehler wirft.
Zwischen Q8_0/Q8_0 vs Q5_0/Q5_0 habe ich bei Dense Modellen wie z.B. Glimmer 30B keinen Geschwindigkeitsvorteil erhalten, nur wie zu erwarten weniger VRAM Verbrauch beim KV Cache.
 
Ich finde es interessant das Qwen 3.8-27b bei einigen von euch schneller ist. Denn bei mir ist es mit 16,55 T/s langsamer als Qwen 3.6-27b mit 33,03 T/s. Nur Vulcan llama.cpp wurde zwischen durch geupdated und LM Studio. Unter Linux.
Gut so sehr stören tut es mich nicht da ich IBM Granite 4 H Tiny sehr gerne zum Vibe Coding benutze. Habe dort 159,26 T/s. Gut is auch nur eine sehr kleine LLM mit 3,94 GB. Für Nutzer mit begrenztem VRAM sehr interessant. Ich denke auch das solch speziallisierten LLMs die Zukunft gehört. Gerade im Privaten/Lokalen Bereich. Da man damit die Hardwarekosten im überschauberen Bereich bleiben.

Hat schon jemand von euch LM Studio Bionic ausprobiert? Ich traue mich nicht so wirklich ran, wegen den Agenten. Nicht das die mir versehentlich die SSD löschen.
 
Komisch, auf welcher Karte? Bei mir sind 3.6 27b und 3.8 27b ähnlich, 3.6 war schon ne Krücke. MTP hilft, aber auch nicht sooo viel bei mir. Evtl. hast beim 3.6er MTP laufen gehabt und jetzt nicht? Mit Themen, bei denen MTP sehr gut funktioniert?
Beitrag automatisch zusammengeführt:

Also bei mir läuft eine AMD Instinct MI50-32GB (Radeon Pro Vega VII) mit Qwen 3.8 27b via Vulkan mit knapp 20 tok/sec im LMStudio unter Windows.
Die Karten wurden letztes Jahr auf eBay für 160€ verramscht, habe 3 Stück. :)
Richtig geil, die Gurken hab ich leider verpasst.
Ist zwar uralt-Vega aber der HBM dürfte rocken... läuft das bei dir mit ROCm oder Vulkan?
 
Richtig geil, die Gurken hab ich leider verpasst.
Ist zwar uralt-Vega aber der HBM dürfte rocken... läuft das bei dir mit ROCm oder Vulkan?
Im Moment und der einfachheit halber mit Vulkan unter Windows, ROCm klappt nur nativ unter Linux (WSL - Windows Subsystem for Linux klappt nicht) und auch da muss man etwas frickeln bzw. ist auf die Comunity angewiesen und läuft nicht out of the box es sei denn, man gibt sich mit einer inzwischen sehr alten Version zufrieden. Angeblich ist die MI50 mit ROCm unter Linux nochmal bis zu 1/3 schneller (kommt aber immer etwas darauf an) als unter Windows mit Vulkan.
 
Komisch, auf welcher Karte? Bei mir sind 3.6 27b und 3.8 27b ähnlich, 3.6 war schon ne Krücke. MTP hilft, aber auch nicht sooo viel bei mir. Evtl. hast beim 3.6er MTP laufen gehabt und jetzt nicht? Mit Themen, bei denen MTP sehr gut funktioniert?
7900XT, wenn ich MTP ausschalte bei 3.8 komme ich nur auf 12,87 T/s.
Bei Granite 4 H ist MTP ausgeschaltet. Ich denke auch bei 3.6. Habe nicht an den Einstellungen rum gespielt.
 
Tiny H, hybrid MoE 7B/1B active. Wobei man sagen muss die sind alle nicht riesig. Das größte 7 GB oder so. Für viele Nutzer die Vibe Coden wollen, interessant.

Das jüngste Update von LM Studio und llama.cpp scheint etwas geändert zu haben. 26,1 T/s bei Qwen 3.8 27b.
 
Ja mehr ist immer besser.
B60 ist der Radiallüfter laut oder leise? Denke drüber nach mir eine Single Slot B50 zu holen.
 
Ist erstaunlich leise (war meine größte Sorge) zumindest die ASRock B60 Blower Variante und bei meinen OpenFrame Case (siehe: https://www.hardwareluxx.de/community/threads/lukü-bilder-kommentare.780754/page-692#post-31246737) - wie das Intel Referenz Design bei der B50 in einem geschlossenen Case ist kann man da nicht ableiten.
Bei ~ 150 W (Volllast bei LLM Aktivität) dreht der kleine 70mm Lüfter gerade mal mit 1.350 rpm, das ist subjektiv ungefähr so laut wie ein 120mm bei 800rpm.
 
Ich geh davon aus, dass die Karten alle "okay" sind... die Gigabyte AI Top ist sehr harmlos...
Die r9700 XFX soll wohl nen scheiß Lüfter haben und besonders laut sein lt. 2 reviews (1x gh, 1x irgendwo reddit), was wirklich dran ist, kein Plan.

Die Blower-Karten sind halt nicht das leiseste, verglichen mit ner 3-Lüfter-200W-tdp Karte (9070, 5070...) natürlich "laut", verglichen zu diversen Historischen Karten, SLI/CF Setups etc. eigentlich überschaubar.
 
Ich sag mal so: Im Rack in einem Silverstone RM4A mit 3 Arctic S12038-8K in der Front hört man meine AsRock R9700 nicht aus den Gehäuse heraus :fresse:
Mit ner Noctua NL-LC1 36 in der Front geht es aber. Immer die Frage, ab wann das eigene Empfinden oder der WAF sich dran stört. verglichen mit ner 7900XTX aber definitiv lauter, für mich aber nicht störend.
 
Hab die ganze Zeit so kack FOMO weil ich keine 2. r9700 geholt hab... jetzt sind die nicht so Preiswert. Hab schon überlegt ne 9070(XT) dazu zu hängen, gleicher Chip, gleich schnell, bremste also nicht und immerhin 48gb VRAM, ist aber auch meh...

Eigetnlich wär diese Arena Modell Funktion spannend (also 2 Modelle am gleichen Thema arbeiten zu lassen, damit man 2 "Meinungen" hat), wenn ich da über meine Popel-Verbindung zwischen GPU und Storage das Modell immer "umladen" muss und den KV Cache neu erstellen, wirst ja alt, die beiden müssten schon zugleich geladen werden können...
Zudem bissl Platz für die RAG Modelle.. mhmh...

Ich hab gelesen, dass man für die Blower-GPUs für genug "Gehäuseüberdruck" sorgen soll (dann sollen sie wohl besser und leiser laufen), klingt eigentlich auch logisch...
 
Hatte vor zwei Wochen Glück und habe noch eine bei Kleinanzeigen geschnappt. Hab mit einer schon vllm genutzt. Ist einfach viel entspannter, weil sich andere um Treiber und Versionen kümmern und der Rumms einfach läuft. Habe aktuell das hier:
Qwen3.8-27B-Quark-AWQ-MXFP4

Anhang anzeigen IMG_0202.jpeg
 
hnnnnnng muss kaufen... darf nicht kaufen...
1789395845700.png

Hm, wie isses vllm als Backend für OpenWebUI einzurichten, oder wie machst dus?
 
Hm, wie isses vllm als Backend für OpenWebUI einzurichten, oder wie machst dus?
Kaufen Du musst :banana:

Spiele mit den Agenten noch rum. War nach Hermes bei Pi.
Aber für normale Fragerei hab ich wie Du Jan.ai.
Das vllm stellt eine Openai kompatible API bereit.
 
Hab die ganze Zeit so kack FOMO weil ich keine 2. r9700 geholt hab... jetzt sind die nicht so Preiswert. Hab schon überlegt ne 9070(XT) dazu zu hängen, gleicher Chip, gleich schnell, bremste also nicht und immerhin 48gb VRAM, ist aber auch meh...
---snip---
Frag mich mal.
In der Bucht verhauen die Chineses dual MI50s mit je 32 GB für 1k€...
 
Also ich habe mal spaßeshalber llama-cpp mit dem Qwen3.5-9B-The-Defiant-Fable-Uncnr-Heretic-plusIQ-NEO-MAX-MTP-Q8_0 auf meiner Workstation installiert. Open-Webui dazu und mal laufen lassen (ok, ein paar mehr Stunden einlesen und installieren waren es schon...).
Mit der Radeon 7800XT/16G kommt das Modell auf ca 50 Token/s bei meinen ersten Anfragen. Das fühlt sich schon ganz gut an, auf meinem Notebook AMD 350 Pro AI mit 16G RAM sind es immerhin 17-20 Token/s - und fühlt sich deutlich langsamer an.
Jetzt kommt noch VSCoder-dingens dazu, dann kann ich ein paar github-Projekte um meine Wünsche ergänzen ;)
Keine Ahnung (mehr) von Programmieren, aber architektionieren - das kann ich! ;)

edit: auf Kubuntu 26.04
 
Kann das irgendwas? Qwen 3.5 9b fand ich enttäuschend mies und diese special customs waren auch selten gut, aber wer weiss.
Probier mal ein Gemma 4 (Unsloth Quant in passender Größe, Q2KXL oder Q3-irgendwas), wenn du ein Uncensored brauchst ein HauHauCS (Q2KP z.B.).
Imho welten besser (auch als Gemma 4 12b).
Evtl. ist Qwen 3.5 9b aber in "Logiksachen" besser?

edit: Sorry, meinte Gemma 4 26B A4B
 
Zuletzt bearbeitet:
Kannte den Thread noch gar nicht. Morgen ist endlich wieder das Mainboard da und es geht erneut ans Basteln.

i7-8700K mit 4x8GB DDR4 auf Asrock Z370 Extreme 4 fliegt raus und wird durch einen Ultra 270K Plus mit 2x24GB DDR5 (leider nur 5600 CL46, der aber mit Standard timings auf 6400 läuft, immerhin) auf Gigabyte Z890 Aero G ersetzt. Was im Server bleibt ist die RTX 5080 und die m.2 500GB Samsung 970 EVO SSD, wobei ich da vielleicht noch eine kleine schnellere verbaue, um das Laden von KI Modellen zu beschleunigen, die jetzige m.2 ist noch eine PCIe3.0, also max. 3500MB/s.

Hätte natürlich auch gerne mehr VRAM... aber wir alle kennen das Problem. 😆

Aber mit dem Mainboard ist zumindest schon mal eine zweite GPU möglich, mit 5.0 x8 Betrieb, womit dann auch die 5080 laufen würde. Für größere KI Modelle hab ich mein Main PC, der Server wird eher für STT/TTS/Embedding/Memory und einem kleinen LLM für Sprachnutzung, das muss nicht super intelligent sein, nur gut genug Deutsch können und schnell sein, weswegen ich zu einem Gemma 4 MoE Modell tendiere. Eventuell ist Gemma 4 26B A4B dafür als irgendein ~4bit quant mit CPU Offload einiger Experten geeignet. Hängt davon ab, wie viel VRAM der andere Kram verbraucht. Eventuell ist Whisper per NPU schnell genug, dann könnte ich mir dafür VRAM sparen, für TTS nutze ich ein OmniVoice finetune, dass ich mit Daten von Sonic 3.6 auf eine KI generierte Stimme für Deutsch trainiert habe und bis jetzt sehr stabil wirkt. OmniVoice verbraucht bei mir inzwischen nur noch 2,6GB VRAM maximal in float16, damit sind noch grob 13,4GB VRAM frei.

Eine zweite GPU später dient dann eher zum auslagen von KI Modellen, bei denen Schnelligkeit nicht ganz so eine große Rolle spielt, also eher eine schwächere GPU mit 16GB VRAM, 5060/5070 TI oder ähnliches. Aber die käme eh erst irgendwann 2027 und wer weiß wo die Preise dann sind. :motz:
 
wie jetzt, 2x GPU ;)

Also ich habe vscodium mal mit der Aufgabe gefüttert, einen PHP-lastigen aber veralteten Code für PHP 8.4 anzupassen. Das wird wohl noch etwas dauern, aber:
Code:
Sep 29 21:38:12 higgins llama-server[85522]: 1.32.552.170 I slot print_timing: id  3 | task 219 |    graphs reused =        224
Sep 29 21:38:12 higgins llama-server[85522]: 1.32.553.813 I slot      release: id  3 | task 219 | stop processing: n_tokens = 37158, truncated = 0
Sep 29 21:38:15 higgins llama-server[85522]: 1.36.131.667 I slot get_availabl: id  3 | task -1 | selected slot by LCP similarity, f_sim_best = 0.927 (> 0.100 thold), f_keep = 0.999
Sep 29 21:38:15 higgins llama-server[85522]: 1.36.131.865 I slot launch_slot_: id  3 | task 261 | processing task, is_child = 0
Sep 29 21:38:21 higgins llama-server[85522]: 1.42.276.049 I slot print_timing: id  3 | task 261 | n_gen =    132, tg =  43.49 t/s, tg_3s =  43.82 t/s
Sep 29 21:38:22 higgins llama-server[85522]: 1.42.690.090 I slot print_timing: id  3 | task 261 | prompt eval time =    3131.86 ms /  2925 tokens (    1.07 ms per token,   933.95 tokens per s>
Sep 29 21:38:22 higgins llama-server[85522]: 1.42.690.094 I slot print_timing: id  3 | task 261 |        eval time =    3426.01 ms /   150 tokens (   22.99 ms per token,    43.49 tokens per s>
Sep 29 21:38:22 higgins llama-server[85522]: 1.42.690.096 I slot print_timing: id  3 | task 261 |       total time =    6557.88 ms /  3075 tokens
Sep 29 21:38:22 higgins llama-server[85522]: 1.42.690.096 I slot print_timing: id  3 | task 261 |    graphs reused =        372
Sep 29 21:38:22 higgins llama-server[85522]: 1.42.691.852 I slot      release: id  3 | task 261 | stop processing: n_tokens = 40191, truncated = 1

Sieht doch schon ganz schick aus. Ich musste nun "tunen", da 32k Token für die Aufgabe zu wenig waren, GPU hat aber nur 16GB VRAM, ... läuft erstmal wieder mit den Optionen "-fa on -ctk q8_0". Bleibe gespannt...
 
wobei ich da vielleicht noch eine kleine schnellere verbaue, um das Laden von KI Modellen zu beschleunigen, die jetzige m.2 ist noch eine PCIe3.0, also max. 3500MB/s.
Bei Neukauf ne flotte Gen 5 (kaum teurer als Gen 4), aber erstmal lass es so. Viel schneller wirds nicht, was auch immer da wirklich bottelnecked, ich bin lokal auf ner guten PCIe 4.0 auch deutlich langsamer, als ich sein sollte beim Laden.

RAM ist auch egal solang er schneller ist als PCIe 5.0x16, für dein MoE Offloading.
Mit 48/16gb bekommst KV-Cache und Experts ganz gut in die GPU, musst halt passend einstellen.
Vorteil, du kannst größere Quants der 3xB Klasse verwenden, also Q6K-irgendwas, macht wohl die MoE Quali etwas besser... mehr als 30-40b MoE bekommst halt trotzdem kaum unter.

Spannend wäre das neue Qwen 3.8 Flash Next. ~180b MoE.
Hat als UD-Q2-K-XL halt immer noch 80gb.

Müsste dafür RAM vom NAS in die Workstation stecken damit ich da auf 128gb komme, dann könnte ich das mit der 5090 machen... ist aber nur DDR4 und PCIe Gen 4, also meh...
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh