Neuer AI-Server

Bei Neukauf ne flotte Gen 5 (kaum teurer als Gen 4), aber erstmal lass es so. Viel schneller wirds nicht, was auch immer da wirklich bottelnecked, ich bin lokal auf ner guten PCIe 4.0 auch deutlich langsamer, als ich sein sollte beim Laden.
Ja, muss ich mal testen. Notfalls mal mit Codex ein kleines Script zum Messen schreiben, aber an sich zeigt schon ein Kaltstart vs Warmstart Vergleich gut, ob eventuell die m.2 bremst. Wäre halt gut den Start schneller zu kriegen um eventuell zwischen LLMs schneller wechseln zu können. Aber macht auch erst richtig Sinn, wenn KI und alles mal so weit steht und ich dann besser weiß, ob ich das überhaupt wirklich benötige.

RAM ist auch egal solang er schneller ist als PCIe 5.0x16, für dein MoE Offloading.
Mit 48/16gb bekommst KV-Cache und Experts ganz gut in die GPU, musst halt passend einstellen.
Vorteil, du kannst größere Quants der 3xB Klasse verwenden, also Q6K-irgendwas, macht wohl die MoE Quali etwas besser... mehr als 30-40b MoE bekommst halt trotzdem kaum unter.
Ja, will jetzt auch nicht den RAM verpulvern, von dem brauche ich auch etwas für anderen Kram, u.a. auch als schnellen Cache. :D
Wird sich dann schon zeigen, das wird eh noch Wochen dauern bis alles mal so weit steht, weil ich auch viel Software selbst mit KI erstellen lasse, statt irgendein fertiges Framework zu nehmen. Zum Beispiel steht auch noch gar nicht fest, welche Inferenz Engine ich am Ende nehmen werde. GGUF ist ja nur eine Möglichkeit, gibt ja auch noch andere wie EXL3 oder gar direkt welche optimiert für Blackwell 5000er Karten, die wohl auch die Performance von LLMs erhöhen können. Hab eigentlich nur GGUF bisher genutzt nur mal kurz EXL2 ausprobiert, da war EXL3 noch zu neu und experimentell.

Am Ende will ich den KI-Server für alle möglichen Spielereien nutzen, auch in Videospielen. Gibt ja schon diverse Projekte für unterschiedliche Spiele, die KI einbinden. Für Skyrim, Fallout 4, Starfield (Bethesda Spiele), aber auch für Elite Dangerous, wie ich vor ein paar Tagen erst gesehen habe, Kenshi (wobei ich immer noch nicht weiß ob das überhaupt ein Spiel für mich ist) u.a. Bei solchen KI-Mods ist es besser, wenn man die KI auf einem extra Rechner hat, wenn man keine Cloud KI verwenden will. Und vielleicht auch eigene Experimente mit KI Integration (ja, Neuro Sama hat mich da etwas inspiriert). Aber erst mal muss alles mal stehen, endlich. xD

Spannend wäre das neue Qwen 3.8 Flash Next. ~180b MoE.
Hat als UD-Q2-K-XL halt immer noch 80gb.

Müsste dafür RAM vom NAS in die Workstation stecken damit ich da auf 128gb komme, dann könnte ich das mit der 5090 machen... ist aber nur DDR4 und PCIe Gen 4, also meh...
Das liegt auch noch auf meiner Platte auf meinem Haupt PC, allerdings als Q5_K_M. Kam noch nicht dazu es auszuprobieren, ist aber so lauffähig mit meiner 4090 24GB VRAM und 64GB DDR5 RAM, weil ~51(?)GB nur n-Gram Layer sind, die man auf die SSD packen kann und so nur noch ~128B für das eigentliche LLM übrig bleiben, das passt locker in 88GB.
 
Zuletzt bearbeitet:
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Na da bin ich neugierig, das halte ich für blauäugig. Aber wenn dus zum laufen bekommst sag Bescheid, 32/64 hab ich auch, wär schon neugierig. Glaub das aber nicht ganz, dass das so geht.,
 
Nun, auf r/LocalLLaMA haben es genau so Leute ans Laufen gebracht, teils sogar mit nur 16GB VRAM. Der n-Gram Teil benötigt dabei so wenig Lesezugriff, dass man diese sogar auf einer SATA SSD betreiben könnte, der liest nur wenige MB/s aus dieser.

Hier ein Beispiel:

Bei mir auf der Platte belegt das Modell selbst in Q5_K_M 51,6 GB + Kontext Fenster, die in VRAM und RAM müssen, die 51GB n-Gram Dateien bleibt auf der SSD. Sehe nicht, warum das Platzmäßig nicht gehen soll. Ich hab auch schon Mistral 4 Small benutzt, was ein 119B Modell ist (60GB in IQ4_XS). Das einzig besondere an Qwen 3.8 Flash Next ist eben die n-Gram Datei.
 
Soso, die -ngram mod settings also.
Fühl dich frei hier runter zu tippen, wie man das in llama.cpp richtig macht, damit verdienst dir einen Keks.
 
Einfach dem bei Reddit verlinkten Github Link folgen? :fresse:


Werden sogar einzelne llama.cpp Parameter erklärt.
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh