Hoto
Legende
- Mitglied seit
- 18.04.2009
- Beiträge
- 7.993
- Ort
- Aincrad
- Desktop System
- Main: Chii | [KI Server: Cardinal]
- Details zu meinem Desktop
- Prozessor
- Intel i7-14700KF | [8700K]
- Mainboard
- AsRock Z790 Steel Legend WiFi | [AsRock Z370 Extreme 4]
- Kühler
- be quiet! Dark Rock Pro 5
- Speicher
- 2x32GB G.Skill Trident Z5 DDR5-6000 CL30 @6200 | [4x8 GB DDR4]
- Grafikprozessor
- PNY RTX 4090 XLR8 Gaming Verto Epic-X Aktiv | [MSI RTX 5080 Ventus 3x OC]
- Display
- Samsung Odyssey OLED G8 G80SD / LU28R55 IPS (2x 4k) | [Sunshine/Moonlight]
- SSD
- Samsung 990 Pro 4TB (NVMe)/ 970 Evo Plus 2TB (NVMe) / 870 Evo 4TB (SATA) / 850 Evo 250GB (SATA)
- HDD
- WD 2TB / WD 4TB
- Opt. Laufwerk
- BluRay
- Soundkarte
- OnBoard (Realtek ALC897 - 5.1)
- Gehäuse
- Fractal Design Pop XL
- Netzteil
- be quiet! Straight Power 12 1000w | [be quiet! 700w]
- Keyboard
- Wooting One
- Mouse
- Logitech G9
- Betriebssystem
- CachyOS (Arch) KDE Plasma Wayland | [Ubuntu 26.04 LTS Server KDE Plasma Wayland]
- Webbrowser
- Firefox, Chromium
- Sonstiges
- Oculus Rift DK2 / CV1, HP Rev G2, Pico Neo 3 Link + HTC Facial Tracker + Index Controller inkl. 3x BaseStation 2.0, Tobii EyeTracker 4C, Leap Motion, [Sonoff Zigbee USB Stick 3.0]
- Internet
- ▼250 MBit ▲40 MBit
Ja, muss ich mal testen. Notfalls mal mit Codex ein kleines Script zum Messen schreiben, aber an sich zeigt schon ein Kaltstart vs Warmstart Vergleich gut, ob eventuell die m.2 bremst. Wäre halt gut den Start schneller zu kriegen um eventuell zwischen LLMs schneller wechseln zu können. Aber macht auch erst richtig Sinn, wenn KI und alles mal so weit steht und ich dann besser weiß, ob ich das überhaupt wirklich benötige.Bei Neukauf ne flotte Gen 5 (kaum teurer als Gen 4), aber erstmal lass es so. Viel schneller wirds nicht, was auch immer da wirklich bottelnecked, ich bin lokal auf ner guten PCIe 4.0 auch deutlich langsamer, als ich sein sollte beim Laden.
Ja, will jetzt auch nicht den RAM verpulvern, von dem brauche ich auch etwas für anderen Kram, u.a. auch als schnellen Cache.RAM ist auch egal solang er schneller ist als PCIe 5.0x16, für dein MoE Offloading.
Mit 48/16gb bekommst KV-Cache und Experts ganz gut in die GPU, musst halt passend einstellen.
Vorteil, du kannst größere Quants der 3xB Klasse verwenden, also Q6K-irgendwas, macht wohl die MoE Quali etwas besser... mehr als 30-40b MoE bekommst halt trotzdem kaum unter.

Wird sich dann schon zeigen, das wird eh noch Wochen dauern bis alles mal so weit steht, weil ich auch viel Software selbst mit KI erstellen lasse, statt irgendein fertiges Framework zu nehmen. Zum Beispiel steht auch noch gar nicht fest, welche Inferenz Engine ich am Ende nehmen werde. GGUF ist ja nur eine Möglichkeit, gibt ja auch noch andere wie EXL3 oder gar direkt welche optimiert für Blackwell 5000er Karten, die wohl auch die Performance von LLMs erhöhen können. Hab eigentlich nur GGUF bisher genutzt nur mal kurz EXL2 ausprobiert, da war EXL3 noch zu neu und experimentell.
Am Ende will ich den KI-Server für alle möglichen Spielereien nutzen, auch in Videospielen. Gibt ja schon diverse Projekte für unterschiedliche Spiele, die KI einbinden. Für Skyrim, Fallout 4, Starfield (Bethesda Spiele), aber auch für Elite Dangerous, wie ich vor ein paar Tagen erst gesehen habe, Kenshi (wobei ich immer noch nicht weiß ob das überhaupt ein Spiel für mich ist) u.a. Bei solchen KI-Mods ist es besser, wenn man die KI auf einem extra Rechner hat, wenn man keine Cloud KI verwenden will. Und vielleicht auch eigene Experimente mit KI Integration (ja, Neuro Sama hat mich da etwas inspiriert). Aber erst mal muss alles mal stehen, endlich. xD
Das liegt auch noch auf meiner Platte auf meinem Haupt PC, allerdings als Q5_K_M. Kam noch nicht dazu es auszuprobieren, ist aber so lauffähig mit meiner 4090 24GB VRAM und 64GB DDR5 RAM, weil ~51(?)GB nur n-Gram Layer sind, die man auf die SSD packen kann und so nur noch ~128B für das eigentliche LLM übrig bleiben, das passt locker in 88GB.Spannend wäre das neue Qwen 3.8 Flash Next. ~180b MoE.
Hat als UD-Q2-K-XL halt immer noch 80gb.![]()
unsloth/Qwen3.8-Flash-Next-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.huggingface.co
Müsste dafür RAM vom NAS in die Workstation stecken damit ich da auf 128gb komme, dann könnte ich das mit der 5090 machen... ist aber nur DDR4 und PCIe Gen 4, also meh...
Zuletzt bearbeitet:
