Wenn ich reich wäre, würde ich das so machen.

Bei den Speicherpreisen, die sich eben auf alles mit Speicher auswirkt, muss man eben kleinere Brötchen backen und mehr Kompromisse eingehen.
Ne, läuft noch nicht alles. Da läuft primär dann STT/TTS, Embedding, Reranker und noch irgendein kleineres LLM drauf, wenn ich etwas leistungsfähigeres brauche, hab ich meinen Haupt-PC mit meiner 4090 und 64GB DDR5 RAM, da läuft locker Qwen 3.8 Next Flash drauf, ~120B Modell mit nGram Teil, den man auf die SSD packen kann, sonst wäre es ein 180B Modell. Eine zweite Grafikkarte im KI Server, welches dann eher eine schwächere wird, dient dann auch eher dazu Zeug von der 5080 auf diese zu verschieben, um dort ein größeres LLM / mehr KI Kram nutzen zu können. Darum will ich auch die NPU nutzen, um VRAM zu sparen. Werde ich dann alles noch austesten müssen.
Dank MoE Modellen kann man diese recht gut auf VRAM und RAM gleichzeitig laufen lassen bei noch angenehmer Geschwindigkeit, bei einem Dense Modell sinkt da direkt die Geschwindigkeit in den Keller. RAM ist aber eben so oder so dann der Bremsklotz, weshalb ich auch primär aufrüsten wollte, meine jetzige Hardware ist ein alter 8700K mit 4x 8GB DDR4 RAM Dual Channel, also alles nur noch optimal. Mehr VRAM ist zwar immer gut, aber wie gesagt, bei den Preisen...
Zum richtig mit KI arbeiten nutze ich eh ChatGPT/Codex, da ist wenig was irgendwie großartig Datenschutz/Privatsphäre relevant für mich wäre. Was das betrifft und lokal läuft, ist das eher ein KI (Sprach) Assistent ,u.a. auch für SmartHome, und unterschiedliche Arten von Rollenspielen mit KI, was mir ab und zurecht viel Spaß macht, und wo mir dann Privatspähre doch wichtiger ist und vor allem auch nicht an einem Cloud-Angebot zu hängen, wo man der Willkür des Betreibers ausgesetzt ist. Da ich gerne endlos Rollenspiele spiele, die ich immer mal wieder weiterführe, ist lokal und alles unter eigener Kontrolle einfach besser. Mal davon ab, dass Cloud meist auch Abo bedeutet.
Ich denke jedenfalls, dass das schon eine solide Plattform für KI Kram wird.