Neuer AI-Server

Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Habe aktuell auf meinem PC Qwen3.8 27B am laufen und es ist echt spooki wie krass das teil ist. das erste mal das ich eine Lokale KI teste aber ich merke schon das 32Gb VRAM eigentlich zu wenig sind wenn man da richtig was machen will

EDIT: Kenne mich da aber auch nicht wirklich aus
 
Zuletzt bearbeitet:
GLM 5.3 Flash würde auf nem Mac Studio M5 Ultra mit 512GB ohne Probleme laufen :fresse2:. Muss mir noch überlegen ob es 2-3x AI Max 192GB oder ein M5 Ultra 512GB wird.

Bin echt beeindruckt wie flott das GLM 5.3 Flash ist und mehr oder weniger auf GLM 5.2 Niveau.
 
Hast Cache im Überfluss?

Bei MoE Modellen ist durchaus ein teilweises Offloading interessant, genug Bandbreite vorausgesetzt.

Du bräuchtest:
1) Genug "normalen" RAM.
1b) Genug "schnellen " normalen RAM
2) Genug VRAM für KV-Kontext und Experts.
3) Genug Bandbreite, das resultiert aus 1b und noch viel kritischer aus der PCIe Bandbreite. PCIe 4 (also DDR4) ist da schwach, im Idealfall brauchst du PCIe 5 (also DDR5).
3b) Den VRAM aus mehreren GPUs mit PCIe 5.0x16 bilden, 5060Ti fallen also raus, 9070(XT) wäre evtl. ne interessante Möglichkeit.

Killen wird hier einen der DDR5 RAM, DDR4 ginge ja noch irgendwie.
Realistisch: Epyc Rome mit nem Asrock Rack dazu, gibts mit 7x 16x4.0 Slots.

4x PCIe 4.0x16 sind ca. 4x 30gb/s also 120gb/s.
8x DDR4 3200 macht ca. 200 gb/s, 2666er langt also auch.

Dense ist halt scheiße, wenns nicht in den VRAM passt. wären dann 64gb VRAM und xxx RAM um ... tja... 4x650 = 2600€ GPU
SP3 Board wirds wsl. nicht all zu teuer geben, irgend nen popeligen SP3 Epyc auch (braucht ja nur die Lanes und Speicherkanäle).

MoE mit teilweisem Offloading wäre damit wsl. vergleichsweise "schnell", zumindest nicht langsamer als AI-Max oder DGX-Spark.

Drum ist wohl DDR4 auch noch so teuer.
Beitrag automatisch zusammengeführt:

Nachtrag:
Crosslink hier rüber: https://www.hardwareluxx.de/community/threads/suche-helferlein-für-suche-und-zusammenfassungen-in-und-von-lokalen-sourcen.1381179/
Da wurde etwas gequatscht über kleinere Modelle und die Sache mit MoE Expert Splitting zwischen VRAM und RAM.
Beitrag automatisch zusammengeführt:

Nochwas.

Qwen 3.8 27b Dense (und auch schon 3.6) zeigt, dass die "Nützlichkeit" einer KI nicht linear skaliert mit den Billion Parameters.
Andererseits sieht man, dass kleinere Modelle einfach richtig mies fallen, siehe Gemma A4B, Qwen 9b etc... (und das obwohl diese genannten Modelle eigentlich schon zu den "sehr guten" gehören).

Wird ne ln(x) Funktion sein... mehr Parameter ist natürlich immer besser, die Frage ist nur wie viel.


Insofern ist die Frage, obs lohnt, ein richtig fettes Monster zu bauen.
Ist halt die Frage, welche Modelle "wir" abbekommen.

Ich ärger mich nicht gleich 2 R9700 gekauft zu haben, hmhm... eine reicht momentan aber joa.
 
Zuletzt bearbeitet:
Wenn da was dran ist, dass llama.cpp so viel schneller ist als ollama, werde ich wohl testweise erstmal ne .cpp instanz aufsetzen...
 
Ich überleg grad, ich hatte ollama auch schon mal als backend... weils angeblich besser mit openwebui läuft, fand aber kacke wie das mit dem Modelfile läuft und so... bin dann wieder zurück.
Bin mir nicht sicher ob da so viel um war, glaub fast nicht...

Es ist allgemein ein bissl ein Krampf mit der Software.
Zu vllm kann ich nix sagen.
 
Naja ein mittlere M5 Ultra mit 256 Gbyte kostet ja ~ 13.000 inkl MwSt, der mit 512 könnte bei 20k+ liegen - dafür kann man auch schon nen Batzen Tokens kaufen auch auf Topp Modellen.

Ich denke aktuell ist für Home AI das warten auf den Xiaomi AI Cube interessant - und solange halt Tokens nutzen. Über openrouter und Co kann man auch für viele Sachen einfache China Modelle nutzen die teils supergünstig sind.


QWen 3.8 Flash z.B. mit 1 Mio Kontext In / Out Price $0,15 / $0,47per 1M gerade die Kontextlänge ist halt bei lokal meist nur 260k - das ja doch leider dann schnell mal einschränkend.
 
Zuletzt bearbeitet:
Darf ich fragen was ihr so mit der ki macht? Interessiert mich sehr was man so sinnvolles machen kann

@pwnbert vielleicht auch per pn? Weil finde das alles super interessant.
Qwen3.8 27B läuft nun auch mit 26200 context und I'm VRAM und mit WhatsApp Nutzung hat er mir auch hinprogrammiert 😅
 
Zuletzt bearbeitet:
Darf ich fragen was ihr so mit der ki macht? Interessiert mich sehr was man so sinnvolles machen kann
Nichts so spannendes.

Mein erster echter Einsatz war einfach copy&paste Hilfe für Linux.
Noch ohne Agent und so, muss mir das erst ansehn.
Einfach gesagt was ich machen will, ggf. Konsolen Outputs und Infos geliefert, dafür Hinweise bekommen wie ich was machen soll und diese ggf auch per copy&paste in die Bash kopiert.
Natürlich nicht mega automatisiert, hab aber nächtelanges Foren lesen erspart und ich doch auch was gelernt.

Ginge wohl per Agents automatisiert, mal sehn.

Ganz klassisch:
Oder z.B. einfache Zusammenfassungs-Tasks... ich hab ein Buch, auch als PDF (Master Key System). Da sind am Ende der meisten Kapitel so ne Art Medidationsübung drin. Ich hab der KI gesagt, sie soll mir bitte ne kompakte Liste mit all diesen Übungen machen, zusätzlich dazu ne Quellenangabe auf welcher Seite das zu finden ist (damit ichs bequem nachprüfen kann).
Hat geklappt.

Oder, wofür vllt. auch die Uncensored Models interssant sind, Infos über Medizin & Medikamente, ob ne Kombination gefährlich ist oder nicht, oder ob ein gewisses Nahrungsergänzungsmittel "fake" ist oder funktioniert usw...
Klar, am Ende muss man immer noch selbst schlau sein... das Risiko, dass das Wissen total falsch ist, ist bei ner KI gegeben.
Trotzdem, ich kan dieses "blabla, ich darf dazu eigentlich nix sagen weil ich ne KI bin" nicht ausstehen, weiss ich selbst, dass es ne KI ist. Soll mir sagen, was sie weiss (oder glaubt).

Ganz spannend auch z.B. Infos von Qwen durch Gemma prüfen lassen oder umgekehrt.


Grundsätzlich ist es erstmal ne Ausbildungs- und Weiterbildungsarbeit.
Mir gefällt die Idee, dass ich ne KI offline und lokal nutzen kann.
 
Ja habe auch viel mit KI umgesetzt aber vorher alles erfragt und dann selber gemacht und die Lokale hat mir einiges selber eingestellt was ich einfach krass fand. Bei meinem Windows ging auch powershell nicht . lag an der Version die ich nutze und der hat das einfach repariert.
Dachte aber eigentlich das ihr vieleicht damit euch geld verdient. Dachte da an automatisiertes Trading oder so. Also wenn das überhaupt möglich ist. Laut KI kann er mir das Programmieren o_O

P.s. mein NAS habe ich auch per KI mit Tailscale usw eingestellt weil ich kam vorher nicht über 16mb/s im upload obwohl eigentlich 60+gehen sollten und dank KI habe ich das nun bei festgenagelten 63MB/s
 
Klar ginge das wohl irgendwie, diverse Plattformen haben ja APIs und so.

Kann man sich sicher hincoden, speziell mit Agenten.
Aber nachdem es ja Hobby ist und ich dafür nur ne begrenzte Menge Zeit hab etc... naja.

Dafür wäre es wsl. besser ein Claude Abo zu füttern, alles einfacher.
Das "Projektmanagement" in open-web-ui muss ich mir erst genauer ansehen.


Es ist jetzt nicht so, dass du dir einfach fürn paar 1000€ Hardware kaufst und alles is in Butter.
 
Deshalb habe ich ja gefragt weil ich mir von erfahrenen Leuten vielleicht mal paar anreize holen kann ohne das wer Lacht oder so. Interessiert mich eben
 
Schau, mit genug Zeit und Muße kannst du verdammt viel machen.

Claude ist the way to go, wenns Online sein darf. Kostet Geld, aber ist überschaubar. AI-Homelab eskaliert preismäßig total, wenn du hier mal 300€ fürs AI Abo raus geblasen hast in 3 Monaten isses nicht schlimm.
Damit kannst halt loslegen.
Jan.ai lokal ist z.B. auch nice., ich habs sehr gern am Desktop.

Du kannst es dir so vorstellen...
Du willst ein Auto tunen.
1) Du lässt den Kram die Werkstatt machen = Claude.
2) Du beginnst dir erstmal selbst deine Werkstatt einzurichten, baust deine Garage um, ne Bühne, kaufst Drehbank und Fräse, Druckluft... ist am Ende teurer und dauert (viel) länger. Dafür isses deins. Und theoretisch kannst es immer wieder machen und hast ein 2. Standbein geschaffen.
 
Ist qwen 3.8 27b nicht so gut? Weil habe da nen Video bei CT3003 gesehen mit Lokale KI ist sowas von da. War sehr interessant weshalb ich das halt ausprobiert habe.
 
Doch, 3.6 27b war schon super. Mit 3.8 hab ich noch nicht so viel gemacht, wenns aber ne Verbesserung zu dem schon guten Modell ist, isses hammer.

Ich meine nicht, dass es nicht gut ist. In den Basics laufen lassen is auch easy.
Ich meine so ein Projekt, mit Agent, Sub-Agents, RAG und so...

Wenn du dir selbst ein SearNXG als Suchmaschine dafür im Docker installierst und entsprechend brauchbar konfigurierst usw..
 
Ist mir schon klar, dass es ein Risiko ist mit den Mod 3080er.
Aber Käse ist es nicht. Viele kaufen für 1000€ eine 3090. Dafür gibts halt zwei von den Chinabombern.
Intel will keiner so richtig anfassen, das wird schon Gründe haben.

Hatte auch erst überlegt eine gebrauchte RTX3090 zu kaufen, war mir dann aber doch zu heiß so ganz ohne Garantie bei dem Preis zuzuschlagen.
Habe mir eine Intel Arc Pro B60 24 GB für 679,- neu geholt und es nicht bereut, denn der llama.cpp SYCL Port läuft sehr stabil und die Leistung passt auch.
Wenn das OpenVINO Backend zukünftig auch noch vollständig mit llama.cpp integriert ist, wird das auch noch einmal für einen guten Leistungssprung sorgen.
Aber ja mit Nvidia hat man Out-of-the-Box mehr Optionen und es ist alles einfacher.
 
Hast das Ding mit Vulkan laufen?
Wie viel Token/s macht so ein Qwen 3.8 27b bei dir?
 
Nein wie geschrieben nutze ich SYCL und nicht Vulkan (das ist bei weitem nicht so stabil wie SYCL).
Ich habe bei Qwen 3.8 27B mit 32K Context und Q4_K_M Quantisierung und KV Cache Q8 + MTP Draft-Max 2, läuft dann mit 18 T/s.
Das Modell nutze ich aber nicht, ich verwende primär Gemma 4 26B A4B, das läuft vollständig im VRAM mit maximalen Context bei 262K und habe dann 36 T/s.
Aktuell bin ich am Testen mit Qwen 3.6 35B A3B das passt auch vollständig in den VRAM nur der maxiale Context wird nur mit CPU Offload erreicht was Leistung kostet, aber mit kleinen Context (20K) passt auch das Modell vollständig in dem VRAM.
 
Gar nicht so übel. Qwen 3.x 27b Dense ist halt ein guter Benchmark weils ein mittelgroßes Dense Modell ist, das noch dazu sehr mächtig und populär ist.
18 T/s mit MTP? Wäre spannend, wie viel es ohne ist. Ohne macht die R9700 etwa 23 T/s, also nicht sooo viel mehr.
Hätte bei der Arc B60 die Sorge gehabt, dass sie durch die kleine Speicherbandbreite etwas lahm ist (gut, ist sie auch im Vergleich zu 4090, 5090, ist die R9700 aka 9070XT32gb aber auch).

Sieht so aus, als ob die Arc Pro B60 momentan ganz interessant ist, vor allem als Dual-GPU Setup (wenn man ein System hat, wo die auf CPU Lanes laufen können oder der Chipsatz ResizeBAR unterstützt, wenn ich das richtig verstehe).
 
Mit und ohne MTP ist der Unterschied nicht so groß, mit MTP 18 T/s ohne MTP 14 T/s. Nutze aber auch sehr konservative Werte:
Code:
--spec-draft-n-max 2
--spec-draft-p-min 0.80
Da könnte man schon noch mehr Geschwindigkeit raus kitzeln, aber Qualität ist mir wichtiger.

Die Intel Arc Pro GPUs sind IMHO stark unterbewertet, man konnte im Juni für um die 1000,- neu eine Arc Pro B65 mit 32GB VRAM kaufen. Aktuell sind da die Preise auch nochmals über 200,- höher angezogen.
Aber aus P/L neu 32 GB VRAM und über 600 GB/s Speicherbrandbreite für knapp 1000 Euro waren schon unschlagbar, aber ich war trotzdem irgendwie nicht bereit die ~ 340 Euro Aufpreis zu einer B60 zahlen um "nur" 8 GB mehr VRAM und eine höhere Speicherbrandbreite zu haben.
 
So, llama-cpp mit openwebui ist verbunden, angeblich soll man über die oberfläche auch modelle laden können, habs bislang noch nicht geschafft...
Modelle per CLI zu laden ist so 1990...
 
Darf ich fragen was ihr so mit der ki macht? Interessiert mich sehr was man so sinnvolles machen kann
Spontanes Beispiel:
Qwen 3.6 27b hat das ziemlich gerockt.
Gemma 4 26b a4b hats ähnlich gut hinbekommen, hätte keinen groben Fehler gesehn.

Gemma 4 12b war meh, so grundsätzliches Blabla das nicht falsch ist (so bissl Bewertungen von 555 vs ATtiny). Auf Nachfrage gabs dann auch Code (etwas anders, sieht am 1. Blick aber okay aus), Pinout Beschreibung war grundsätzlich auch da.
Zur Versorgung mit 5V aus 12V hat es dann nen Spannungsteiler vorgeschlagen, was IMHO ziemlicher Bullshit ist. Bei genauerer Nachfrage hat er komisch rumgetan und einfach Bullshit erzählt (ich weiss, dass der µC Strom zu viel schwankt für nen Spannungsteiler, da müsste der Querstrom schon groß sein). Die ganze Idee wurde dann massiv verschlimmbessert.
Auf die Idee auf nen Stepper zu verweisen isses nicht gekommen.

Das zeigt schon die Risiken, die KI gestütztes Arbeiten mit sich bringt, wenn man selbst nicht erfahren genug ist um die Sinnhaftigekeit der Antwort einzuschätzen.
Schlimm ist, dass "dumme" KIs einfach "lügen" weil sie sich ihrer Dummheit nicht bewusst sind, genau wie die Menschen halt auch oft.

Für mich ist Qwen 27b Dense ein tolles "Arbeits-LLM" für "seriöse Jobs", Gemma 4 26b a4b ein tolles "Quatsch-LLM" (das durchaus mehr kann, die Kommunikation ist aber sehr "comfy" für unsere westlichen Gewohnheiten).
Alles kleinere ist einfach pfui. Spannend, dass diese 2 Modelle mit ihren knappen ~30b wohl so ne Art "Schallmauer" durchbrochen haben... die sind schon verdammt gut bei kompakter Größe.

Ärgert mich, dass ich nicht 2 von den AI-Pro gekauft hab, jetzt is mir die 2. zu teuer (und wird wsl. noch teurer lol).

So, llama-cpp mit openwebui ist verbunden, angeblich soll man über die oberfläche auch modelle laden können, habs bislang noch nicht geschafft...
Modelle per CLI zu laden ist so 1990...
Du brauchst den "Router Mode", die KIs verweisen ungern auf den, warum auch immer.
Hier ein Sniplet, den Rest musst dir selber rauswürgen:
Systemd Service anlegen:
Code:
cat > /etc/systemd/system/llama-router.service <<'EOF'
[Unit]
Description=llama.cpp model router
After=network.target

[Service]
Type=simple
ExecStart=/root/llama.cpp/build/bin/llama-server \
  --device ROCm0 -mg 0 -sm none \
  --models-dir /mnt/ai-models \
  --host 0.0.0.0 --port 8080 \
  --n-gpu-layers 999 --ctx-size 128000 --threads 4 \
  --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on \
  --parallel 1 --models-max 1 \
  --jinja --reasoning-format deepseek
Restart=on-failure

[Install]
WantedBy=multi-user.target
EOF
Code:
systemctl daemon-reload
systemctl enable --now llama-router.service

Special (hat mir Claude geflüstert, ob das so stimmt, kein Plan, klingt plausibel und scheint zu funktionieren):
Du solltest das --jinja --reasoning-format deepseek dazu nehmen und bei der Verbindung in OpenWebUi "Default" nehmen nicht nicht llama.cpp.
Dann sollte theoretisch das <thinking>...</thinking> Zeugs von Qwen und Gemma nicht mit in den KV Cache aufgenommen werden (weil es dir mit hohem Thinking sofort den Context zumüllt, hab das Problem grad in jan.ai am Desktop, weil dort irgendwie die "strip reasoning from context" Funktion verschwunden ist.

Hab das ausnahmsweise mit Claude (free) gemacht, weil mich jan.ai genervt hat und ich ja schwer den LLM Server verwenden kann, wenn ich dran rumfrickel.
Claude ist schon okay und wsl. sein Geld wert, ich mags trotzdem Lokal.
 
Zuletzt bearbeitet:
was nutzt du denn für die KI? gibt ja da einiges an Programme.
Ich habe aktuell LM Studio Bionic aber soll ja noch andere geben die aber teilweise langsamer sein sollen. habe das bis jetzt das erste mal ausprobiert und vorher nichts Lokal gehabt sondern immer Gemini um hilfe gefragt und da auch paar Änderungen vorgenommen damit die antworten besser sind
 
"Jan.ai" lokal, lies den Thread: https://www.hardwareluxx.de/community/threads/suche-helferlein-für-suche-und-zusammenfassungen-in-und-von-lokalen-sourcen.1381179/
Mit deiner 4090 bist gut dabei, probier ein Gemma 4 26B A4B ( https://huggingface.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF lad das "gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf" runter fürs erste, mmproj bf16 kannst dazu nehmen, mtp kannst weg lassen, bringt bei der 5090 keinen Vorteil, kA wies bei der 4090 ist).

llama.cpp Backend und OpenWebUi Frontend am Server.

PS: Gemma 4 26b a4b fand die Idee mit dem Spannungsteiler sofort Kacke und hat gemeint, ich soll ein PCB mit Wide Input Range suchen, eigentlich die beste Antwort.
Keine Ahnung was die Leute im Internet haben mit ihrem "12b dense ist so toll weil dense".. ja ne, eher nicht.
 
llama.cpp-cuda lüppt im docker, deshalb ne docker compose yml aber duckai hat mich auch af die richtigen environment variables gebracht, am ende war ich noch so doof und hab nicht bedacht, dass der /models im docker halt im root ist und nicht wie lokal unter /mnt/ai_models/llama.cpp, nachdem ich das noch in der Variable getauscht hatte, sehe ich jetzt auch die lokalen Modelle.
damit fliegt ollama runter.
Problem ist das nicht vorhandene autounloading, das nervt bissi, ist aber zu vertreten, schlimmer ist, dass der Eject-Button in OpenwebUI nur als Admin auftaucht und somit normale User gerade an das Modell gebunden sind, welches ICH gerade missbrauche...
 
Ich habe mir einen Mac Mini M6/32/1TB/10G vorbestellt. Wollte zum rumspielen mit Agenten, erst die Standard Version, da hat mir aber jede Ki von abgeraten. Ich habe noch Null Ahnung davon aber jeder fängt ja mal an :-)

Fand ich ganz Interessant. https://wavect.io/de/blog/mac-mini-m6-vs-mac-studio-m5-local-ai/ und https://modelfit.io/guides/how-much-ram-for-local-llm/
1788175296684.png
 
Zuletzt bearbeitet:
Hmmm wobei lokal ja eher die abliterated Modelle sinnvoll sind :d die anderen gehen ja ok über openrouter und Co und sind da ja dann auch nicht sooooo teuer da gibt es oft ein supergünstiges.
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh