Neuer AI-Server

Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Habe aktuell auf meinem PC Qwen3.8 27B am laufen und es ist echt spooki wie krass das teil ist. das erste mal das ich eine Lokale KI teste aber ich merke schon das 32Gb VRAM eigentlich zu wenig sind wenn man da richtig was machen will

EDIT: Kenne mich da aber auch nicht wirklich aus
 
Zuletzt bearbeitet:
GLM 5.3 Flash würde auf nem Mac Studio M5 Ultra mit 512GB ohne Probleme laufen :fresse2:. Muss mir noch überlegen ob es 2-3x AI Max 192GB oder ein M5 Ultra 512GB wird.

Bin echt beeindruckt wie flott das GLM 5.3 Flash ist und mehr oder weniger auf GLM 5.2 Niveau.
 
Hast Cache im Überfluss?

Bei MoE Modellen ist durchaus ein teilweises Offloading interessant, genug Bandbreite vorausgesetzt.

Du bräuchtest:
1) Genug "normalen" RAM.
1b) Genug "schnellen " normalen RAM
2) Genug VRAM für KV-Kontext und Experts.
3) Genug Bandbreite, das resultiert aus 1b und noch viel kritischer aus der PCIe Bandbreite. PCIe 4 (also DDR4) ist da schwach, im Idealfall brauchst du PCIe 5 (also DDR5).
3b) Den VRAM aus mehreren GPUs mit PCIe 5.0x16 bilden, 5060Ti fallen also raus, 9070(XT) wäre evtl. ne interessante Möglichkeit.

Killen wird hier einen der DDR5 RAM, DDR4 ginge ja noch irgendwie.
Realistisch: Epyc Rome mit nem Asrock Rack dazu, gibts mit 7x 16x4.0 Slots.

4x PCIe 4.0x16 sind ca. 4x 30gb/s also 120gb/s.
8x DDR4 3200 macht ca. 200 gb/s, 2666er langt also auch.

Dense ist halt scheiße, wenns nicht in den VRAM passt. wären dann 64gb VRAM und xxx RAM um ... tja... 4x650 = 2600€ GPU
SP3 Board wirds wsl. nicht all zu teuer geben, irgend nen popeligen SP3 Epyc auch (braucht ja nur die Lanes und Speicherkanäle).

MoE mit teilweisem Offloading wäre damit wsl. vergleichsweise "schnell", zumindest nicht langsamer als AI-Max oder DGX-Spark.

Drum ist wohl DDR4 auch noch so teuer.
Beitrag automatisch zusammengeführt:

Nachtrag:
Crosslink hier rüber: https://www.hardwareluxx.de/community/threads/suche-helferlein-für-suche-und-zusammenfassungen-in-und-von-lokalen-sourcen.1381179/
Da wurde etwas gequatscht über kleinere Modelle und die Sache mit MoE Expert Splitting zwischen VRAM und RAM.
Beitrag automatisch zusammengeführt:

Nochwas.

Qwen 3.8 27b Dense (und auch schon 3.6) zeigt, dass die "Nützlichkeit" einer KI nicht linear skaliert mit den Billion Parameters.
Andererseits sieht man, dass kleinere Modelle einfach richtig mies fallen, siehe Gemma A4B, Qwen 9b etc... (und das obwohl diese genannten Modelle eigentlich schon zu den "sehr guten" gehören).

Wird ne ln(x) Funktion sein... mehr Parameter ist natürlich immer besser, die Frage ist nur wie viel.


Insofern ist die Frage, obs lohnt, ein richtig fettes Monster zu bauen.
Ist halt die Frage, welche Modelle "wir" abbekommen.

Ich ärger mich nicht gleich 2 R9700 gekauft zu haben, hmhm... eine reicht momentan aber joa.
 
Zuletzt bearbeitet:
Wenn da was dran ist, dass llama.cpp so viel schneller ist als ollama, werde ich wohl testweise erstmal ne .cpp instanz aufsetzen...
 
Ich überleg grad, ich hatte ollama auch schon mal als backend... weils angeblich besser mit openwebui läuft, fand aber kacke wie das mit dem Modelfile läuft und so... bin dann wieder zurück.
Bin mir nicht sicher ob da so viel um war, glaub fast nicht...

Es ist allgemein ein bissl ein Krampf mit der Software.
Zu vllm kann ich nix sagen.
 
Naja ein mittlere M5 Ultra mit 256 Gbyte kostet ja ~ 13.000 inkl MwSt, der mit 512 könnte bei 20k+ liegen - dafür kann man auch schon nen Batzen Tokens kaufen auch auf Topp Modellen.

Ich denke aktuell ist für Home AI das warten auf den Xiaomi AI Cube interessant - und solange halt Tokens nutzen. Über openrouter und Co kann man auch für viele Sachen einfache China Modelle nutzen die teils supergünstig sind.


QWen 3.8 Flash z.B. mit 1 Mio Kontext In / Out Price $0,15 / $0,47per 1M gerade die Kontextlänge ist halt bei lokal meist nur 260k - das ja doch leider dann schnell mal einschränkend.
 
Zuletzt bearbeitet:
Darf ich fragen was ihr so mit der ki macht? Interessiert mich sehr was man so sinnvolles machen kann

@pwnbert vielleicht auch per pn? Weil finde das alles super interessant.
Qwen3.8 27B läuft nun auch mit 26200 context und I'm VRAM und mit WhatsApp Nutzung hat er mir auch hinprogrammiert 😅
 
Zuletzt bearbeitet:
Darf ich fragen was ihr so mit der ki macht? Interessiert mich sehr was man so sinnvolles machen kann
Nichts so spannendes.

Mein erster echter Einsatz war einfach copy&paste Hilfe für Linux.
Noch ohne Agent und so, muss mir das erst ansehn.
Einfach gesagt was ich machen will, ggf. Konsolen Outputs und Infos geliefert, dafür Hinweise bekommen wie ich was machen soll und diese ggf auch per copy&paste in die Bash kopiert.
Natürlich nicht mega automatisiert, hab aber nächtelanges Foren lesen erspart und ich doch auch was gelernt.

Ginge wohl per Agents automatisiert, mal sehn.

Ganz klassisch:
Oder z.B. einfache Zusammenfassungs-Tasks... ich hab ein Buch, auch als PDF (Master Key System). Da sind am Ende der meisten Kapitel so ne Art Medidationsübung drin. Ich hab der KI gesagt, sie soll mir bitte ne kompakte Liste mit all diesen Übungen machen, zusätzlich dazu ne Quellenangabe auf welcher Seite das zu finden ist (damit ichs bequem nachprüfen kann).
Hat geklappt.

Oder, wofür vllt. auch die Uncensored Models interssant sind, Infos über Medizin & Medikamente, ob ne Kombination gefährlich ist oder nicht, oder ob ein gewisses Nahrungsergänzungsmittel "fake" ist oder funktioniert usw...
Klar, am Ende muss man immer noch selbst schlau sein... das Risiko, dass das Wissen total falsch ist, ist bei ner KI gegeben.
Trotzdem, ich kan dieses "blabla, ich darf dazu eigentlich nix sagen weil ich ne KI bin" nicht ausstehen, weiss ich selbst, dass es ne KI ist. Soll mir sagen, was sie weiss (oder glaubt).

Ganz spannend auch z.B. Infos von Qwen durch Gemma prüfen lassen oder umgekehrt.


Grundsätzlich ist es erstmal ne Ausbildungs- und Weiterbildungsarbeit.
Mir gefällt die Idee, dass ich ne KI offline und lokal nutzen kann.
 
Ja habe auch viel mit KI umgesetzt aber vorher alles erfragt und dann selber gemacht und die Lokale hat mir einiges selber eingestellt was ich einfach krass fand. Bei meinem Windows ging auch powershell nicht . lag an der Version die ich nutze und der hat das einfach repariert.
Dachte aber eigentlich das ihr vieleicht damit euch geld verdient. Dachte da an automatisiertes Trading oder so. Also wenn das überhaupt möglich ist. Laut KI kann er mir das Programmieren o_O

P.s. mein NAS habe ich auch per KI mit Tailscale usw eingestellt weil ich kam vorher nicht über 16mb/s im upload obwohl eigentlich 60+gehen sollten und dank KI habe ich das nun bei festgenagelten 63MB/s
 
Klar ginge das wohl irgendwie, diverse Plattformen haben ja APIs und so.

Kann man sich sicher hincoden, speziell mit Agenten.
Aber nachdem es ja Hobby ist und ich dafür nur ne begrenzte Menge Zeit hab etc... naja.

Dafür wäre es wsl. besser ein Claude Abo zu füttern, alles einfacher.
Das "Projektmanagement" in open-web-ui muss ich mir erst genauer ansehen.


Es ist jetzt nicht so, dass du dir einfach fürn paar 1000€ Hardware kaufst und alles is in Butter.
 
Deshalb habe ich ja gefragt weil ich mir von erfahrenen Leuten vielleicht mal paar anreize holen kann ohne das wer Lacht oder so. Interessiert mich eben
 
Schau, mit genug Zeit und Muße kannst du verdammt viel machen.

Claude ist the way to go, wenns Online sein darf. Kostet Geld, aber ist überschaubar. AI-Homelab eskaliert preismäßig total, wenn du hier mal 300€ fürs AI Abo raus geblasen hast in 3 Monaten isses nicht schlimm.
Damit kannst halt loslegen.
Jan.ai lokal ist z.B. auch nice., ich habs sehr gern am Desktop.

Du kannst es dir so vorstellen...
Du willst ein Auto tunen.
1) Du lässt den Kram die Werkstatt machen = Claude.
2) Du beginnst dir erstmal selbst deine Werkstatt einzurichten, baust deine Garage um, ne Bühne, kaufst Drehbank und Fräse, Druckluft... ist am Ende teurer und dauert (viel) länger. Dafür isses deins. Und theoretisch kannst es immer wieder machen und hast ein 2. Standbein geschaffen.
 
Ist qwen 3.8 27b nicht so gut? Weil habe da nen Video bei CT3003 gesehen mit Lokale KI ist sowas von da. War sehr interessant weshalb ich das halt ausprobiert habe.
 
Doch, 3.6 27b war schon super. Mit 3.8 hab ich noch nicht so viel gemacht, wenns aber ne Verbesserung zu dem schon guten Modell ist, isses hammer.

Ich meine nicht, dass es nicht gut ist. In den Basics laufen lassen is auch easy.
Ich meine so ein Projekt, mit Agent, Sub-Agents, RAG und so...

Wenn du dir selbst ein SearNXG als Suchmaschine dafür im Docker installierst und entsprechend brauchbar konfigurierst usw..
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh