Neuer AI-Server

@butcher1de
Bei den KI Vergleichen muss man auch immer aufpassen. Ist einfach nicht mehr aktuell, dass die Qwen2.5 vergleichen. Bei 32GB halt auch 26B Modelle und nicht 8b :d
Ich hoffe Du willst den MacMini auch für andere Dinge nutzen. Ansonsten sind 2k für 170 GB/s Bandbreite echt schwach.
Und im Vergleich gibts einen Ryzen AI Max+ 395 mit 128GB noch für 2600€. Der hat 256 GB/s Bandbreite.
 
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Ich habe mir einen Mac Mini M6/32/1TB/10G vorbestellt. Wollte zum rumspielen mit Agenten, erst die Standard Version, da hat mir aber jede Ki von abgeraten. Ich habe noch Null Ahnung davon aber jeder fängt ja mal an :-)
Für den Zweck ist das leider ein Vollgacks, anders kann mans nicht nennen.

Hab ja noch so ein Ultra 255 Notebook mit 32gb RAM, das kann auch sehr viel RAM als VRAM verwenden, insofern sehr ähnlich. Speicherbandbreite ist kleiner, GPU schwächer, aber geschenkt.
Gemma 4 26B als Q2kP (HauHauCS) oder UD-Q2-K-XL oder so läuft drauf, das gehts ich im RAM/VRAM mit etwas Kontext grad noch aus, ist von der Qualität her voll okay (diese 9-14b Modelle sind einfach zum scheißen, so ein hoch optimierter Q2 Quant verliert zwar auch Qualität, ist aber haushoch über so Dreck wie 9b qwen oder Gemma 4 12b oder noch kleiner).
Qwen 3.6 27B läuft als Q2 Quant mit ca. 1 token/s. Wenn der Mac 5x so schnell ist (was er wsl. nicht ist), ist das immer noch mega mies.

Gemma 4 26B A4B z.B. ist als MoE relativ flott, selbst auf einer schwachen GPU bzw. mit wenig Speicherbandbreite, damit bekomm ich mit MTP immerhin 10 token/s... was nutzbar ist aber schon ziemlich langweilig.


Wenn du irgend nen Agenten hast, der über Nacht ackern darf ist das ja okay, wenn du in "Echtzeit" mit dem Ding reden magst, ist alles unter 20-50 Token/s sehr lame.
20 token/s macht die R9700 mit Qwen 3.8 27b UD-Q4-K-XL ohne MTP und das ist schon relativ lame, wenn das Reasoning noch umfangreich ist.
60 token/s macht die R9700 mit Gemma 4 26B A4B (Q4/Q5), das ist voll okay. Ist halt nicht so "deep" für viele Arbeiten, das Qwen Dense ist schon geil.
120 token/s macht die 5090 mit Gemma 4 26B A4B (Q4/Q5), das ist geil und macht richtig spaß, damit chattet das Zeug so richtig in Echtzeit zurück, selbst wenn mal bissl "nachdenken" muss.


So ein gut komprimiertes Gemma 4 26B A4B oder Qwen 3.8 27b wirst schon laufen lassen können...
Die 2 Modelle selbst haben ca. 14-16gb in entsprechender Quantisierung, bleibt noch ca. 8gb Platz für KV Cache (ist nicht üppig aber auch nicht wenig), dann bist bei 24gb und hast noch 8gb über für OS&Browser.

=> Kann man machen, wird aber keinen Spaß machen.
Wenn du irgend nen Agenten hast, der selbstständig ohen User-Eingriffe über Nacht sein Zeug macht, okay.
Wenn du aktiv damit arbeitest und reden magst, wirds eher zach.


.... ich hoffe, du verwendest das Ding primär für was anderes.
Wenns ein AI Spaßrechner sein soll stornier das Ding und stell dir irgend eine Vollgurke (AM4, S1200/S1700, popel-cpu mit satt RAM) mit ner Arc-Pro B60 24gb hin...
Beitrag automatisch zusammengeführt:

Und im Vergleich gibts einen Ryzen AI Max+ 395 mit 128GB noch für 2600€. Der hat 256 GB/s Bandbreite.
Wo?
Imho 3800€ der billigste GMKtek Chinaböller.
Beitrag automatisch zusammengeführt:

Nachtrag:
Die Realität ist, dass diese ~600gb/s Speicherbandbreite von 9070(XT), R9700 Ai-Pro, Arc B65/70 schon nur so medium sind... is zwar schon ganz gut und brauchbar, aber eher die Untergrenze von dem, was bequem ist und man gern hätte.
Die 450gb/s der Arc Pro B60 24gb sind imho schon so eine Sache, P/L mäßig mit 24gb aber ganz in Ordnung.

Vielleicht wäre eine 7900 XTX 24gb mit ihren 900gb/s gar nicht so uninteressant... sind schlecht gealtert und sterben wohl gern überdurchschnittlich (so den ein oder anderen Fall sieht man).
Solang der Preis passt, könnte man das aber überlegen.

Hat schon nen Grund, warum die RTX6000 96gb (und auch die 5090) gekauft werden, 1800gb/s sind schon nochmal anders.


Ist ja toll, der Unified Memory, aber 1. lohnt das erst, wenn man "genug" davon hat und 2. isses over all halt doch langsam.
Klar, ein größeres MoE rennt drauf nicht so schlecht, vor allem hat man gut Platz für Kontext.

Aber so die Eierlegende-Wollmilch-Endlösung isses halt nicht, wie alle tun.
Auch so ein DGX Spark ist eigentlich ziemlich lahm.
 
Zuletzt bearbeitet:
Im Garantiefall, kein Plan.
Im Zweifel ohne, wie bei all dem Chinazügs. 💁‍♂️
... gibts einen Ryzen AI Max+ 395 mit 128GB noch für 2600€.
"Zollfrei in der EU ab Lager D". Zollfrei ist nicht MwSt-frei. :sneaky:
Gibt's auch bei Amazon das Ding und dann inklusive aller Kosten für ~3k € oder 2.8k CHF. Wäre ok angesichts der Tatsache, daß solche Geräte fast nirgends überhaupt erhältlich sind.
Jetzt hab ich persönlich noch nie von Bosgame gehört. 🫨
 
@pwnbert und Rest.. Wenn ich das alles so lese und hoffentlich verstehe.... Meine beiden M4 behalten, Apple keine Kohle (und zwar reichlich davon) in den Anus blasen und zum rumspielen meine GTX 4090 mit dem 9950X3d und 64GB Ram nehmen.
Dagegen spricht der hohe Stromverbrauch gegenüber dem Mac. Hmmmm :confused:

Wenn der Agent über Nacht ackert wäre mir das eigentlich egal, bei der dicken Kiste eher nicht. Dann wäre noch das Problem der Lieferbarkeit, jetzt auf erste Test warten und dann Monate keinen mehr bekommen, ist auch nicht Toll.

Und ja der Mac würde auch für Büro Arbeiten und das Übliche herhalten müssen.
Aber so die Eierlegende-Wollmilch-Endlösung isses halt nicht, wie alle tun.
Muss es auch nicht. Wenn/falls ich mal richtig Plan davon habe und denke mehr zu brauchen, kann ja immer noch auf was größeres ausweichen. Für rumprobieren ist mir eigentlich jetzt schon die Kiste zu teuer, über den M5Pro und größer + Ram oder höher reden wir mal nicht.

EDIT: ich werde mit dem jetzigen System anfangen und dann schauen wie es läuft. wenn der Mac kommt, stelle ich das selbe Szenario dann auf dem Mac nach. Wenn das annehmbar läuft, bleibt er, wenn nicht geht er zurück. Ich denke das ist die beste Lösung für mich.
 
Zuletzt bearbeitet:
Genau, machs am Desktop.
Mit ner 4090 bist bei 24gb / 1000gb/s eh ganz gut dabei, dann kannst mal einschätzen, wie schnell/langsam usw...

Apple kauft man doch eigentlich nur, wenn man den Lock-In genießt. Mag auch tatsächlich praktisch sein, unter gewissen Bewertungskriterien, mag da keinem seine Vorliebe für dieses Ökosystem absprechen, funktioniert sicher alles äußerst bequem zusammen, ohne sich viel damit beschäftigen zu müssen... und schlecht is die Hardwarequalität ja nicht...
Ob man den Lock-In (inkl. der ganzen Cloud) will und ob einem die bequemlichkeit den Preis wert is... der eine schon, der andere nicht, beide haben ihre Gründe, mag das nicht bewerten.

Aber wegen der "AI Power" allein? Idk...
Dagegen spricht der hohe Stromverbrauch gegenüber dem Mac. Hmmmm :confused:
Na erstmal spielst ja nur bissl rum damit, wegen 20€ Strom rumeiern is jetzt nicht besonders schlau.
 
Aber wegen der "AI Power" allein?
Für größere Modelle ist Apple quasi die einzige halbwegs bezahlbare Option, oder wo bekommt man sonst ein System mit 512GB “VRAM” für unter 20k :fresse2:

Ich hab mir auch nen Mac Mini M6 32GB (10GBe) bestellt, aber primär als Desktop Workstation und weniger als “KI”-Spielwiese, meine alltäglichen Arbeitstiere (GLM-5.3-Flash, GLM-5.2, MiniMax-M3 oder Deepseek-V4-Flash) werden darauf schließlich nicht laufen ^^.

Aber so nen Qwen3.6-35B/Qwen3.8-27B sollte schon darauf laufen, wenn die Kiste da ist wird das mal evaluiert ;). Mein selbstgehostetes Qwen3.6-35B läuft aktuell auf 2x 5070 Ti’s.
 
2666er RDIMM gibts relativ "billig" (+/- 150€).
Dual Sockel Zen 3 Epyc mit 16 Stück davon und schauen was so geht, dazu 4x Arc Pro B60 oder 9070(XT). CPUs gibts günstig, Board muss man bissl schauen, is aber nicht der Killer.

Müsste man halt rechnen, was das so zusammenbringt.
Die Großen sind eh alle MoE und in 64-96gb VRAM passt schon bissl Kontext und die Experts.
4x PCIe 4.0x16 schafft zwar "nur" 128gb/s, aber nachdem nur die Experts drüber müssen, sollte das halbwegs laufen.

Braucht halt Strom. Ist vom Tempo her aber wsl. doch noch ne andere Liga... müsste man mal schauen, obs Tests damit gibt. Wissen tu ichs natürlich nicht.
Aber so nen Qwen3.6-35B/Qwen3.8-27B sollte schon darauf laufen
Isn massiver Unterschied, Qwen 3.6 35B A3B ist mitunter eines der schnellsten größeren LLMs, weils nur 3B aktive Experts hat (Gemma 4 26 A4B immerhin 4B, also 33% mehr).
Qwen 3.6/3.8 27B isn Dense, das schneckt schon auf einer 5090, im Verhältnis zum MoE.
 
Soo, gestern aus Frust über die CPU-Performance von Qwen3.8 27B mit 16 Kernen im Keller mal lokal ne llama.cpp rocm Instanz aufgesetzt.
(Die olle M60 kann kein Unified Memory und kackt beim laden vom 27B ab...)

Des scheint nicht ganz in die 16 GB von der 6900 XTXH zu passen... =(
Das 3.5 9B zieht beim halluzinieren immer 100 % GPU, das 27B stottert immer mal.

Ist aber tatsächlich ein riesiger Unterschied, was das 9B alles an Sachen hinzu lügt, geht auf keine Kuhhaut ("Wie funktioniert eine Nixie-Röhre?", da scheitern ALLE 9er und kleiner dran...).
Aber der Speed ist schon krass unterschiedlich:
Qwen3.5 9B:
Keller M60: ~14 t/s
Desktop 6900XTXH: ~63 t/s

Qwen3.8 27B:
Keller M60: crash
Keller 16 Xeon Gold 6140 Kerne: ~1 t/s
Desktop 6900XTXH: ~11 t/s (intermittierend)

Lade gerade das 3.6 35B-A3B, mal sehen, wie das auf dem Desktop laggt.

//Edith:
Ok, krass, das hätte ich SO nicht erwartet:
1788245722690.png
Task 0: "Warum ist der Himmel blau?"
Task 1045: "Wie funktioniert eine Nixie-Röhre?"

Alles zufriedenstellend erklärt, bis auf dass die Anode einer Nixie-Röhre halt außen drumrum ist, statt in der Mitte...

//Edith2:
Zusatzfrage:
Was rödelt das 3.6 35B noch so ewig auf der Festplatte hinterher (aktuell ca. 10 min)?
Seit den Abfragen habe ich einen konstanten Stream von 30 MB/s Down- und 1,5 MB/s Upload aufm iSCSI...
 
Zuletzt bearbeitet:
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh