Hardwareluxx führt derzeit die Hardware-Umfrage 2026 (mit Gewinnspiel) durch und bittet um eure Stimme. Unter allen Teilnehmern verlosen wir eine aktuelle Grafikkarte Eurer Wahl bis 1099 EUR.
Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
@butcher1de
Bei den KI Vergleichen muss man auch immer aufpassen. Ist einfach nicht mehr aktuell, dass die Qwen2.5 vergleichen. Bei 32GB halt auch 26B Modelle und nicht 8b
Ich hoffe Du willst den MacMini auch für andere Dinge nutzen. Ansonsten sind 2k für 170 GB/s Bandbreite echt schwach.
Und im Vergleich gibts einen Ryzen AI Max+ 395 mit 128GB noch für 2600€. Der hat 256 GB/s Bandbreite.
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Ich habe mir einen Mac Mini M6/32/1TB/10G vorbestellt. Wollte zum rumspielen mit Agenten, erst die Standard Version, da hat mir aber jede Ki von abgeraten. Ich habe noch Null Ahnung davon aber jeder fängt ja mal an
Für den Zweck ist das leider ein Vollgacks, anders kann mans nicht nennen.
Hab ja noch so ein Ultra 255 Notebook mit 32gb RAM, das kann auch sehr viel RAM als VRAM verwenden, insofern sehr ähnlich. Speicherbandbreite ist kleiner, GPU schwächer, aber geschenkt.
Gemma 4 26B als Q2kP (HauHauCS) oder UD-Q2-K-XL oder so läuft drauf, das gehts ich im RAM/VRAM mit etwas Kontext grad noch aus, ist von der Qualität her voll okay (diese 9-14b Modelle sind einfach zum scheißen, so ein hoch optimierter Q2 Quant verliert zwar auch Qualität, ist aber haushoch über so Dreck wie 9b qwen oder Gemma 4 12b oder noch kleiner).
Qwen 3.6 27B läuft als Q2 Quant mit ca. 1 token/s. Wenn der Mac 5x so schnell ist (was er wsl. nicht ist), ist das immer noch mega mies.
Gemma 4 26B A4B z.B. ist als MoE relativ flott, selbst auf einer schwachen GPU bzw. mit wenig Speicherbandbreite, damit bekomm ich mit MTP immerhin 10 token/s... was nutzbar ist aber schon ziemlich langweilig.
Wenn du irgend nen Agenten hast, der über Nacht ackern darf ist das ja okay, wenn du in "Echtzeit" mit dem Ding reden magst, ist alles unter 20-50 Token/s sehr lame.
20 token/s macht die R9700 mit Qwen 3.8 27b UD-Q4-K-XL ohne MTP und das ist schon relativ lame, wenn das Reasoning noch umfangreich ist.
60 token/s macht die R9700 mit Gemma 4 26B A4B (Q4/Q5), das ist voll okay. Ist halt nicht so "deep" für viele Arbeiten, das Qwen Dense ist schon geil.
120 token/s macht die 5090 mit Gemma 4 26B A4B (Q4/Q5), das ist geil und macht richtig spaß, damit chattet das Zeug so richtig in Echtzeit zurück, selbst wenn mal bissl "nachdenken" muss.
So ein gut komprimiertes Gemma 4 26B A4B oder Qwen 3.8 27b wirst schon laufen lassen können...
Die 2 Modelle selbst haben ca. 14-16gb in entsprechender Quantisierung, bleibt noch ca. 8gb Platz für KV Cache (ist nicht üppig aber auch nicht wenig), dann bist bei 24gb und hast noch 8gb über für OS&Browser.
=> Kann man machen, wird aber keinen Spaß machen.
Wenn du irgend nen Agenten hast, der selbstständig ohen User-Eingriffe über Nacht sein Zeug macht, okay.
Wenn du aktiv damit arbeitest und reden magst, wirds eher zach.
.... ich hoffe, du verwendest das Ding primär für was anderes.
Wenns ein AI Spaßrechner sein soll stornier das Ding und stell dir irgend eine Vollgurke (AM4, S1200/S1700, popel-cpu mit satt RAM) mit ner Arc-Pro B60 24gb hin...
Nachtrag:
Die Realität ist, dass diese ~600gb/s Speicherbandbreite von 9070(XT), R9700 Ai-Pro, Arc B65/70 schon nur so medium sind... is zwar schon ganz gut und brauchbar, aber eher die Untergrenze von dem, was bequem ist und man gern hätte.
Die 450gb/s der Arc Pro B60 24gb sind imho schon so eine Sache, P/L mäßig mit 24gb aber ganz in Ordnung.
Vielleicht wäre eine 7900 XTX 24gb mit ihren 900gb/s gar nicht so uninteressant... sind schlecht gealtert und sterben wohl gern überdurchschnittlich (so den ein oder anderen Fall sieht man).
Solang der Preis passt, könnte man das aber überlegen.
Hat schon nen Grund, warum die RTX6000 96gb (und auch die 5090) gekauft werden, 1800gb/s sind schon nochmal anders.
Ist ja toll, der Unified Memory, aber 1. lohnt das erst, wenn man "genug" davon hat und 2. isses over all halt doch langsam.
Klar, ein größeres MoE rennt drauf nicht so schlecht, vor allem hat man gut Platz für Kontext.
Aber so die Eierlegende-Wollmilch-Endlösung isses halt nicht, wie alle tun.
Auch so ein DGX Spark ist eigentlich ziemlich lahm.
"Zollfrei in der EU ab Lager D". Zollfrei ist nicht MwSt-frei.
Gibt's auch bei Amazon das Ding und dann inklusive aller Kosten für ~3k € oder 2.8k CHF. Wäre ok angesichts der Tatsache, daß solche Geräte fast nirgends überhaupt erhältlich sind.
Jetzt hab ich persönlich noch nie von Bosgame gehört. 🫨
@pwnbert und Rest.. Wenn ich das alles so lese und hoffentlich verstehe.... Meine beiden M4 behalten, Apple keine Kohle (und zwar reichlich davon) in den Anus blasen und zum rumspielen meine GTX 4090 mit dem 9950X3d und 64GB Ram nehmen.
Dagegen spricht der hohe Stromverbrauch gegenüber dem Mac. Hmmmm
Wenn der Agent über Nacht ackert wäre mir das eigentlich egal, bei der dicken Kiste eher nicht. Dann wäre noch das Problem der Lieferbarkeit, jetzt auf erste Test warten und dann Monate keinen mehr bekommen, ist auch nicht Toll.
Und ja der Mac würde auch für Büro Arbeiten und das Übliche herhalten müssen.
Muss es auch nicht. Wenn/falls ich mal richtig Plan davon habe und denke mehr zu brauchen, kann ja immer noch auf was größeres ausweichen. Für rumprobieren ist mir eigentlich jetzt schon die Kiste zu teuer, über den M5Pro und größer + Ram oder höher reden wir mal nicht.
EDIT: ich werde mit dem jetzigen System anfangen und dann schauen wie es läuft. wenn der Mac kommt, stelle ich das selbe Szenario dann auf dem Mac nach. Wenn das annehmbar läuft, bleibt er, wenn nicht geht er zurück. Ich denke das ist die beste Lösung für mich.
Genau, machs am Desktop.
Mit ner 4090 bist bei 24gb / 1000gb/s eh ganz gut dabei, dann kannst mal einschätzen, wie schnell/langsam usw...
Apple kauft man doch eigentlich nur, wenn man den Lock-In genießt. Mag auch tatsächlich praktisch sein, unter gewissen Bewertungskriterien, mag da keinem seine Vorliebe für dieses Ökosystem absprechen, funktioniert sicher alles äußerst bequem zusammen, ohne sich viel damit beschäftigen zu müssen... und schlecht is die Hardwarequalität ja nicht...
Ob man den Lock-In (inkl. der ganzen Cloud) will und ob einem die bequemlichkeit den Preis wert is... der eine schon, der andere nicht, beide haben ihre Gründe, mag das nicht bewerten.
Für größere Modelle ist Apple quasi die einzige halbwegs bezahlbare Option, oder wo bekommt man sonst ein System mit 512GB “VRAM” für unter 20k
Ich hab mir auch nen Mac Mini M6 32GB (10GBe) bestellt, aber primär als Desktop Workstation und weniger als “KI”-Spielwiese, meine alltäglichen Arbeitstiere (GLM-5.3-Flash, GLM-5.2, MiniMax-M3 oder Deepseek-V4-Flash) werden darauf schließlich nicht laufen ^^.
Aber so nen Qwen3.6-35B/Qwen3.8-27B sollte schon darauf laufen, wenn die Kiste da ist wird das mal evaluiert . Mein selbstgehostetes Qwen3.6-35B läuft aktuell auf 2x 5070 Ti’s.
2666er RDIMM gibts relativ "billig" (+/- 150€).
Dual Sockel Zen 3 Epyc mit 16 Stück davon und schauen was so geht, dazu 4x Arc Pro B60 oder 9070(XT). CPUs gibts günstig, Board muss man bissl schauen, is aber nicht der Killer.
Müsste man halt rechnen, was das so zusammenbringt.
Die Großen sind eh alle MoE und in 64-96gb VRAM passt schon bissl Kontext und die Experts.
4x PCIe 4.0x16 schafft zwar "nur" 128gb/s, aber nachdem nur die Experts drüber müssen, sollte das halbwegs laufen.
Braucht halt Strom. Ist vom Tempo her aber wsl. doch noch ne andere Liga... müsste man mal schauen, obs Tests damit gibt. Wissen tu ichs natürlich nicht.
Isn massiver Unterschied, Qwen 3.6 35B A3B ist mitunter eines der schnellsten größeren LLMs, weils nur 3B aktive Experts hat (Gemma 4 26 A4B immerhin 4B, also 33% mehr).
Qwen 3.6/3.8 27B isn Dense, das schneckt schon auf einer 5090, im Verhältnis zum MoE.
Soo, gestern aus Frust über die CPU-Performance von Qwen3.8 27B mit 16 Kernen im Keller mal lokal ne llama.cpp rocm Instanz aufgesetzt.
(Die olle M60 kann kein Unified Memory und kackt beim laden vom 27B ab...)
Des scheint nicht ganz in die 16 GB von der 6900 XTXH zu passen... =(
Das 3.5 9B zieht beim halluzinieren immer 100 % GPU, das 27B stottert immer mal.
Ist aber tatsächlich ein riesiger Unterschied, was das 9B alles an Sachen hinzu lügt, geht auf keine Kuhhaut ("Wie funktioniert eine Nixie-Röhre?", da scheitern ALLE 9er und kleiner dran...).
Aber der Speed ist schon krass unterschiedlich:
Qwen3.5 9B:
Keller M60: ~14 t/s
Desktop 6900XTXH: ~63 t/s
Lade gerade das 3.6 35B-A3B, mal sehen, wie das auf dem Desktop laggt.
//Edith:
Ok, krass, das hätte ich SO nicht erwartet:
Task 0: "Warum ist der Himmel blau?"
Task 1045: "Wie funktioniert eine Nixie-Röhre?"
Alles zufriedenstellend erklärt, bis auf dass die Anode einer Nixie-Röhre halt außen drumrum ist, statt in der Mitte...
//Edith2:
Zusatzfrage:
Was rödelt das 3.6 35B noch so ewig auf der Festplatte hinterher (aktuell ca. 10 min)?
Seit den Abfragen habe ich einen konstanten Stream von 30 MB/s Down- und 1,5 MB/s Upload aufm iSCSI...
Zusatzfrage:
Was rödelt das 3.6 35B noch so ewig auf der Festplatte hinterher (aktuell ca. 10 min)?
Seit den Abfragen habe ich einen konstanten Stream von 30 MB/s Down- und 1,5 MB/s Upload aufm iSCSI...
Qwen 3.6 35B-A3B ist ein MoE Modell und passt nicht vollständig in die 16 GB VRAM deiner 6900XTXH d.h. wenn VRAM nicht ausreicht wird auf den RAM ausgelagert (Offload).
Wenn RAM und Pagefile genutzt werden dann ist auch Aktivität auf dem lokalen Speicher. Würde daher --load-mode mlock verwenden, damit das nicht passiert. Siehe llama.cpp Server Readme:
-lm, --load-mode MODE
model loading mode (default: auto)
- auto: mmap, unless a device does not support it
- none: no special loading mode
- mmap: memory-map model (if mmap disabled, slower load but may reduce pageouts if not using mlock)
- mlock: force system to keep model in RAM rather than swapping or compressing
- mmap+mlock: mmap + force system to keep model in RAM rather than swapping or compressing
- dio: use DirectIO if available
Würde aber grundsätzlich erst mal den Context verkleinern und dann manuell den Offload steuern (via --n-cpu-moe ), da hast du auch mehr Leistung am Ende.
Hmm, die Aktivität war halt NACH den Antworten, deshalb wundert es mich was danach noch so groß passiert, der Server hat ja das processing beendet (siehe oben).
Die 4k Kontext im Standard-GGUF sind viel zu wenig, ich hab den Kontext extra auf 16k erhöht, das mit dem MoE Offloading muss ich mal probieren.
Den load mode habe ich auf none gestellt (so wie es der Server beim Laden ohne Parameter empfiehlt), seitdem scheints schneller zu gehen, allerdings hab ich jetzt das Modell auf die lokale SSD geworfen.
Der M6 wird ja von Apple als Allways On (Agent) mit Moderatem Stromverbrauch beschrieben. Die Maschienen die hier aufgezählt werden (egal wie schnell) sind keine Allways on Geräte (Privat) oder man hat ne eigenen PV Anlage.
Das ist für mich eigentlich der springende Punkt, wenn es ein wenig länger dauert, ist das okay. Ich will mit der Kiste nicht reden die soll einfach Sachen für mich erledigen.
Für Fragen an die Ki gibt es genügend Alternativen die ich nicht Lokal betreiben muss.
Meinen HA sollte ich auch mit dem LLM auf dem M6 verbinden können. Mehr benötige ich eigentlich nicht. Klar wenn man die dicken Kisten es rumstehen hat und immer in Betrieb hat, warum auch nicht, aber auf Dauer ohne PV habe ich da kein Bock drauf.
Okay für 2,1k kann man eine Menge Strom verballern, aber ich benutze die Kiste dann ja auch für die alltäglichen Aufgaben.
Probier einen kleinen Quant. UD-Q2-K-XL probier mal. Sollte um Welten besser sein als 9b oder sowas, auch wenn vllt. schon bissl viel "weggeschnitten" ist, wird ja sehr gut selektiert bei den Unsloth Quants.
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
huggingface.co
Bleiben dir 6gb, je nach dem ob der ganze Klickibunti Kack vom OS auch noch rein muss ist das mehr oder weniger Kontext, Bie Qwen Dense kannst wohl auch den KV Cache als Q4_0 Quantisieren ohne großes Drama (Q5_0 ist in der Theorie gut, flash_attn geht aber wohl nur mit 4/8/16, wodurch das in der Praxis raus fällt).
Welche Version hast verwendet, warum läuft 35B und 27B nicht, 35B ist ja größer...
Und ja, 3.6 35B A3B ist blazing fast weil es nur 3b aktiv hat. Gemma 4 26b a4b ist ähnlich schnell (die 4b sind zwar mehr, dafür die 26b gesamt weniger).
MoE reagiert aufs Quantisieren aber immer heikler als Dense und ist ohnehin schon etwas "schusseliger"... muss man halt abwiegen.
Zusatzfrage:
Was rödelt das 3.6 35B noch so ewig auf der Festplatte hinterher (aktuell ca. 10 min)?
Seit den Abfragen habe ich einen konstanten Stream von 30 MB/s Down- und 1,5 MB/s Upload aufm iSCSI...
Ich hab MTP gestern noch zum laufen gebracht, wobei das bissl strange ist im llama-cpp router... weil ich ja nur 1 config hab.
Dort als aktiviert, draft max 3, draft min 1, draft probability 0.8 rein getippt, dürften brauchbare universalparamter sein.
Wie man dort nen externen Drafter von Gemma 4 lät, kein Plan, die internen Drafter von Qwen 3.6/3.8 laufen so.
Q 3.8 27b macht nun (je nach Kontextlänge und Thema) ca. 25 token/s statt 20 token/s.
mmproj auch... muss nur richtig drin sein.
Im Modell-Ordner muss ein Unterordner mit dem gewünschten Modellnamen sein, dort dann das Haupt-GGUF rein und das MMproj. richtib enannt.
/models/qwen/qwen3.8-27b-q4
/models/qwen/mmproj-qwen3.8-27b-q4 (muss mit mmproj beginnen, dahinter ist wohl egal was steht, sollte auch mit mmproj123 laufen, nicht probiert).
Dynamic Temperature in OpenWebUI muss ich mir mal ansehen, das Feature dürfte ganz gut sein gegen Hallus.
Und ja, diese ganzen Modelle kleiner als Gemma 4 26b a4b und Qwen 3.6/3.8 27b kannst vergessen.
Vielleicht taugt das für einfachere Sachen, aber als "Universalmodell" ist das nix.
Vllt. gibts Tool-Calling-Zeugs wo Qwen 9b was kann, je nach Aufgabe, keine Ahnung.
So zum "Reden" ist Gemma E4B überraschend okay (recht klein und flott) und kann zumindest halbwegs deutsche Sätze bilden (was ich von Qwen 9b nicht behaupten könnte).
Der M6 wird ja von Apple als Allways On (Agent) mit Moderatem Stromverbrauch beschrieben. Die Maschienen die hier aufgezählt werden (egal wie schnell) sind keine Allways on Geräte (Privat) oder man hat ne eigenen PV Anlage.
Das ist für mich eigentlich der springende Punkt, wenn es ein wenig länger dauert, ist das okay. Ich will mit der Kiste nicht reden die soll einfach Sachen für mich erledigen.
Für Fragen an die Ki gibt es genügend Alternativen die ich nicht Lokal betreiben muss.
Meinen HA sollte ich auch mit dem LLM auf dem M6 verbinden können. Mehr benötige ich eigentlich nicht. Klar wenn man die dicken Kisten es rumstehen hat und immer in Betrieb hat, warum auch nicht, aber auf Dauer ohne PV habe ich da kein Bock drauf.
Okay für 2,1k kann man eine Menge Strom verballern, aber ich benutze die Kiste dann ja auch für die alltäglichen Aufgaben.
Naja, wenn du weisst, was du machen willst und dir die Leistung reicht, dann passt das.
Ich muss gestehen, mit diesem Agent Zeugs im Hintergrund hab ich noch nicht so viel gemacht, dass ich das einschätzen könnte, welche Modelle/Leistungen man da braucht.
Muse Glimmer soll wohl interessant sein, braucht wenig Platz für den KV Cache und läuft wohl stark quantisiert noch ganz gut:
What a powerful model even at 2-bit! Muse Glimmer did a complete repo bug hunt for 5 mins nonstop with: evidence, repro, fix, tests and a PR writeup.
huggingface.co
Meine persönliche Einschätzung ist, dass 32gb Unified (zu) wenig sind, zumindest auf Dauer.
Wegen der hohen Preise werden diverse Modelle eher kompakt gehalten werden und besser getuned werden, sicherlich...
Für mich wirkt das ein bisschen wie so eine typische Beschaffungsaktion vom Bund.
Wie gesagt, lass dich da von mir nicht verunsichern, wenn du weisst was du tust.
Beobachtungspost. Alter Verwalter, ich dachte schon ich spiele viel rum.
Bei mir ist aber erstmal nur nen Strix Halo mit 64Gb in Überlegung - das dürfte für meine Zwecke erstmal ausreichen. Mit den 16Gb Vram meiner 9070 komme ich auf jeden Fall nicht sehr weit... llama 3.1:8b und qwen2.5:14b sind die beiden Modelle mit denen ich gerade experimentiere. Letzteres war aber schon mal nen Krampf auf ordentliches Deutsch oder Englisch zu kriegen - die arme wurde regelmäßig so überfordert das sie Chinesisch oder in Maschinencode geantwortet hat. 😅
Ich hab MTP gestern noch zum laufen gebracht, wobei das bissl strange ist im llama-cpp router... weil ich ja nur 1 config hab.
Dort als aktiviert, draft max 3, draft min 1, draft probability 0.8 rein getippt, dürften brauchbare universalparamter sein.
Wie man dort nen externen Drafter von Gemma 4 lät, kein Plan, die internen Drafter von Qwen 3.6/3.8 laufen so.
So M6 Storniert 🤣 Ich Fummel erstmal mit meinem Rechner rum. Dann lasse ich mich von euch beraten. Die nur 32GB sind eigentlich der echte Grund. Evt. kommt ja noch was mit dem M6 nach.
Mit den 16Gb Vram meiner 9070 komme ich auf jeden Fall nicht sehr weit... llama 3.1:8b und qwen2.5:14b sind die beiden Modelle mit denen ich gerade experimentiere. Letzteres war aber schon mal nen Krampf auf ordentliches Deutsch oder Englisch zu kriegen - die arme wurde regelmäßig so überfordert das sie Chinesisch oder in Maschinencode geantwortet hat. 😅
Gemma 4 E4B als Minimum, 12B eher meh, 26B A4B als UD-Q2-K-XL Quant oder so am besten. Evtl. kannst noch ein kleines IBM Granite probieren (schau mal nach was da momentan aktuell ist, imho gibts ein 8/9b und granite ist deutlich besser als sein quasi nicht vorhandener Ruf).
Dieses alte llama und das alte kleine Qwen sind doch ein Fiebertraum.
Unbedingt, eigene Erfahrungen > Rest.
Der Käse am Mac ist halt, dass es so vollproprietär ist, da kannst ja nicht mal ein RAM Upgrade machen, wenns zu wenig wäre.
Is halt schwer wem anderen was zu empfehlen, weil das Thema einfach komplexer ist als Gaming oder so.
Kann natürlich auch sein, dass die 32gb für dein Vorhaben eh reichen und das Ding dann teurer wird, und man hätte jetzt kaufen sollen... andererseits kanns auch sein, dass es dir zu klein ist und du das Ding verkaufst, beim Verkauf stress hast etc... weisst eh, wie mans macht, macht mans falsch (außer meine 2k 5090... einmal darf man ja Glück haben).
Das würde ich nicht machen weil die M4 dann gehen. Ehrlich gesagt ist es mir dafür auch zu viel Kohle zum testen und dann für Büro Arbeiten zu benutzen. Ich habe noch ein wenig recherchiert und die 32GB Ram werden auf jeden fall das Problem am Ende sein.
Die M5 Pro und Höher sind einfach nur abgehoben sobald der Ram erhöht wird, Apple hat da echt ne Macke, noch schlimmer wie sonst.
Ich glaube am Ende sehen wir wie gut die M6 abschneiden, sobald Sie auf dem Markt sind. Und bis dahin weiss ich ob 24 Gig Vram für meine Zwecke reichen. Wenn es dann doch gut wird mit den M6 kann man immer noch einen holen, oder auch lassen wenn die zu teuer werden (was sie jetzt schon sind).
Japps stimme ich Dir ohne Neid zu. Ich bin froh meine 4090 nicht verkauft zu haben.
Eine Frage habe ich noch. Welches OS nehmen? Windows 11 ist drauf (Zockerkiste), Linux kein Plan von und auch keine Lust mich vorerst darauf einzulassen.
Ich find Jan.Ai lokal ganz okay. Ist FOSS und so, afaik.
Win frisst halt paar Gigabyte VRAM, beim 10er Hier bin ich mit 4k+FHD und so bissl Browserkram bei knapp 3gb VRAM @desktop, was man nun einspart wenn man div Hardwarebeschleunigung deaktiviert... wär mir das Gefummel nicht wert.
OS ist eigentlich egal, das Zeug ist alles ziemlich Cross-Plattform... Linux ist sicher schneller/schlanker, aber spricht nix dagegen einfach deine Zockkiste zu verwenden wie sie ist.