Suche Helferlein für Suche und Zusammenfassungen in und von lokalen Sourcen

Zyxx

Legende
Thread Starter
Mitglied seit
13.07.2010
Beiträge
6.142
Hallo zusammen.

Ich habe aktuell langsam einen Punkt erreicht in dem ich die Übersicht in meinen lokal geklonten und Teils stark angepassten Projekten verliere.

Soll heißen, ich weiß das es was gibt das XY macht, das ich damit gearbeitet und es repariert/ergänzt habe und finde es einfach nicht mehr, oder würde gerne auf die schnelle die Kommentare dazu sehen, da ich dort meine Gedankengänge hinkleister.

99.9% auf English, habe ich die letzte Zeit mal mit "freien" online Helferlein experimentiert, aber... das Ergebnis war schlecht.
Es wurde zu oft Murks erfunden oder um es wie Gemini zu sagen das mir grade "helfen wollte" und nur Murks gemacht hat:

1000039226.png


So etwas sollte natürlich nicht passieren. Ich kann falsche Antworten zwar meistens erkennen, hätte aber lieber ne Minute gewartet oder ein "das weiß ich nicht" bekommen als im Brustton der Überzeugung:

"Klar, das ist so und so".

Daher meine Frage, was gibt es da an Helferlein die bei gelegentlicher Nutzung überschaubar im Preis bleiben, oder auf einem alten PC oder ner kleinen ARM NPU brauchbare Resultate liefern?

Das ich hier teils auch Sachen habe die vertraulich sind, macht es nochmals kniffliger. Nichts sollte im Internet landen ohne das ich explizit zustimme... .

Ich stehe dem ganzen Krams sehr kritisch gegenüber und habe mich lange gewehrt, nur langsam bräuchte ich wirklich mehr manpower oder einen digitalen Helfer.
Bspw. nehme man eine aktuelle ITU-T und arbeitet diese händisch durch oder zwingt eine KI das vernünftig nach genau festgelegten Parametern durchzuackern. Und bei einem Umfang von teils hunderten Seiten... bin ich bei aktuelle Temperaturen geneigt das lieber eine KI erledigen zu lassen.
Natürlich nur wenn diese keinen Müll als Ergebnis präsentiert.

Gibbet da was?
 
Wenn Du diese Anzeige nicht sehen willst, registriere Dich und/oder logge Dich ein.
Privat oder Arbeit? Welches Level an Vertraulichkeit?

Lokal:
Alter PC kannst mal gleich vergessen, NPU eigetnlich auch, das klingt zwar nett, aber... ist so ne Sache.
9070XT ist okay von der Leistung her, VRAM ist leider für die 30b Klasse zu klein.
Wenn du sie als Haupt-GPU hast, musst mal 1-2gb VRAM fürs Windooze weg rechnen Linux wsl. etwas weniger.
Außer dem LLM Modell selbst muss noch der "KV-Cache" in den VRAM, das ist quasi der "Arbeitsspeicher der KI", darum darf dieses nicht zu groß sein.

Was du probieren könntest, ob die Modelle gut genug sind, müsste man eben probieren:
Gemma 4 12b - Damit hab ich schon einiges gemacht, ist zwischen ganz gut und naja, ist halt ein kleines 12B Modell, dafür aber nicht schlecht. Gegen das gelobte Qwen 27b kanns halt nicht (ansatzweise) anstinken.
Gwen 3.5 9b
Eventuell Ministral 3 14b

Ganz Eventuell gpt oss 20b (das hat als q5km oder gpt-oss-20b-UD-Q4_K_XL knapp 12gb, kleiner sollte man bei nem MoE auch nicht werden). Soll aber mit Q8_0 komprimirtem KV Cache nur 2.3gb VRAM für die 128k Token brauchen, insofern würde sich das auf der Karte recht genau ausgehen...

Gibt Lokal eh ein paar Tools, musst halt bissl rumspielen. Jan.ai hab ich ganz gern, wobei ich mit dem RAG Zeugs nicht nicht so viel gemacht hab, kannst ja mal testen, ist schnell geladen und so.
LM Studio hat mir irgendwie nicht so zugesagt, ist sicher auch ganz gut. Ist halt nicht open source, soll aber nix nach Hause senden und so, geht also auch.


Kannst ja schauen, was dabei rum kommt, kostet ja nix ausser etwas Zeit.


Online wird wsl. Claude das beste sein, so dem Hörensagen nach (und dem wenigen, was ich selbst damit gemacht habe, ich bevorzuge lokal), die Dokumente werden sicher nicht irgendwo online auftauchen. Dass die gescannten Inhalte eventuell irgendwie weiterverwendet werden... das wohl sicher... man müsste mal die AGBs und das Kleingedruckte lesen (wenn man das denn will).

Nachtrag:
Grad Gemma 4 26-b als Q2kP laufen lassen hier am Laptop, hat ca. 11gb, war noch nicht mal scheiße obwohl stark komprimiert.
Wär vllt. nen Versuch wert ein qwen 3.6 27b ( https://huggingface.co/unsloth/Qwen3.6-27B-GGUF?show_file_info=Qwen3.6-27B-UD-Q2_K_XL.gguf ) als ud-q2-k-xl laufen zu lassen und zu schauen, was dabei rauskommt/passiert. Beim 27b kann man den KV-Cache wohl auch Q4_0 quantisieren ohne zu große Qualitätsprobleme. Damit könnte man mit den 16gb was brauchbares hinbekommen.
qwen27b ist halt recht lahm, dafür aber ziemlich gut/genau bei so Logikkram. Für kreatives Schreiben vllt. eher gemma4-26b a3b (ist schneller, aber dafür "schlampiger")
 
Zuletzt bearbeitet:
Nach Möglichkeit sollte es lokal bleiben, dann muss ich mal schauen.
Danke dir für die Modelle! Das gibt auf jeden Fall schonmal Anhaltspunkte.

Was das fehlende Bild angeht das bei der Maintenance der Website hier wohl verloren gegangen ist, hier nochmal angehängt:

1000039226.png
 
Zuletzt bearbeitet:
Am besten Gemma 4 QAT nehmen, das ist nicht so beschnitten wie die 2-Bit-Version. Eventuell passt sogar die 26B A4B Version in den VRAM.
 
Zuletzt bearbeitet:
Ne, passt nicht, musst leider schon als 2 Bit verwenden, aber die Unsloth Dynamic sind schon okay, die wichtigeren Schichten sind ja weniger stark komprimiert, das wird selektiv komprimiert.
Meiner Erfahrung nach ist ein recht stark komprimirtes größeres Modell immer noch besser als ein kleineres kaum komprimiertes.
QAT ist nicht schlecht, wenns das Modell als QAT gibt, ist aber nicht so der Gamechanger gegenüber den Unsloth Quants, die doch recht gut sind. Google halt so "guck, wir können das auch".

Mit 16gb VRAM und etwas benötigtem Platz für KV Cache hast keine andere Wahl. Qwen 3.5 9b / Gemma 4 12b als UQ5k-xl oder so, oder halt ein UDQ2kXL vom Gemma 4 26b oder Qwen 3.6 27b probieren.
Was am Ende besser funktioniert, muss man testen.

Ich muss das mal bissl testen mit einem Qwen 3.7 27b ud-q2k-XL wenn mal Zeit ist.

Ne andere Wahl hast eh nicht. Die ganzen anderen kleinen Modelle sind ohnehin pfui, die Qwen 3.5 4b bekommt noch nicht mal nen geraden Satz hin (offenbar ist die deutsche Sprache gar nicht so einfach, von der Logik her). Gemma 4 E4B bekommt das verhältnismäßig gut hin, aber trotzdem...
 
Ne, passt nicht, musst leider schon als 2 Bit verwenden, aber die Unsloth Dynamic sind schon okay, die wichtigeren Schichten sind ja weniger stark komprimiert, das wird selektiv komprimiert.
Du solltest schon auch den Link klicken, wenn du ihn kommentierst ;)

Gemma 4 gibt's als QAT von unsloth, siehe Link, und die wird sicher besser performen als eine 2-Bit-Quantisierung. Siehe Link.
 
Die 26B A4B muss zudem überhaupt nicht komplett in den VRAM passen. Das ist ein MoE Modell und damit perfekt geeignet es auf VRAM und RAM zu splitten und trotzdem noch schnell genug zu sein. Aber klar, kommt drauf an wie viel RAM vorhanden ist. Ist zwar toll, wenn man seine Hardware ins Forum schreibt, dann aber nicht dazu schreibt wie viel man davon hat. Da es aber DDR-4 RAM ist, vermutlich maximal 32GB, wenn nicht sogar nur 16GB. Trotzdem, selbst dann kann ein Teil in den RAM ausgelagert werden, bei 16GB wirds nur dann doch sehr eng, andere Software und vor allem Windows wollen auch RAM und das selten nicht wenig. xD

P.S. ich muss mich endlich mal selbst mit QAT beschäftigen. xD
 
Du solltest schon auch den Link klicken, wenn du ihn kommentierst ;)

Gemma 4 gibt's als QAT von unsloth, siehe Link, und die wird sicher besser performen als eine 2-Bit-Quantisierung. Siehe Link.
Hab ich, mit 14,2gb halt zu groß für 16gb VRAM.
Die 26B A4B muss zudem überhaupt nicht komplett in den VRAM passen. Das ist ein MoE Modell und damit perfekt geeignet es auf VRAM und RAM zu splitten und trotzdem noch schnell genug zu sein.
Das ist Irrglaube.
Das reduziert nur die Rechenlast, weil nur mit den aktiven Berechnet wird, die springen aber herum, müssten also stets nachgeladen werden.
Ein MoE ist nur schneller, nicht aber spart man VRAM.

Sprich ne popelige iGPU mit viel Unified RAM / VRAM ist mit einem MoE noch in mehr oder weniger akzeptablen Geschwindigkeitsbereichen unterwegs.

Auch sowas wie ein NV Spark oder Ryzen AI 395 ist mit MoE gut unterwegs, die sind nämlich von der Rechenleistung und Speicherbandbreite her relativ lahm (im Vergleich zu Blackwell und besser), haben aber viel VRAM. Da kann man mit MoE schon gut was anfangen.
 
Zuletzt bearbeitet:
Hab ich, mit 14,2gb halt zu groß für 16gb VRAM.

Das ist Irrglaube.
Das reduziert nur die Rechenlast, weil nur mit den aktiven Berechnet wird, die springen aber herum, müssten also stets nachgeladen werden.
Ein MoE ist nur schneller, nicht aber spart man VRAM.
Hab ich auch nicht behauptet? Es erweitert den Speicherplatz mit normalem RAM.
Sprich ne popelige iGPU mit viel Unified RAM / VRAM ist mit einem MoE noch in mehr oder weniger akzeptablen Geschwindigkeitsbereichen unterwegs.
Das geht auch mit VRAM + RAM. Keine Ahnung worauf du gerade hinaus willst. Das mache ich so schon seit Monaten, sogar mit einem 120B Moe bei 24GB VRAM und 64GB RAM.

Auch sowas wie ein NV Spark oder Ryzen AI 395 ist mit MoE gut unterwegs, die sind nämlich von der Rechenleistung und Speicherbandbreite her relativ lahm (im Vergleich zu Blackwell und besser), haben aber viel VRAM. Da kann man mit MoE schon gut was anfangen.
Absolut korrekt. Sonst würden die Maschinen kaum Sinn ergeben, weil bei Dense Modellen sind sie zu langsam für vieles. Leider sind sie wegen den (V)RAM Preisen nur kaum bezahlbar, haben schon zum normalen Preis einiges gekostet.
 
Das geht auch mit VRAM + RAM. Keine Ahnung worauf du gerade hinaus willst. Das mache ich so schon seit Monaten, sogar mit einem 120B Moe bei 24GB VRAM und 64GB RAM.
Na erzähl mal, was bekommst raus in token/s?
Werd mir das nochmal ansehen müssen... not sure wie schnell die Experts "durch wechseln"... hängt wohl auch davon ab.
 
Ich muss mal schauen was es hier für eine Lösung wird.
Wir sind halt in der Anfangszeit der AI unterwegs, in der noch mit riesigen Modellen gearbeitet werden muss, weil die Hardware nicht mehr hergibt.
(Nur um dann hoffentlich intelligent genuge Aussagen zu bekommen).

Ich werde mir garantiert keinen weiteren Tower hinstellen bei den aktuellen Temperaturen, habe aber noch einige RK3588 mit 8 bis 16GB RAM rumidlen.
Und irgendwo habe ich bestimmt noch einen kleinen MiniPC mit AMD und Unmengen an RAM.

Wenn ich da ein paar zusammenlege, kann ich wahrscheinlich einen Host freibekommen und gehe mit https://github.com/NotPunchnox/rkllama mal an die Sache.
Danke euch!
 
@pwnbert:
Wenn ich mir einen Kasten reinstelle der nochmal mit ein paar hundert Watt vor sich hindreht, dann geht das nicht mehr auf.
Das wäre dann eher was für den Herbst aber nichts was rund um die Uhr laufen kann.

Daher ja auch meine Idee das auf Low Power Devices abzubilden.

Außerdem habe ich grade so ein rund laufendes Zocksystem am Start, da würde ich ungern jetzt mit Dockern rummatschen und mir meine Entwicklungsumgebung im Netzwerk zerlegen.
Dafür (und ich hasse Python) fehlt mir bei den Temperaturen die Muße.
 
Also nochmal, du gehst auf: https://www.jan.ai/
Du ladest dir die passende Version für dein OS runter.
Das installierst du, gehst bei den Optionen aufs Llama.cpp Backend, hast da paar options, kannst wsl. aussuchen ob Vulcan oder ROCm (hab am Desktop die 5090 und im Laptop Intel, daher kein Plan wie das mit RDNA4 ist).
Derweil gehst du auf Huggingface und ladest dir die entsprechenden Modelle runter, 10-11gb, mehr sollte es nicht sein, Qwen 3.6 27b als UD-Q2-K-XL und Gemma 4 26ba 3b auch als UD-Q2..K-XL (und den MTP Drafter dazu).
Die kannst du dann in den Options von Jan.ai (wenn du auf das lokale llama.cpp klickst bei den anbietern, wird automatisch mit installiert etc.) einfach importieren (mit dem entsprechenden button).

Das wars.

Das Ding installiert sich wie ne stinknormale Anwendung ohne Dependency Hell.
Du musst keinen extrra Server und extra Frontend installieren, was dann nicht läuft, weil beide unterschiedliche globale python Versionen benötigen oder sonstiges fuckup.

Stell dich nicht so an, machs einfach.
Dafür brauchst keine Muße, das sind 3 Klicks, das schafft jedes 1337 Kiddie.
Beitrag automatisch zusammengeführt:

PS:
So, mal mit Gemma 4 26b a4b Q5km gespielt, 200k token KV-Cache als Q8_0 (ohne MTP).

Alles in der GPU, 130 token/s, 26gb VRAM (total, inkl. Win10 GUI overhead).
10 MoE Layer in die CPU, 55 token/s, 21gb VRAM.
20 MoE Layer in die CPU, 35 token/s, 15,5gb VRAM.
alle MoE Layer in die CPU, 25 token/s, 10gb VRAM.

Ist eigentlich gar nicht sooo schlimm wie bei Dense. Die dicke RDNA4 macht halt ca. die Hälfte der 5090, wird wohl auf um die 12 token/s kommen, macht wenig Spaß, geht aber. Wobei ich hier DDR4 hab, mit DDR5 bist du etwas flotter.

Ich fand aber das (UD)-Q2-K-XL gar nicht soo übel, läuft auf der Intel Laptop GPU immerhin mit 8 token/s mit MTP. Man kanns verwenden, aber eigentlich isses zu langsam um echt Spaß zu machen oder produktiv zu sein.

PPS:
Qwen 3.6 35b a3b macht bei mir als UD-Q4-K-XL ca. 170 token/s (ohne MTP, mit MTP nur 115, frag mich nicht warum, die MTP Einstellungen sollten passen), braucht 27gb mit 128k Kontext.
alle MoE in der CPU machts 35 token/s, 8gb VRAM. RAM brauchst halt dafür, hatte 35/64 belegt, läuft aber viel kack, müsste sich mit 32gb gut ausgehen.


Geht eigentlich.
Mit Dense geht das halt nicht.



Ich muss mal nachreichen, was MTP bei Gemma 4 26b hier bringt. Am Laptop bringt es sehr viel, ich hab das Gefühl, dass das bei Gurken super ist, bei starken Rechnern aber nicht funktioniert, werd das noch nachreichen.


tl,dr: Probiers einfach mal aus.
 
Zuletzt bearbeitet:
Na erzähl mal, was bekommst raus in token/s?
Werd mir das nochmal ansehen müssen... not sure wie schnell die Experts "durch wechseln"... hängt wohl auch davon ab.
Mit Mistral-Small-4-119B-2603.i1-IQ4_XS:

CtxLimit:3791/12288, Init:0.03s, Processed:569 in 5.18s (109.82T/s), Generated:759/1024 in 21.20s (35.80T/s), Total:26.41s

Gerade kein anderes Modell zum Testen. Finde, das ist mehr als brauchbar. War jetzt aber auch nur ein kurzer Test, ein paar kurze Fragen und Antworten und das da war eine Textzusammenfassung, alles mit Reasoning an. Hab noch gut 13 GB RAM frei, wobei ich auch noch weitere Software aufhabe, da ich gerade noch mit Codex in VS Code gearbeitet und Firefox/ChatGPT offen habe (neben Discord/Steam). Könnte aber Q4_K_M nutzen, keine Ahnung wie sich das auf die Geschwindigkeit auswirkt. Hab aktuell nicht so viel Speicherplatz frei, um mehrere große Modelle zu speichern.

Und das ist auch noch ein altes MoE ohne MTP und was aktuell so noch neu dazu kam, um die LLMs noch schneller zu machen. Da ist also noch Luft nach oben.

Edit: Achja, meine 4090 ist auf 360W gecappt, da geht also ein klein wenig Leistung verloren, viel ist es aber nicht.
 
Zuletzt bearbeitet:
So, Multi Token Prediction mal überprüft, mit der 5090 ist man mit MTP tatsächlich langsamer unterwegs als ohne, bei Qwen 35b a3b stärker als bei Gemma 26b a4b (wsl. weils schneller ist und weniger aktive Parameterhat). Bei Qwen bin ich 30% langsamer, bei Gemma 10%, roundabout. Der Validierungsaufwand = Overhead ist wohl größer als der Nutzen.
Das Verhalten ändert sich ein wenig, wenn ich alle Experts auf die CPU lege, dann hab ich mit MTP 28 token/s und ohne 25 token/s, zumindest keinen Einbruch mehr.

Am 255 Ultra vom Laptop bekomm ich allerdings die phantastischen +80% durchs MTP.
Mit Mistral-Small-4-119B-2603.i1-IQ4_XS:
Muss ich mir mal ansehen.


Ist halt die Frage, obs am Ende lohnt.
Ob nicht ein Qwen 3.6 (3.8) 27b als UD-Q2-K-XL Quant immer noch besser und auch nicht langsamer (wenn nicht schneller) ist.


Meiner Erfahrung nach ist Qwen 3.6 27b Dense einfach eine andere Liga als MoE in "handlichen Größen", soll ja auch ziemlich ebenbürtig mit dem Qwen 3.5 122b a10b sein, obs stimmt, keine Ahnung.
Bin auf jeden Fall ziemlich zufrieden vom 27b Output... und dieser entpuppt sich als deutlich besser gegenüber den MoEs.
 
Ja, schon. Dieses Mistral Modell hab ich primär runtergeladen, weil ich den Schreibstil der Mistral Modelle mag und je größer das Model, desto besser ist es halt auch in Deutsch, trotz Quant. Programmieren tue ich lokal gar nicht mit lokalen KIs (dafür nutze ich Codex), lokale Agenten nutzen aktuell auch noch nicht.
 
Zuletzt bearbeitet:
Irgendwie funktioniert das bei mir nicht vernünftig, wohl irgend ein Formatierungsproblem. Eigentlich sollte das Unsloth gguf die passenden jinja eingebaut haben, aber irgendwas spinnt rum. Oder bloß ein Fehler, kein Plan.
Je nach Menge des Offloadings zur CPU komm ich auf 20-35 t/s mit der 5090 und DDR4, ist mehr oder weniger okay.
Imho lohnt diese ~100-150b MoE Klasse aber nicht so wirklich gegenüber der 30b Dense klasse (speziell Qwen 3.6 27b und Gemma 4 31b, mal sehn was uns mit Qwen 3.8 27b erwartet).
Vllt. schätze ich das Mistral auch falsch ein.
Ich war bisher den Mistrals gegenüber sehr offen und wohl gesonnen, aber so wirklich brauchbar waren die für mein Gefühl nicht.


Meiner Erfahrung nach ist das Qwen 3.6 27b für "seriöse, ernsthafte Arbeit" ziemlich unangefochten, Gemma 4 26b e4b (auch als uncensored HauHauCS) ist ein nettes flottes Modell zum "quatschen" und für weniger "schwere" Themen.
Nachdem die beide als entsprechend kleiner Quant (Qwen soll auch mit Q4 KV-Cache gut klar kommen) in 16gb passen, sind wilde MoE Offloading-Experimente eigentlich nicht nötig.

Wie gesagt, ich würde das probieren, der Aufwand geht gegen 0, das "Risiko" (python etc.) ebenso, die passenden Modelle sind vorgekaut.
 
Mistral hinkt leider hinterher, die haben nicht die Ressourcen um richtig aufzuholen, aber auch deren Modelle werden besser. Fokussieren sich, finde ich zumindest, aber auch auf zu viele Sprachen inzwischen, ältere Modelle hatten da nur rein typisch europäische Sprachen.

Das Problem mit den 120B Modellen ist, dass die meisten davon alle älter sind als die von dir genannten kleineren Dense Modelle. Entsprechend ist das auch ein Alt gegen Neu Vergleich. Es bräuchte ein aktuelles neues ~120B MoE. Die kleineren Gemma Modelle muss ich selbst noch mal testen, ich nutze KI halt fast nur noch in Deutsch und in Englisch sind die Modelle oftmals generell deutlich besser.

Fürs Quatschen mit einer KI reichen ja auch 20-35 t/s locker aus, das ist normal für bequemes Lesen noch immer mehr als schnell genug. Gerade da finde ich ein größeres Modell aber schon smarter, wenn es denn halt ein aktuelles Modell wäre. Ich hoffe Qwen 3.8 bringt da auch noch irgendwas um die 60B bis 120B.
 
Das Problem mit den 120B Modellen ist, dass die meisten davon alle älter sind als die von dir genannten kleineren Dense Modelle.
Jein, Gemma 4 26B A4B und Qwen 3.6 35B A3B sind keine Dense und schon auch ziemlich gut.
Die kleineren Gemma Modelle muss ich selbst noch mal testen
Kannst dir imho sparen, mein persönliches "Gefühl" (weil das ja sehr schwer Bestimmbar ist, klar, gibt Benchmarks, sind abera uch nur Benchmarks) ist, dass Gemma 4 26B MoE als UD-Q2-XL bzw. "Special-Q2-Quant" immer noch besser (und auch schneller) ist als das G4 12B dense, E4B und E2B sind zwar überraschend okay, ber nicht wirklich nützlich.
Wo E4B und 12B zumindest als Q4 Quant laufen, läuft idR. auch ein 26B als Q2 "Special-"Quant, welcher imho immer besser ist.
Fürs Quatschen mit einer KI reichen ja auch 20-35 t/s locker aus,
Jein, ohne Reasoning vielleicht, mit Reasoning sieht die Sache anders aus. Ja, ist okay, aber schnell ist anders.


tl,dr:
Egal, für den TE würde ich immer noch empfehlen mal lokal die 16gb VRAM zu nutzen mit einer "einfachen Software" (z.B. Jan.ai ... finde ich einfach schwer okay) und einem Gemma 4 26B MoE oder/und einem Qwen 3.6 (bald 3.8) 27b Dense... beides als entsprechend knapper Quant, damit noch Platz für KV Cache bleibt.


PS: Ja, Man könnte auch Qwen 3.6 35B A3B als UD-Q5-K-XL shared in RAM und VRAM ausführen, damit hätte man weniger Kompression und akzeptable Geschwindigkeit, ob das dann besser wäre als ein 3.6 27b Dense Q2 (oder so) Quant, wer weiss. Muss man halt testen.

Fürn Anfrang würd ich mich ans tl,dr halten, das ist entsprechend einfach und man kann wenig falsch machen und muss sich nicht zu tief rein fuchsen.
 
Quant 2 ist halt schon ziemlich kritisch, kann funktionieren, muss aber nicht. Der beste Kompromiss ist um Q4_K_M rum, darunter verlieren zu viele Modelle stark an Qualität, Tool Calling scheitert gerne mal etc.
 
Seit gestern dann also Qwen 3.8:

Ich könnte mir allerdings immer noch vorstellen, dass eine Gemma 4 QAT-Variante bei 16 GB besser läuft als eine heftige Qwen-Quantisierung.

Die E2B und E4B QAT-Varianten von Gemma 4 wären ggf. auch für die Edge-NPU interessant, die @Zyxx vorschwebt.
 
Das ging schnell, hatte Gestern noch nachgeguckt, da war nur das große Modell raus, das würde erst in 0,1 bit bei mir laufen. xD

Ja, für 16GB VRAM bräuchte es 3bit des 27B Modells, das dürfte nicht sonderlich gut laufen. Mit 24GB VRAM kann man gut besagte Q4_K_M (oder besser Q4_K_XL, wenn vorhanden) nutzen.
 
Ich könnte mir allerdings immer noch vorstellen, dass eine Gemma 4 QAT-Variante bei 16 GB besser läuft als eine heftige Qwen-Quantisierung.
Unwahrscheinlich, Gemma 4 ist nicht so "schlau", grundsätzlich nicht, dazu noch als MoE Version eben MoE.
Was Gemma 4 26B A4B gut kann ist so Gequatsche, auch kreatives, (NSFW) Roleplay (als entsprechende Version) und ähnlich Späße.

Man merkt, dass Gemma hier mehr in Richtung Consumer-Unterhaltung geht (was nicht zwingend schlecht sein muss).
Qwen kann/will das nicht so, ist bei gewissen "technischen" sachen einfach besser, zudem als Dense ohnehin viel präziser.

Und ja, bei Gemma 4 26b a4b und Qwen 3.6/3.8 27b müssen wir zwangsweise MoE mit Dense vergleichen.
Die E2B und E4B QAT-Varianten von Gemma 4 wären ggf. auch für die Edge-NPU interessant, die @Zyxx vorschwebt.
Kannst vergessen, A2B und E4B sind nur Spielerei. Immerhin bringt E4B ganze deutsche Sätze raus (was man von den ganz kleinen Qwen jetzt nicht behaupten konnte).
26B A4B gewinnt als Q2 Quant massiv(!).
Ja, für 16GB VRAM bräuchte es 3bit des 27B Modells, das dürfte nicht sonderlich gut laufen. Mit 24GB VRAM kann man gut besagte Q4_K_M (oder besser Q4_K_XL, wenn vorhanden) nutzen.
Keine Panik.
UD-Q2-K-XL testen.
Ist ja weit weg von einem starren 2 Bit, die wichtigen Layer sind weniger hoch komprimiert im Unsloth-Dynamic .. XL Verfahren.
Ist halt ein Dense, muss also zwingend in den VRAM passen zu 100%, sonst geht gar nix mehr (1 token/s hier mit DDR5 an der iGPU, Gemma 4 26b a4b macht als q2kp immerhin mit mtp 10 t/s).

Bei Qwen kannst den KV Cache wohl auch auf Q4 stellen, ohne dass es zu stark leidet, das geht bei Gemma nicht.


Eh egal, der TE ist wie üblich schon lange weg. 🤡
 
Also gerade bei Qwen hab ich ständig Warnungen gehört den KV Cache überhaupt zu quantisieren, vor allem nicht in Q4, da Qwen besonders empfindlich darauf reagieren soll.
 
Nö. Selber probieren und Wissen aktuell halten, Hörensagen bei dem Thema ist eh so ne Sache, ist es älter als 3-6 Monate, kannst es einfach vergessen.

Betrifft hauptsächlich alte LLMs, speziell bei Qwen, MoE eher als Dense.
Q8 sollte immer easy sein, Q4 je nach Aufgabe okay oder auch nicht.
 
Nö. Selber probieren und Wissen aktuell halten, Hörensagen bei dem Thema ist eh so ne Sache, ist es älter als 3-6 Monate, kannst es einfach vergessen.
Ja, stimme ich zu, war es aber halt nicht, vielleicht 2 Monate speziell die kleineren Qwen3.6 Modelle betreffend, die ja in der Community derart beliebt beim Coding waren und nun von Qwen3.8 27B abgelöst wurde, was auf ChatGPT Luna Max Niveau ist.
 
Gerade 3.6 27b dense ist da imho nicht so heikel.
Einerseits hat das meine Recherche ergeben, andererseits hab ichs selbst ne Zeit lang so verwendet (um einen Proxmox zu konfigurierein), war ganz gut, besser als die Gemma mit Q8.

Ist aber auch die Frage, was man macht. Für Coding / Mathe will man wohl doch eher Q8, für Text-Kram, Recherche etc. tuts wsl. Q4.

Mit 3.8 muss ich mich mal bissl mehr spielen.
Hab erst etwas mit der HauHauCS rumgespielt, die mag kein Deutsch sprechen... ansich okay, überrascht mich aber. Qwen ist halt schon anstrengend anständig manchmal.
 
Hardwareluxx setzt keine externen Werbe- und Tracking-Cookies ein. Auf unserer Webseite finden Sie nur noch Cookies nach berechtigtem Interesse (Art. 6 Abs. 1 Satz 1 lit. f DSGVO) oder eigene funktionelle Cookies. Durch die Nutzung unserer Webseite erklären Sie sich damit einverstanden, dass wir diese Cookies setzen. Mehr Informationen und Möglichkeiten zur Einstellung unserer Cookies finden Sie in unserer Datenschutzerklärung.


Zurück
Oben Unten refresh