Darf ich fragen was ihr so mit der ki macht? Interessiert mich sehr was man so sinnvolles machen kann
Spontanes Beispiel:
Hallo zusammen, ich lese hier schon eine Weile mit und habe mich jetzt angemeldet, weil ich bei einem Thema ein bisschen Input von Leuten gebrauchen könnte, die mehr Erfahrung mit Homelabs und Enterprise-Hardware haben. Kurz zu mir: Ich komme beruflich aus der IT, allerdings nicht speziell aus...
www.hardwareluxx.de
Qwen 3.6 27b hat das ziemlich gerockt.
Gemma 4 26b a4b hats ähnlich gut hinbekommen, hätte keinen groben Fehler gesehn.
Gemma 4 12b war meh, so grundsätzliches Blabla das nicht falsch ist (so bissl Bewertungen von 555 vs ATtiny). Auf Nachfrage gabs dann auch Code (etwas anders, sieht am 1. Blick aber okay aus), Pinout Beschreibung war grundsätzlich auch da.
Zur Versorgung mit 5V aus 12V hat es dann nen Spannungsteiler vorgeschlagen, was IMHO ziemlicher Bullshit ist. Bei genauerer Nachfrage hat er komisch rumgetan und einfach Bullshit erzählt (ich weiss, dass der µC Strom zu viel schwankt für nen Spannungsteiler, da müsste der Querstrom schon groß sein). Die ganze Idee wurde dann massiv verschlimmbessert.
Auf die Idee auf nen Stepper zu verweisen isses nicht gekommen.
Das zeigt schon die Risiken, die KI gestütztes Arbeiten mit sich bringt, wenn man selbst nicht erfahren genug ist um die Sinnhaftigekeit der Antwort einzuschätzen.
Schlimm ist, dass "dumme" KIs einfach "lügen" weil sie sich ihrer Dummheit nicht bewusst sind, genau wie die Menschen halt auch oft.
Für mich ist Qwen 27b Dense ein tolles "Arbeits-LLM" für "seriöse Jobs", Gemma 4 26b a4b ein tolles "Quatsch-LLM" (das durchaus mehr kann, die Kommunikation ist aber sehr "comfy" für unsere westlichen Gewohnheiten).
Alles kleinere ist einfach pfui. Spannend, dass diese 2 Modelle mit ihren knappen ~30b wohl so ne Art "Schallmauer" durchbrochen haben... die sind schon verdammt gut bei kompakter Größe.
Ärgert mich, dass ich nicht 2 von den AI-Pro gekauft hab, jetzt is mir die 2. zu teuer (und wird wsl. noch teurer lol).
So, llama-cpp mit openwebui ist verbunden, angeblich soll man über die oberfläche auch modelle laden können, habs bislang noch nicht geschafft...
Modelle per CLI zu laden ist so 1990...
Du brauchst den "Router Mode", die KIs verweisen ungern auf den, warum auch immer.
Hier ein Sniplet, den Rest musst dir selber rauswürgen:
Systemd Service anlegen:
Code:
cat > /etc/systemd/system/llama-router.service <<'EOF'
[Unit]
Description=llama.cpp model router
After=network.target
[Service]
Type=simple
ExecStart=/root/llama.cpp/build/bin/llama-server \
--device ROCm0 -mg 0 -sm none \
--models-dir /mnt/ai-models \
--host 0.0.0.0 --port 8080 \
--n-gpu-layers 999 --ctx-size 128000 --threads 4 \
--cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on \
--parallel 1 --models-max 1 \
--jinja --reasoning-format deepseek
Restart=on-failure
[Install]
WantedBy=multi-user.target
EOF
Code:
systemctl daemon-reload
systemctl enable --now llama-router.service
Special (hat mir Claude geflüstert, ob das so stimmt, kein Plan, klingt plausibel und scheint zu funktionieren):
Du solltest das --jinja --reasoning-format deepseek dazu nehmen und bei der Verbindung in OpenWebUi "Default" nehmen nicht nicht llama.cpp.
Dann sollte theoretisch das <thinking>...</thinking> Zeugs von Qwen und Gemma nicht mit in den KV Cache aufgenommen werden (weil es dir mit hohem Thinking sofort den Context zumüllt, hab das Problem grad in jan.ai am Desktop, weil dort irgendwie die "strip reasoning from context" Funktion verschwunden ist.
Hab das ausnahmsweise mit Claude (free) gemacht, weil mich jan.ai genervt hat und ich ja schwer den LLM Server verwenden kann, wenn ich dran rumfrickel.
Claude ist schon okay und wsl. sein Geld wert, ich mags trotzdem Lokal.