Äh, ja, so etwas behauptet KI auch gerne mal. Typische zu selbstsichere Aussagen.
Achja, weil ich gerade dran denke und es vielleicht den ein oder anderen interessiert, der gute Hardware hat:
Qwen3.8 Flash Next 180B, läuft mit 16GB VRAM + 64 GB RAM + m.2 SSD mit ~100K Kontext.
Wie das geht? Ein großer Teil der 180B ist eine nGram Tabelle, das eigentlich KI Model (MoE) ist 125B groß, in Q4 ~63GB, dazu 4B MTP für Multi-Token Prediction. Obendrauf kann man noch den Vision Encoder für Bild/Videoverarbeitung nutzen.
Darum passt das, wenn man 80GB RAM insgesamt hat und man hat noch locker RAM für einen größeren KV-Cache, allerdings sollte dann für 100K+ nicht viel nebenher laufen (wegen freiem RAM). Besser natürlich, wenn man eine 24GB VRAM GPU oder gar eine 5090 hat. Die ~51B nGram Tabelle kann man auf eine schnelle m.2 SSD auslagern, auf die wird nicht so stark zugegriffen. ChatGPT meinte das bei 36 Token/s das bei den nGrams gerade mal 3MB/s SSD-Traffic wäre, da müsste selbst eine SATA SSD eigentlich noch reichen.
Ich hatte das Modell erst direkt abgehakt, also ich die 180B gesehen habe, normal ist bei ~128B Schluss, weil da ist ~Q4_K_M das Maximum, darunter kostet es zu viel Qualität.
Hier bin ich darüber gestolpert:
Dort wird das Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64 Quant dieses Modells genutzt:
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
huggingface.co