Zum Inhalt springen
benchmark.securesight.ai
EN

Lokal gelaufen

Qwen3.8-Flash-Next

AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2 · 2 Läufe

Hardware
AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2Strix Halo · Radeon 8060S · gfx1151
Speicher
128 GiB unified
Aufgaben
Moorhuhn, Clair Obscure, Bilderkennung
Quantisierungen
UD-Q4_K_XL
Kai Bennett

Persönliche Meinung

Kai Bennett

Bisher hatte ich noch kein Modell gefunden, das auf dem AMD Strix Halo so richtig gut funktioniert, weil entweder waren es dichte Modelle die mit der niedrigen Bandbreite zu langsam liefen, oder aber sie waren so klein, dass sie auch auf Hardware mit deutlich weniger Speicher gut liefen, oder sie hatten z.B. keine Bilderkennungs - Fähigkeiten.

Dieses Modell ändert das, in den Benchmarks kann es mit viel größeren Modellen mithalten und wird bei artificialanalysis.ai sogar oberhalb von GPT 5.6 Luna (max) eingeordnet, es läuft konstant auch bei größerem Kontext mit um die 20 Token, hat Vision Fähigkeiten, nutzt den vollen Speicher des Geräts und liefert gute Ergebnisse.

Das Modell ist aus meiner Sicht wie gemacht für den AMD Strix Halo oder DGX Spark.

Beschreibung des Modells

Hybrides MoE-Modell mit 125 Milliarden Parametern im Sprachmodell, davon 6 Milliarden je Token aktiv, dazu 51 Milliarden Parameter N-Gramm-Embedding und 4 Milliarden MTP. Die Modellkarte nennt 48 Schichten im Muster 12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE)) sowie 512 Experten, von denen je Token 10 geroutete und 1 geteilter aktiv sind. Der native Kontext liegt bei 262 144 Token und ist auf 1 000 000 Token erweiterbar. Als Typ ist "Causal Language Model with Vision Encoder" angegeben, die config.json enthält einen Vision-Encoder mit 27 Schichten und Hidden-Größe 1152.

Gesamtparameter Sprachmodell
125B
Aktive Parameter je Token
6B
N-Gramm-Embedding
51B
MTP
4B, 1 Schicht
Schichten
48
Schichtmuster
12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))
Experten
512
Aktive Experten
10 geroutet + 1 geteilt
Kontextlänge
262 144 nativ, erweiterbar auf 1 000 000 Token
Lizenz
other, license_name qwen-community-1.0
Architekturschaubild des Herstellers
Schaubild des Herstellers · Quelle

Angaben des Herstellers: Quelle · Modellkarte · Hersteller

Lauf: Moorhuhn · UD-Q4_K_XL · Reasoning xhigh · 03. September 2026

Die Zahlen auf einen Blick

Decode, Median

21,76 t/s

346 gewertete Antworten

Decode, p10 bis p90

17,15–26,28 t/s

Antworten ab 200 Tokens werden gewertet; kürzere erzeugen im Protokoll Ausreißer bis über 1 000 000 t/s, weil dort ein einzelnes Token in nahezu null Millisekunden fällt. Median klassisch, Perzentile nach Rangplatz. Beim Prefill gilt diese Schwelle NICHT, dort zählt jede Auswertung.

Spitze

33,89 t/s

einzelne Antwort

Prefill, Median

77,6 t/s

Ausgabe erzeugt

770.428 Token

nur die gewerteten Antworten ab 200 Tokens

Laufzeit

13,6 h

815 Minuten

Selbstkorrekturen

nicht gemessen

Antworten gesamt

459

346 davon gewertet

Eingabe gesamt

24,15 Mio. Token

Kontext aller 459 Anfragen zusammengezählt

davon neu berechnet

1.051.292 Token

23,10 Mio. lagen im Prompt-Cache

Durch das Modell gelaufen

24,94 Mio. Token

Eingabe und Ausgabe zusammen

Bei einem Anbieter

0,95 USD

Qwen3.8 Flash gehostet, günstigster Tarif

Was dieser Lauf gekostet hätte, wenn Qwen3.8 Flash bei einem Anbieter gelaufen wäre
Anbieter Eingabeje Mio. Ausgabeje Mio. Cacheje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Alibaba Cloud Int. 0,150,47 0,016 3,99 0,95

Alle Beträge in USD. Die ersten drei Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit denselben Token wie links: 24 148 766 Eingabe über alle Anfragen, davon 1 051 292 neu berechnet und 23 097 474 aus dem Prompt-Cache, dazu 786 506 Ausgabe. Die Spalte „ohne Cache“ setzt die ganze Eingabe zum Eingabetarif an. In der Spalte „mit Cache“ zahlt der neue Teil den Schreibtarif von 0,20 USD, der zwischengespeicherte den Lesetarif von 0,016 USD. Einziger Anbieter ist Alibaba Cloud International. Dort heißt das Modell „Qwen3.8 Flash“, ohne den Zusatz Next und ohne Angabe einer Parameterzahl. Gelaufen ist hier der Build Qwen3.8-Flash-Next von Hugging Face mit 125 Milliarden Parametern, davon 6 aktiv. Für dieselbe Herkunft sprechen derselbe Hersteller, dieselbe Kontextlänge von 1 000 000 Token und dasselbe Erscheinungsdatum; bewiesen ist es durch die Anbieterseite nicht. Stand 08.09.2026, Listenpreise ohne Mengenrabatt. Lokal kostet der Lauf statt dessen Strom und die Anschaffung des Rechners. Preise bei OpenRouter, abgerufen am 2026-09-08.

Was dieser Lauf gekostet hätte, wenn Sonnet 5 mit gleichem Tokenverbrauch gelaufen wäre
Modell Eingabeje Mio. Ausgabeje Mio. Cache schreibenje Mio. Cache lesenje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Sonnet 5 2,0010,00 2,500,20 56,16 15,11

Alle Beträge in USD. Die ersten vier Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit genau den Token dieses Laufs: 24 148 766 Eingabe, davon 1 051 292 neu und 23 097 474 aus dem Cache, dazu 786 506 Ausgabe. Ohne Cache zum Eingabetarif, mit Cache zahlt der neue Teil den Schreibtarif und der zwischengespeicherte den Lesetarif. Das ist ein Vergleich unter der Annahme gleichen Tokenverbrauchs. Ein anderes Modell löst dieselbe Aufgabe mit anderer Tokenzahl, meist mit weniger; die Zeile sagt also, was diese Token bei Sonnet 5 gekostet hätten, nicht was Sonnet 5 für diese Aufgabe gekostet hätte. Preisliste von Anthropic, abgerufen am 2026-09-08.

llama.cpp-Serverlog · 346 von 459 Antworten ab 200 Tokens · Lauf vom 03./04.09.2026, 13 h 35 min. Der Server lief 844,3 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 837,0 Minuten; darin liegt eine Leerlaufpause von 21,9 Minuten. Das Arbeitsfenster sind also 815 Minuten. Die reine Rechenzeit auf der GPU beträgt 798,8 Minuten. · Rohprotokoll

Ergebnisse

Moorland Mayhem — Featherstorm: Titelbild, Spielrunde, Wertung und Abspann, ungeschnitten

Moorland Mayhem — Featherstorm

Öffnet in einer eigenen Ebene

Zielen und schiessen mit Maus oder Finger. Nachladen geht in fuenf von sieben Modi von selbst. Braucht WebGL. Im Hochformat sind die Ziele kleiner als eine Fingerkuppe — quer im Vollbild spielen.

Lädt erst auf Klick · 0,3 MB Übertragung · 1,3 MB entpackt

Prefill über Kontexttiefe

Ein Spitzenwert bei kurzem Kontext sagt wenig darüber, wie sich ein Modell nach Stunden anfühlt.

125173221 3,1 K · 212,0 t/s 13,3 K · 191,2 t/s 24,8 K · 201,2 t/s 37,1 K · 162,9 t/s 47,3 K · 155,4 t/s 57,6 K · 140,8 t/s 67,8 K · 134,0 t/s 3,1 K67,8 K t/s

Kontexttiefe in tausend Token · Momentanrate innerhalb eines einzigen durchgehenden Prefills: Aufgabe 185882 dieses Laufs verarbeitete 69 985 Token am Stück. llama.cpp meldet dabei alle 2 048 Token einen Zwischenstand; die Rate ist der Quotient aus Token und Zeit zwischen zwei aufeinanderfolgenden Ständen. 32 Schritte bleiben übrig, Werte unter 1 500 Token sind augeschlossen. Von 2 048 auf 68 827 Token fällt die Rate um den Faktor 1,58. Jeder Punkt ist aus dem verlinkten Serverprotokoll nachvollziehbar.

llama.cpp Startparameter

Kontext
131.072
KV-Cache
q8_0 / q8_0
Micro-Batch
512
Spekulativ
MTP, Shared-Q8_0, n-max 2
Build
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf ^
  --mmproj mmproj-F16.gguf --alias qwen3.8-flash-next ^
  --host 127.0.0.1 --port 8099 --device Vulkan0 ^
  --gpu-layers all --n-cpu-moe 0 --fit off -fa on ^
  --load-mode mmap --lazy-mode on ^
  --ctx-size 262144 --parallel 1 --kv-unified ^
  -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 ^
  --ctx-checkpoints 4 --checkpoint-min-step 4096 ^
  --jinja --reasoning on --reasoning-format deepseek --reasoning-effort xhigh

Einordnung

35 / 40

Die Note ist eine persönliche also subjektive Einschätzung.

SpielgefühlLäuft es, und spielt es sich?

Ein sehr gutes Spielgefühl und Feedback, das Spielen macht Spaß und ist abwechslungsreich.

PräsentationMenüs, Anzeigen, Grafik, Ton

Vollständige Umsetzungen, Menüs sind schön und umfangreich designt. Bestes Ergebnis, besser als Sonnet 5.

CodequalitätTests, Struktur, Selbstkorrekturen

12 Testdateien mit 1 494 Testzeilen, kein Reparaturskript. Ordnerstruktur sinnvoll, auch einen Unterordner angelegt.

UmfangWie viel vom Auftrag wurde erfüllt?

55 Dateien, 10 531 Zeilen. Fast alles aus dem Prompt wurde im Spiel auch umgesetzt.

Was schiefging

  • Im Ladebildschirm steht „Featherstorm wordt geladen“ — Niederländisch statt Deutsch. Genau eine Stelle im ganzen Spiel; der Rest ist durchgehend deutsch.
  • Das Spiel rendert auf ein 1280×720-Canvas. Auf einem 390 Pixel breiten Telefon wird es auf 390×219 herunterskaliert — spielbar, aber die Zielscheiben sind klein.
  • Der Lauf brauchte drei Sitzungen (20, 376 und 419 Minuten). Zwischen den Sitzungen ging der Kontext verloren und musste neu aufgebaut werden.

llama.cpp-Serverlog · 346 von 459 Antworten ab 200 Tokens · Lauf vom 03./04.09.2026, 13 h 35 min. Der Server lief 844,3 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 837,0 Minuten; darin liegt eine Leerlaufpause von 21,9 Minuten. Das Arbeitsfenster sind also 815 Minuten. Die reine Rechenzeit auf der GPU beträgt 798,8 Minuten.

Lauf: Clair Obscure · UD-Q4_K_XL · Reasoning xhigh · 01. September 2026

Die Zahlen auf einen Blick

Decode, Median

10,93 t/s

92 gewertete Antworten

Decode, p10 bis p90

9,70–13,85 t/s

Antworten ab 200 Tokens werden gewertet; kürzere erzeugen im Protokoll Ausreißer bis über 1 000 000 t/s, weil dort ein einzelnes Token in nahezu null Millisekunden fällt. Median klassisch, Perzentile nach Rangplatz. Beim Prefill gilt diese Schwelle NICHT, dort zählt jede Auswertung.

Spitze

17,01 t/s

einzelne Antwort

Prefill, Median

109,7 t/s

Ausgabe erzeugt

236.460 Token

nur die gewerteten Antworten ab 200 Tokens

Laufzeit

6,2 h

370 Minuten

Selbstkorrekturen

nicht gemessen

Antworten gesamt

106

92 davon gewertet

Eingabe gesamt

8,15 Mio. Token

Kontext aller 106 Anfragen zusammengezählt

davon neu berechnet

251.883 Token

7,90 Mio. lagen im Prompt-Cache

Durch das Modell gelaufen

8,39 Mio. Token

Eingabe und Ausgabe zusammen

Bei einem Anbieter

0,29 USD

Qwen3.8 Flash gehostet, günstigster Tarif

Was dieser Lauf gekostet hätte, wenn Qwen3.8 Flash bei einem Anbieter gelaufen wäre
Anbieter Eingabeje Mio. Ausgabeje Mio. Cacheje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Alibaba Cloud Int. 0,150,47 0,016 1,34 0,29

Alle Beträge in USD. Die ersten drei Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit denselben Token wie links: 8 153 803 Eingabe über alle Anfragen, davon 251 883 neu berechnet und 7 901 920 aus dem Prompt-Cache, dazu 238 371 Ausgabe. Die Spalte „ohne Cache“ setzt die ganze Eingabe zum Eingabetarif an. In der Spalte „mit Cache“ zahlt der neue Teil den Schreibtarif von 0,20 USD, der zwischengespeicherte den Lesetarif von 0,016 USD. Einziger Anbieter ist Alibaba Cloud International. Dort heißt das Modell „Qwen3.8 Flash“, ohne den Zusatz Next und ohne Angabe einer Parameterzahl. Gelaufen ist hier der Build Qwen3.8-Flash-Next von Hugging Face mit 125 Milliarden Parametern, davon 6 aktiv. Für dieselbe Herkunft sprechen derselbe Hersteller, dieselbe Kontextlänge von 1 000 000 Token und dasselbe Erscheinungsdatum; bewiesen ist es durch die Anbieterseite nicht. Stand 08.09.2026, Listenpreise ohne Mengenrabatt. Lokal kostet der Lauf statt dessen Strom und die Anschaffung des Rechners. Preise bei OpenRouter, abgerufen am 2026-09-08.

Was dieser Lauf gekostet hätte, wenn Sonnet 5 mit gleichem Tokenverbrauch gelaufen wäre
Modell Eingabeje Mio. Ausgabeje Mio. Cache schreibenje Mio. Cache lesenje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Sonnet 5 2,0010,00 2,500,20 18,69 4,59

Alle Beträge in USD. Die ersten vier Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit genau den Token dieses Laufs: 8 153 803 Eingabe, davon 251 883 neu und 7 901 920 aus dem Cache, dazu 238 371 Ausgabe. Ohne Cache zum Eingabetarif, mit Cache zahlt der neue Teil den Schreibtarif und der zwischengespeicherte den Lesetarif. Das ist ein Vergleich unter der Annahme gleichen Tokenverbrauchs. Ein anderes Modell löst dieselbe Aufgabe mit anderer Tokenzahl, meist mit weniger; die Zeile sagt also, was diese Token bei Sonnet 5 gekostet hätten, nicht was Sonnet 5 für diese Aufgabe gekostet hätte. Preisliste von Anthropic, abgerufen am 2026-09-08.

llama.cpp-Serverlog · 92 von 106 Antworten ab 200 Tokens · Lauf vom August 2026. Der Server lief 374,4 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 369,7 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die reine Rechenzeit auf der GPU beträgt 368,1 Minuten. · Rohprotokoll

Ergebnisse

Clair Obscure — Kampfarena mit Magiekreis, Aktionsmenü und Zaubereffekten, ungeschnitten

Clair Obscur Echo — Studio of the Gilded Hour

Öffnet in einer eigenen Ebene

Maus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.

Lädt erst auf Klick · 0,3 MB Übertragung · 1,7 MB entpackt

Prefill über Kontexttiefe

Ein Spitzenwert bei kurzem Kontext sagt wenig darüber, wie sich ein Modell nach Stunden anfühlt.

183205227 3,1 K · 222,9 t/s 7,2 K · 204,8 t/s 13,3 K · 197,3 t/s 17,4 K · 188,6 t/s 22,4 K · 203,2 t/s 28,5 K · 192,7 t/s 32,6 K · 186,9 t/s 3,1 K32,6 K t/s

Kontexttiefe in tausend Token · Momentanrate innerhalb eines einzigen durchgehenden Prefills: Aufgabe 176155 dieses Laufs verarbeitete 35 009 Token am Stück. llama.cpp meldet dabei alle 2 048 Token einen Zwischenstand; die Rate ist der Quotient aus Token und Zeit zwischen zwei aufeinanderfolgenden Ständen. 15 Schritte bleiben übrig, Reststücke unter 1 500 Token sind verworfen, weil dort der Aufruf-Overhead misst statt der Tiefe. Von 2 048 auf 33 642 Token fällt die Rate um den Faktor 1,19. Jeder Punkt ist aus dem verlinkten Serverprotokoll nachrechenbar.

llama.cpp Startparameter

Kontext
262.144
KV-Cache
q8_0 / q8_0
Micro-Batch
512
Spekulativ
MTP, ältere Fassung (nicht die von Unsloth)
Build
580e88d
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf ^
  --mmproj mmproj-F16.gguf --alias qwen3.8-flash-next ^
  --host 127.0.0.1 --port 8099 --device Vulkan0 ^
  --gpu-layers all --n-cpu-moe 0 --fit off -fa on ^
  --load-mode mmap --lazy-mode on ^
  --ctx-size 262144 --parallel 1 --kv-unified ^
  -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 ^
  --ctx-checkpoints 4 --checkpoint-min-step 4096 ^
  --jinja --reasoning on --reasoning-format deepseek --reasoning-effort xhigh

Einordnung

22 / 40

Die Note ist eine persönliche also subjektive Einschätzung.

SpielgefühlLäuft es, und spielt es sich?

Kampfarena läuft, Parieren und Ausweichen sind angelegt.

PräsentationMenüs, Anzeigen, Grafik, Ton

Aufnahme vorhanden.

CodequalitätTests, Struktur, Selbstkorrekturen

Keine Testdateien; auch keine Reparaturskripte.

UmfangWie viel vom Auftrag wurde erfüllt?

29 Dateien, 6 157 Zeilen.

Diese Bewertung ist ein Vorschlag und von Kai Bennett noch nicht bestätigt. Codequalität und Umfang stützen sich auf ausgezählte Dateien, Quell- und Testzeilen sowie Reparaturskripte im Belegrepo.

Was schiefging

Keine Selbstkorrekturen protokolliert.

llama.cpp-Serverlog · 92 von 106 Antworten ab 200 Tokens · Lauf vom August 2026. Der Server lief 374,4 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 369,7 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die reine Rechenzeit auf der GPU beträgt 368,1 Minuten.

Selbst ausprobieren

  1. Gewichte laden · Bezugsquelle
  2. llama-server mit der Startzeile oben starten
  3. Den Endpunkt in VS Code als eigenes Modell eintragen und den Agenten wählen

Auftrag, Agentdateien und Werkzeuge: Agent Test Harness

Zitieren: Kai Felix Bennett, „Nutzbarkeitstest von lokaler KI auf AMD-Hardware", benchmark.securesight.ai, Lauf qwen38-flashnext-moorhuhn-evox2. Messdaten CC-BY-4.0.

Messdaten CC-BY-4.0, Code MIT.