Run locally
Laguna S 2.1
AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2
- Hardware
- AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2Strix Halo · Radeon 8060S · gfx1151
- Memory
- 128 GiB unified
- Tasks
- Clair Obscure, Image recognition
- Quantisations
- Q4_K_M
About the model
Mixture-of-Experts model from poolside with 118 billion total parameters and about 8 billion parameters active per token. The model card states 48 layers, of which 12 use global attention and 36 use sliding-window attention with a window size of 512, plus 256 routed experts with top-10 selection and one additional shared expert. Attention is grouped-query with 8 KV heads and head dimension 128, with per-head softplus output gating. Context window 1,048,576 tokens, vocabulary 100,352 tokens, license OpenMDW-1.1.
- Hersteller
- poolside
- Architektur
- Mixture-of-Experts
- Parameter gesamt
- 118 Mrd.
- Aktive Parameter je Token
- rund 8 Mrd.
- Schichten
- 48 (12 global, 36 Sliding Window)
- Experten
- 256 geroutet, Top-10, plus 1 geteilter Experte
- Kontextfenster
- 1 048 576 Token
- Lizenz
- OpenMDW-1.1
Figures from the vendor: Source
The numbers at a glance
Synthetischer Labortest mit pp512 und tg128, kein Agentenlauf. Die Geschwindigkeit stammt daher aus einer Messreihe, nicht aus gewerteten Antworten eines echten Laufs. Eine Tokenbilanz gibt es nicht, sie setzt viele aufeinanderfolgende Anfragen voraus. Die Kurven über die Kontexttiefe stammen aus einer eigenen Messung am laufenden Server mit Prompts wachsender Länge. Das Spiel daneben stammt aus einem eigenen Durchgang desselben Modells, gebaut in UD-Q4_K_XL.
Decode ohne Spekulation
20.71 t/s
llama-bench tg128, so läuft das Modell im Betrieb
Decode bei 36 500 Token
17.8 t/s
Q4_K_M am laufenden Server, bei rund 60 Token sind es 20,6
Prefill bei 512 Token
338.68 t/s
llama-bench pp512 mit --no-mmap
Prefill bei 4 096 Token
275.82 t/s
llama-bench pp4096 mit --no-mmap
Programmieraufgaben
5 von 5
mit Reasoning in 736 Sekunden, ohne Reasoning nur 3 von 5
DFlash im Betrieb
aus
mit Q3_K_M gemessen: Nettoverlust in jeder Arbeitslast, beim Code das 0,94fache
Speicher bei 256 K Kontext
89.1 GiB
belegt, mit KV q8_0 und dem Entwurfsmodell für DFlash
Gewichte
70.01 GiB
Q4_K_M, 117,56 Mrd. Parameter, rund 8 Mrd. aktiv
Synthetisch: llama-bench pp512, pp4096 und tg128, dazu llama-server über die Kontexttiefe. Messreihen vom 22. und 23.07.2026. · Raw log
Results
Clair Obscur: Expedition 33
Opens in its own layerMaus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.
Loads only on click · 0.3 MB transfer · 1.7 MB unpacked
Measurement series
Decode über die Kontexttiefe
Gemessen an einem laufenden Server mit echten, codeähnlichen Prompts wachsender Länge. Bis 128 K sinkt die Geschwindigkeit beim Schreiben auf weniger als die Hälfte.
Prefill über die Kontexttiefe
Bis 32 K verliert das Einlesen des Prompts kaum Tempo, danach bricht es ein. Wer nur flach misst, hält Prefill fälschlich für unabhängig von der Tiefe.
DFlash über die Entwurfstiefe, gemessen an einem einzelnen Prompt
Die Modellkarte empfiehlt eine Entwurfstiefe von 15. Auf dieser Maschine ist das zweieinhalbmal langsamer als ganz ohne Spekulation. Am schnellsten ist 3 mit 27,9 t/s, aber nur bei diesem einen Prompt: in einer echten Agentensitzung fiel die Annahme auf null, und DFlash ist im Betrieb aus.
llama.cpp launch parameters
- Context
- 262,144
- KV-Cache
- q8_0 / q8_0
- Micro-Batch
- 512
- Speculative
- draft-dflash · n_max 3 · im Spiellauf aktiv, später abgeschaltet
- Build
- 04b2b72
llama-server -m Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf ^ --host 127.0.0.1 --port 8091 ^ -c 262144 -ngl 999 -fa on ^ -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 ^ --spec-type draft-dflash --spec-draft-n-max 3 ^ --jinja --reasoning on
Assessment
22 / 40
The grade is a personal, and therefore subjective, assessment.
Game feelDoes it run, and does it play?
6/10
Das Spiel startet und läuft: rundenbasierter Kampf mit vier Figuren gegen drei Gegner samt Boss, gesteuert über ein Aktionsmenü mit sieben Aktionen.
PresentationMenus, HUD, graphics, sound
6/10
Aufnahme vorhanden. Eigene Kampfbühne mit Lichtpartikeln, Leisten für Leben und Aktionspunkte bei jeder Figur.
Code qualityTests, structure, self-corrections
4/10
21 Dateien, 5 994 Zeilen, keine Tests.
ScopeHow much of the prompt was fulfilled?
6/10
Kampfsystem, Reaktionen, Zugreihenfolge, Schadenszahlen, Partikel und Ton sind umgesetzt.
This assessment is a proposal and has not yet been confirmed by Kai Bennett. Code quality and scope rest on counted files, source and test lines and repair scripts in the evidence repository.
How do you see it? The grade above is a personal assessment. Here yours counts, independently of it.
What went wrong
- Die Modellkarte empfiehlt --spec-draft-n-max 15. Mit Q4_K_M an einem einzelnen Prompt sind das auf dieser Maschine 8,1 t/s, zweieinhalbmal langsamer als ganz ohne Spekulation.
- In einer echten Agentensitzung in VS Code bei rund 26 K Kontext fiel die Annahme der Entwürfe auf null. Das Schreiben sank auf 8,56 t/s, und selbst Anfragen mit 17 neuen Token brauchten fast 12 Sekunden für den Prompt.
- Mit der Entwurfstiefe 15, auf die das Entwurfsmodell trainiert ist, verliert DFlash in jeder Arbeitslast, gemessen mit Q3_K_M: beim Code das 0,94fache, bei Fließtext das 0,26fache, beim Nachdenken das 0,38fache. DFlash bleibt deshalb aus.
- Ohne Reasoning ist das Modell achtmal schneller, löst aber nur noch 3 von 5 Programmieraufgaben statt 5 von 5.
- UD-Q3_K_M schreibt 51 Prozent schneller, denkt aber bei zwei von fünf Aufgaben ohne Ende nach und liefert auch nach 24 576 Token keine Antwort. Eine davon erledigt Q4_K_M mit 623 Token. Der Bericht verwirft Q3 deshalb.
- In der Messreihe über die Kontexttiefe dauerte es bei 128 K 13,2 Minuten bis zum ersten Token.
- Die Laborwerte stammen überwiegend von Q4_K_M. Der Vergleich DFlash an und aus ist mit Q3_K_M gemessen, und für die Kurven über die Kontexttiefe nennt der Bericht keine eindeutige Quantisierung. Das Spiel hat das Modell in UD-Q4_K_XL gebaut. Dessen eigene Geschwindigkeit ist nicht gemessen, weil es von diesem Lauf kein Serverprotokoll gibt.
Synthetisch: llama-bench pp512, pp4096 und tg128, dazu llama-server über die Kontexttiefe. Messreihen vom 22. und 23.07.2026.
Image recognition
Laguna S 2.1 ist ein reines Textmodell und kann keine Bilder verarbeiten. Einen Bilderkennungstest gibt es für dieses Modell deshalb nicht.
Sources
- Measurement repositorygithub.com/KaiFelixBennett/local-ai-amd-benchmark
- Raw log of this rungithub.com/KaiFelixBennett/local-ai-amd-benchmark/blob/main/evidence/reports/laguna-s21-strix-halo-vulkan-benchmark.md
- Source code · Clair Obscure · Q4_K_M · Reasoning an, ohne Begrenzunggithub.com/KaiFelixBennett/local-ai-amd-benchmark/tree/main/benchmarks/laguna-s21/clairobscure
Try it yourself
- Download the weights
- Start llama-server with the parameters above
- Register the endpoint in VS Code as a custom model and pick the agent
Prompt, agent files and tools: Agent Test Harness
Citation: Kai Felix Bennett, “Usability test of local AI on AMD hardware”, benchmark.securesight.ai, run laguna-s21-evox2. Measurement data CC-BY-4.0.
Measurement data CC-BY-4.0, code MIT.