Skip to content
benchmark.securesight.ai
DE

Run locally

Laguna S 2.1

AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2

Hardware
AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2Strix Halo · Radeon 8060S · gfx1151
Memory
128 GiB unified
Tasks
Clair Obscure, Image recognition
Quantisations
Q4_K_M

About the model

Mixture-of-Experts model from poolside with 118 billion total parameters and about 8 billion parameters active per token. The model card states 48 layers, of which 12 use global attention and 36 use sliding-window attention with a window size of 512, plus 256 routed experts with top-10 selection and one additional shared expert. Attention is grouped-query with 8 KV heads and head dimension 128, with per-head softplus output gating. Context window 1,048,576 tokens, vocabulary 100,352 tokens, license OpenMDW-1.1.

Hersteller
poolside
Architektur
Mixture-of-Experts
Parameter gesamt
118 Mrd.
Aktive Parameter je Token
rund 8 Mrd.
Schichten
48 (12 global, 36 Sliding Window)
Experten
256 geroutet, Top-10, plus 1 geteilter Experte
Kontextfenster
1 048 576 Token
Lizenz
OpenMDW-1.1

Figures from the vendor: Source

The numbers at a glance

Synthetischer Labortest mit pp512 und tg128, kein Agentenlauf. Die Geschwindigkeit stammt daher aus einer Messreihe, nicht aus gewerteten Antworten eines echten Laufs. Eine Tokenbilanz gibt es nicht, sie setzt viele aufeinanderfolgende Anfragen voraus. Die Kurven über die Kontexttiefe stammen aus einer eigenen Messung am laufenden Server mit Prompts wachsender Länge. Das Spiel daneben stammt aus einem eigenen Durchgang desselben Modells, gebaut in UD-Q4_K_XL.

Decode ohne Spekulation

20.71 t/s

llama-bench tg128, so läuft das Modell im Betrieb

Decode bei 36 500 Token

17.8 t/s

Q4_K_M am laufenden Server, bei rund 60 Token sind es 20,6

Prefill bei 512 Token

338.68 t/s

llama-bench pp512 mit --no-mmap

Prefill bei 4 096 Token

275.82 t/s

llama-bench pp4096 mit --no-mmap

Programmieraufgaben

5 von 5

mit Reasoning in 736 Sekunden, ohne Reasoning nur 3 von 5

DFlash im Betrieb

aus

mit Q3_K_M gemessen: Nettoverlust in jeder Arbeitslast, beim Code das 0,94fache

Speicher bei 256 K Kontext

89.1 GiB

belegt, mit KV q8_0 und dem Entwurfsmodell für DFlash

Gewichte

70.01 GiB

Q4_K_M, 117,56 Mrd. Parameter, rund 8 Mrd. aktiv

Synthetisch: llama-bench pp512, pp4096 und tg128, dazu llama-server über die Kontexttiefe. Messreihen vom 22. und 23.07.2026. · Raw log

Results

Clair Obscur: Expedition 33, gebaut von Laguna S 2.1. Kampf mit vier Figuren gegen drei Gegner samt Boss, gesteuert über ein Aktionsmenü, ungeschnitten.

Clair Obscur: Expedition 33

Opens in its own layer

Maus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.

Loads only on click · 0.3 MB transfer · 1.7 MB unpacked

Measurement series

Decode über die Kontexttiefe

Gemessen an einem laufenden Server mit echten, codeähnlichen Prompts wachsender Länge. Bis 128 K sinkt die Geschwindigkeit beim Schreiben auf weniger als die Hälfte.

112132 4.3 K · 29.28 t/s · Prompt mit 4 267 Token 33.5 K · 18.13 t/s · Prompt mit 33 477 Token 133.8 K · 13.28 t/s · Prompt mit 133 839 Token 4.3 K33.5 K133.8 K t/s
Kontexttiefe in tausend Token · llama-server, Vulkan, KV q8_0, ohne Spekulation. Welche Quantisierung dabei lief, nennt Abschnitt 5.7 nicht. Abschnitt 6.2c führt die 18,13 t/s bei 32 K als Q3 und misst später mit einem neueren Build bei 36 500 Token 26,6 t/s mit Q3_K_M und 17,8 t/s mit Q4_K_M. Mit den 20,71 t/s von llama-bench ist der Wert bei 4 K laut Abschnitt 5.7.2 nicht direkt vergleichbar: dort KV f16 und eine andere Zeitmessung.

Prefill über die Kontexttiefe

Bis 32 K verliert das Einlesen des Prompts kaum Tempo, danach bricht es ein. Wer nur flach misst, hält Prefill fälschlich für unabhängig von der Tiefe.

109190271 4.3 K · 252.90 t/s · 16,9 Sekunden bis zum ersten Token 33.5 K · 239.80 t/s · 121,9 Sekunden bis zum ersten Token 133.8 K · 126.40 t/s · 794 Sekunden, 13,2 Minuten bis zum ersten Token 4.3 K33.5 K133.8 K t/s
Kontexttiefe in tausend Token · Von 4 K auf 32 K 5 Prozent weniger, von 32 K auf 128 K weitere 47 Prozent. Dieselbe Messreihe wie oben, auch hier ohne Angabe der Quantisierung. Bericht, Abschnitt 5.7.

DFlash über die Entwurfstiefe, gemessen an einem einzelnen Prompt

Die Modellkarte empfiehlt eine Entwurfstiefe von 15. Auf dieser Maschine ist das zweieinhalbmal langsamer als ganz ohne Spekulation. Am schnellsten ist 3 mit 27,9 t/s, aber nur bei diesem einen Prompt: in einer echten Agentensitzung fiel die Annahme auf null, und DFlash ist im Betrieb aus.

51831 ohne Spekulation 20,4 t/s 2 · 26.00 t/s · Annahme 0,645 3 · 27.90 t/s · Annahme 0,559 4 · 24.70 t/s · Annahme 0,443 5 · 23.10 t/s · Annahme 0,391 6 · 19.60 t/s · Annahme 0,293 8 · 9.70 t/s · Annahme 0,265 15 · 8.10 t/s · Annahme 0,150 schnellster Wert, ein PromptModellkarte 23456815 t/s
Entwurfstiefe, --spec-draft-n-max · Q4_K_M, Poolside Fork 04b2b72, Temperatur 0, derselbe Prompt. Die Linie ohne Spekulation stammt aus dem offiziellen llama.cpp, nicht aus dem Fork, Bericht Abschnitt 9. Dass DFlash im Betrieb verliert, steht in den Abschnitten 5.8.1 und 6.2b des Berichts.

llama.cpp launch parameters

Context
262,144
KV-Cache
q8_0 / q8_0
Micro-Batch
512
Speculative
draft-dflash · n_max 3 · im Spiellauf aktiv, später abgeschaltet
Build
04b2b72
llama-server -m Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf ^
  --host 127.0.0.1 --port 8091 ^
  -c 262144 -ngl 999 -fa on ^
  -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 ^
  --spec-type draft-dflash --spec-draft-n-max 3 ^
  --jinja --reasoning on

Assessment

22 / 40

The grade is a personal, and therefore subjective, assessment.

Game feelDoes it run, and does it play?

Das Spiel startet und läuft: rundenbasierter Kampf mit vier Figuren gegen drei Gegner samt Boss, gesteuert über ein Aktionsmenü mit sieben Aktionen.

PresentationMenus, HUD, graphics, sound

Aufnahme vorhanden. Eigene Kampfbühne mit Lichtpartikeln, Leisten für Leben und Aktionspunkte bei jeder Figur.

Code qualityTests, structure, self-corrections

21 Dateien, 5 994 Zeilen, keine Tests.

ScopeHow much of the prompt was fulfilled?

Kampfsystem, Reaktionen, Zugreihenfolge, Schadenszahlen, Partikel und Ton sind umgesetzt.

This assessment is a proposal and has not yet been confirmed by Kai Bennett. Code quality and scope rest on counted files, source and test lines and repair scripts in the evidence repository.

What went wrong

  • Die Modellkarte empfiehlt --spec-draft-n-max 15. Mit Q4_K_M an einem einzelnen Prompt sind das auf dieser Maschine 8,1 t/s, zweieinhalbmal langsamer als ganz ohne Spekulation.
  • In einer echten Agentensitzung in VS Code bei rund 26 K Kontext fiel die Annahme der Entwürfe auf null. Das Schreiben sank auf 8,56 t/s, und selbst Anfragen mit 17 neuen Token brauchten fast 12 Sekunden für den Prompt.
  • Mit der Entwurfstiefe 15, auf die das Entwurfsmodell trainiert ist, verliert DFlash in jeder Arbeitslast, gemessen mit Q3_K_M: beim Code das 0,94fache, bei Fließtext das 0,26fache, beim Nachdenken das 0,38fache. DFlash bleibt deshalb aus.
  • Ohne Reasoning ist das Modell achtmal schneller, löst aber nur noch 3 von 5 Programmieraufgaben statt 5 von 5.
  • UD-Q3_K_M schreibt 51 Prozent schneller, denkt aber bei zwei von fünf Aufgaben ohne Ende nach und liefert auch nach 24 576 Token keine Antwort. Eine davon erledigt Q4_K_M mit 623 Token. Der Bericht verwirft Q3 deshalb.
  • In der Messreihe über die Kontexttiefe dauerte es bei 128 K 13,2 Minuten bis zum ersten Token.
  • Die Laborwerte stammen überwiegend von Q4_K_M. Der Vergleich DFlash an und aus ist mit Q3_K_M gemessen, und für die Kurven über die Kontexttiefe nennt der Bericht keine eindeutige Quantisierung. Das Spiel hat das Modell in UD-Q4_K_XL gebaut. Dessen eigene Geschwindigkeit ist nicht gemessen, weil es von diesem Lauf kein Serverprotokoll gibt.

Synthetisch: llama-bench pp512, pp4096 und tg128, dazu llama-server über die Kontexttiefe. Messreihen vom 22. und 23.07.2026.

Image recognition

Laguna S 2.1 ist ein reines Textmodell und kann keine Bilder verarbeiten. Einen Bilderkennungstest gibt es für dieses Modell deshalb nicht.

Try it yourself

  1. Download the weights
  2. Start llama-server with the parameters above
  3. Register the endpoint in VS Code as a custom model and pick the agent

Prompt, agent files and tools: Agent Test Harness

Citation: Kai Felix Bennett, “Usability test of local AI on AMD hardware”, benchmark.securesight.ai, run laguna-s21-evox2. Measurement data CC-BY-4.0.

Measurement data CC-BY-4.0, code MIT.