Lokal gelaufen
Laguna S 2.1
AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2
- Hardware
- AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2Strix Halo · Radeon 8060S · gfx1151
- Speicher
- 128 GiB unified
- Aufgaben
- Clair Obscure, Bilderkennung
- Quantisierungen
- Q4_K_M
Beschreibung des Modells
Mixture-of-Experts-Modell von poolside mit 118 Milliarden Parametern insgesamt und rund 8 Milliarden je Token aktiven Parametern. Die Modellkarte nennt 48 Schichten, davon 12 mit globaler Aufmerksamkeit und 36 mit Sliding-Window-Aufmerksamkeit bei Fenstergröße 512, dazu 256 geroutete Experten mit Top-10-Auswahl und einen zusätzlichen geteilten Experten. Die Aufmerksamkeit ist als Grouped-Query mit 8 KV-Köpfen und Kopfdimension 128 ausgeführt, mit Softplus-Gating je Kopf am Ausgang. Kontextfenster 1 048 576 Token, Vokabular 100 352 Token, Lizenz OpenMDW-1.1.
- Hersteller
- poolside
- Architektur
- Mixture-of-Experts
- Parameter gesamt
- 118 Mrd.
- Aktive Parameter je Token
- rund 8 Mrd.
- Schichten
- 48 (12 global, 36 Sliding Window)
- Experten
- 256 geroutet, Top-10, plus 1 geteilter Experte
- Kontextfenster
- 1 048 576 Token
- Lizenz
- OpenMDW-1.1
Angaben des Herstellers: Quelle
Die Zahlen auf einen Blick
Synthetischer Labortest mit pp512 und tg128, kein Agentenlauf. Die Geschwindigkeit stammt daher aus einer Messreihe, nicht aus gewerteten Antworten eines echten Laufs. Eine Tokenbilanz gibt es nicht, sie setzt viele aufeinanderfolgende Anfragen voraus. Die Kurven über die Kontexttiefe stammen aus einer eigenen Messung am laufenden Server mit Prompts wachsender Länge. Das Spiel daneben stammt aus einem eigenen Durchgang desselben Modells, gebaut in UD-Q4_K_XL.
Decode ohne Spekulation
20,71 t/s
llama-bench tg128, so läuft das Modell im Betrieb
Decode bei 36 500 Token
17,8 t/s
Q4_K_M am laufenden Server, bei rund 60 Token sind es 20,6
Prefill bei 512 Token
338,68 t/s
llama-bench pp512 mit --no-mmap
Prefill bei 4 096 Token
275,82 t/s
llama-bench pp4096 mit --no-mmap
Programmieraufgaben
5 von 5
mit Reasoning in 736 Sekunden, ohne Reasoning nur 3 von 5
DFlash im Betrieb
aus
mit Q3_K_M gemessen: Nettoverlust in jeder Arbeitslast, beim Code das 0,94fache
Speicher bei 256 K Kontext
89,1 GiB
belegt, mit KV q8_0 und dem Entwurfsmodell für DFlash
Gewichte
70,01 GiB
Q4_K_M, 117,56 Mrd. Parameter, rund 8 Mrd. aktiv
Synthetisch: llama-bench pp512, pp4096 und tg128, dazu llama-server über die Kontexttiefe. Messreihen vom 22. und 23.07.2026. · Rohprotokoll
Ergebnisse
Clair Obscur: Expedition 33
Öffnet in einer eigenen EbeneMaus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.
Lädt erst auf Klick · 0,3 MB Übertragung · 1,7 MB entpackt
Messreihen
Decode über die Kontexttiefe
Gemessen an einem laufenden Server mit echten, codeähnlichen Prompts wachsender Länge. Bis 128 K sinkt die Geschwindigkeit beim Schreiben auf weniger als die Hälfte.
Prefill über die Kontexttiefe
Bis 32 K verliert das Einlesen des Prompts kaum Tempo, danach bricht es ein. Wer nur flach misst, hält Prefill fälschlich für unabhängig von der Tiefe.
DFlash über die Entwurfstiefe, gemessen an einem einzelnen Prompt
Die Modellkarte empfiehlt eine Entwurfstiefe von 15. Auf dieser Maschine ist das zweieinhalbmal langsamer als ganz ohne Spekulation. Am schnellsten ist 3 mit 27,9 t/s, aber nur bei diesem einen Prompt: in einer echten Agentensitzung fiel die Annahme auf null, und DFlash ist im Betrieb aus.
llama.cpp Startparameter
- Kontext
- 262.144
- KV-Cache
- q8_0 / q8_0
- Micro-Batch
- 512
- Spekulativ
- draft-dflash · n_max 3 · im Spiellauf aktiv, später abgeschaltet
- Build
- 04b2b72
llama-server -m Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf ^ --host 127.0.0.1 --port 8091 ^ -c 262144 -ngl 999 -fa on ^ -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 ^ --spec-type draft-dflash --spec-draft-n-max 3 ^ --jinja --reasoning on
Einordnung
22 / 40
Die Note ist eine persönliche also subjektive Einschätzung.
SpielgefühlLäuft es, und spielt es sich?
6/10
Das Spiel startet und läuft: rundenbasierter Kampf mit vier Figuren gegen drei Gegner samt Boss, gesteuert über ein Aktionsmenü mit sieben Aktionen.
PräsentationMenüs, Anzeigen, Grafik, Ton
6/10
Aufnahme vorhanden. Eigene Kampfbühne mit Lichtpartikeln, Leisten für Leben und Aktionspunkte bei jeder Figur.
CodequalitätTests, Struktur, Selbstkorrekturen
4/10
21 Dateien, 5 994 Zeilen, keine Tests.
UmfangWie viel vom Auftrag wurde erfüllt?
6/10
Kampfsystem, Reaktionen, Zugreihenfolge, Schadenszahlen, Partikel und Ton sind umgesetzt.
Diese Bewertung ist ein Vorschlag und von Kai Bennett noch nicht bestätigt. Codequalität und Umfang stützen sich auf ausgezählte Dateien, Quell- und Testzeilen sowie Reparaturskripte im Belegrepo.
Wie sehen Sie das? Die Note oben ist eine persönliche Einschätzung. Hier zählt Ihre, unabhängig davon.
Was schiefging
- Die Modellkarte empfiehlt --spec-draft-n-max 15. Mit Q4_K_M an einem einzelnen Prompt sind das auf dieser Maschine 8,1 t/s, zweieinhalbmal langsamer als ganz ohne Spekulation.
- In einer echten Agentensitzung in VS Code bei rund 26 K Kontext fiel die Annahme der Entwürfe auf null. Das Schreiben sank auf 8,56 t/s, und selbst Anfragen mit 17 neuen Token brauchten fast 12 Sekunden für den Prompt.
- Mit der Entwurfstiefe 15, auf die das Entwurfsmodell trainiert ist, verliert DFlash in jeder Arbeitslast, gemessen mit Q3_K_M: beim Code das 0,94fache, bei Fließtext das 0,26fache, beim Nachdenken das 0,38fache. DFlash bleibt deshalb aus.
- Ohne Reasoning ist das Modell achtmal schneller, löst aber nur noch 3 von 5 Programmieraufgaben statt 5 von 5.
- UD-Q3_K_M schreibt 51 Prozent schneller, denkt aber bei zwei von fünf Aufgaben ohne Ende nach und liefert auch nach 24 576 Token keine Antwort. Eine davon erledigt Q4_K_M mit 623 Token. Der Bericht verwirft Q3 deshalb.
- In der Messreihe über die Kontexttiefe dauerte es bei 128 K 13,2 Minuten bis zum ersten Token.
- Die Laborwerte stammen überwiegend von Q4_K_M. Der Vergleich DFlash an und aus ist mit Q3_K_M gemessen, und für die Kurven über die Kontexttiefe nennt der Bericht keine eindeutige Quantisierung. Das Spiel hat das Modell in UD-Q4_K_XL gebaut. Dessen eigene Geschwindigkeit ist nicht gemessen, weil es von diesem Lauf kein Serverprotokoll gibt.
Synthetisch: llama-bench pp512, pp4096 und tg128, dazu llama-server über die Kontexttiefe. Messreihen vom 22. und 23.07.2026.
Bilderkennung
Laguna S 2.1 ist ein reines Textmodell und kann keine Bilder verarbeiten. Einen Bilderkennungstest gibt es für dieses Modell deshalb nicht.
Quellen
- Messdaten-Repogithub.com/KaiFelixBennett/local-ai-amd-benchmark
- Rohprotokoll dieses Laufsgithub.com/KaiFelixBennett/local-ai-amd-benchmark/blob/main/evidence/reports/laguna-s21-strix-halo-vulkan-benchmark.md
- Quelltext · Clair Obscure · Q4_K_M · Reasoning an, ohne Begrenzunggithub.com/KaiFelixBennett/local-ai-amd-benchmark/tree/main/benchmarks/laguna-s21/clairobscure
Selbst ausprobieren
- Gewichte laden
- llama-server mit der Startzeile oben starten
- Den Endpunkt in VS Code als eigenes Modell eintragen und den Agenten wählen
Auftrag, Agentdateien und Werkzeuge: Agent Test Harness
Zitieren: Kai Felix Bennett, „Nutzbarkeitstest von lokaler KI auf AMD-Hardware", benchmark.securesight.ai, Lauf laguna-s21-evox2. Messdaten CC-BY-4.0.
Messdaten CC-BY-4.0, Code MIT.