Zum Inhalt springen

Tests und persönliche Erfahrungen

Lokale KI auf bezahlbarer Hardware

Welche Modelle bringen welche Ergebnisse in welcher Geschwindigkeit? Keine Standard-Benchmarks, sondern Bilderkennung und agentisches Coding mit VS Code auf lokaler, bezahlbarer AMD-Hardware selbst ausprobiert.

8Läufe mit Messung
2Maschinen
37,9 hServerlaufzeit

Alle Läufe ansehen

Human in the loop

Kai Bennett

Ich bin Kai Bennett, Softwarearchitekt, und begeistere mich seit September 2025 für lokale KI. Hier teile ich meine Erkenntnisse und Ergebnisse, die ich auf den beiden Geräten gemessen habe.

Zertifizierter Softwarearchitekt (iSAQB CPSA-F/A) · Mitgründer von securesight.ai

LinkedInGitHubXingE-Mail

Wie hier gemessen wird

Persönliche Empfehlung

Meine Empfehlung pro Gerät.

Ich habe mit den beiden Modellen die längsten agentischen autonomen Aufträge von bis zu 13,6 h und gleichzeitig sehr gute Ergebnisse bei nutzbarer Geschwindigkeit von über 20 t/s im Median. Das ist für mich auf dieser Hardware, Stand September 2026, der beste Kompromiss aus Qualität und Geschwindigkeit, ohne Token bezahlen, ohne Abhängigkeit zu Cloud Anbietern und ohne meine Daten zu teilen.

AI MAX 395

Qwen3.8-Flash-Next

UD-Q4_K_XL

21,76t/s Median

R9700

Qwen3.8-27B

UD-Q4_K_XL

33,69t/s Median

Warum diese beiden

AMD AI MAX 395 · AMD Halo · 13,6 h

Single Shot

Qwen3.8-Flash-Next baut ein Spiel mit — Zeilen Code inklusive Tests fertig, autonom, mit einem einzelnen Prompt.

13,6 hLaufzeit
459Anfragen
787kTokens erzeugt

Jetzt spielen

Radeon AI PRO R9700

Der schnellste gemessene Lauf.

Qwen3.8-27B UD-Q4_K_XL mit über 30 t/s im Schnitt, bei langem Kontext noch um die 30. Das ist eine gut brauchbare Geschwindigkeit, und das, obwohl es sich um ein Dense-Modell handelt, bei dem alle 27 Milliarden Parameter gleichzeitig aktiv sind.

33,69t/s Median
45,34t/s p90
9,0 hLaufzeit

Alle Geschwindigkeiten

Maschine 1

Radeon AI PRO R9700

gfx1201 · RDNA4 · 32 GB dediziert, headless betrieben.
Intel Core Ultra 7 265KF · 63,6 GiB RAM · ASUS PRIME Z890-P.

Windows 11 Pro 26200 · Adrenalin 26.6.4 · amdvlk64 9.2.10.395

Maschine 2

AMD AI MAX 395 (AMD Halo)

Strix Halo · Radeon 8060S · gfx1151 · 128 GiB unified LPDDR5X-8533, rund 256 GB/s theoretische Bandbreite.

Windows 11 Pro 26200 · Treiber 32.0.31021.5001 · Vulkan-Heap 98.123 MiB

Software

llama.cpp über Vulkan

Alle Läufe auf llama.cpp mit dem Vulkan-Backend, kein ROCm, keine BIOS-Änderung. Als Server im lokalen Netz, angebunden an VS Code Copilot Chat als Custom Endpoint.

Builds b10717 · bd9bd1b · b9985 · 580e88d · poolside 04b2b72

Persönliche Empfehlung

Ich habe mit den beiden Modellen die längsten agentischen autonomen Aufträge von bis zu 13,6 h und gleichzeitig sehr gute Ergebnisse bei nutzbarer Geschwindigkeit von über 20 t/s im Median. Das ist für mich auf dieser Hardware, Stand September 2026, der beste Kompromiss.

AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2

Qwen3.8-Flash-Next

UD-Q4_K_XL · MTP, Shared-Q8_0, n-max 2

t/s Median
21,76
Laufzeit
13,6 h
Anfragen
459

Nicht das schnellste und auch nicht die höchste Qualität, aber es nutzt die Vorteile des AMD Strix Halo, also verwendet den gesamten VRAM, beinhaltet bereits die Qwen 4 Architektur und liefert mit stabiler Geschwindigkeit gut ab.

Rohprotokoll

Radeon AI PRO R9700

Qwen3.8-27B

UD-Q4_K_XL · draft-mtp + ngram-mod 24/48/64

t/s Median
33,69
Laufzeit
9,0 h
Anfragen
108

Das erste Modell, das ich auf einer GPU mit 24–32 GB VRAM auch zum Coding empfehlen würde. Es läuft in Q4 stabil agentisch über Stunden, schreibt Tests und reviewt sich selbst. Wenn ich ein Modell im Bereich bis 32 GB VRAM empfehlen würde, dann wäre es definitiv dieses.

Rohprotokoll

Die Modelle

Videos, Bilderkennung und Messwerte auf den Detailseiten

Zum Beispiel ein vom Retro Spiel „Moorhuhn“ inspirierter Test, der mit nur einem Prompt erstellt wurde, zum selbst ausprobieren. Alle Messwerte inklusive der Geschwindigkeit und der verbrauchten Token. Auch Bilderkennung wird getestet, eine wichtige Fähigkeit der Modelle damit sie ihre eigenen Ergebnisse ansehen und verbessern können.

Dafür wurde ein Agent in Visual Studio Code konfiguriert, der die entsprechenden Anweisungen enthält.

14 von 14 Detailseiten gebaut·0 folgen

/

Tippen zum Filtern · ↑ ↓ zum Wählen · Eingabe öffnet die Detailseite

Qwen3.8-Flash-NextMoorhuhn · Clair Obscure UD-Q4_K_XL 20,37 t/s Median 33,3Mio. Token 1185Minuten AI MAX 395 Rohprotokoll +1 Detailseite
Qwen3.8-27BMoorhuhn · Clair Obscure UD-Q4_K_XL · UD-Q6_K_M 31,77 t/s Median 11,7Mio. Token 1043Minuten R9700 Rohprotokoll +1 Detailseite
Qwen3.6-27BMoorhuhn · Clair Obscure UD-Q6_K_XL 33,45 t/s Median 28,9Mio. Token 153Minuten R9700 Rohprotokoll Detailseite
Qwen3.5-122B-A10BLabortest UD-Q4_K_XL 31,80 t/s Median Mio. Token Minuten AI MAX 395 Rohprotokoll Detailseite
Laguna S 2.1Clair Obscure Q4_K_M 20,71 t/s Median Mio. Token Minuten AI MAX 395 Rohprotokoll Detailseite
DeepSeek-V4-Flash-0731Clair Obscure UD-IQ3_XXS 7,02 t/s Median 8,0Mio. Token 502Minuten AI MAX 395 Rohprotokoll Detailseite
Opus 5 ULTRACODEClair Obscure · Moorhuhn t/s Median Mio. Token Minuten Cloud nicht gemessen Detailseite
GPT 5.6 SolMoorhuhn t/s Median Mio. Token Minuten Cloud nicht gemessen Detailseite
Sonnet 5Moorhuhn t/s Median Mio. Token 70Minuten Cloud nicht gemessen Detailseite

Jedes Modell steht einmal, mit allen Aufgaben, die es bearbeitet hat. Wo mehrere Läufe vorliegen, ist der Median über alle gewerteten Antworten dieser Läufe zusammen gerechnet, nicht aus den einzelnen Medianen gemittelt; Token und Minuten sind Summen. Die Zahlen je Lauf stehen auf der Detailseite.
Mio. Token verbraucht ist die Zahl, die ein kostenpflichtiger Anbieter in Rechnung gestellt hätte: Eingabe plus Ausgabe, wobei jede einzelne Anfrage mit ihrem vollen Kontext zählt und nicht nur mit dem, was neu hinzukam. Ein Agentenlauf schickt denselben Verlauf hunderte Male mit, deshalb liegt die Eingabe um ein Vielfaches über der Ausgabe. Kurze Antworten sind mitgezählt, auch die, die in den Geschwindigkeitswert nicht eingehen. Die Aufteilung in Eingabe und Ausgabe steht im Tooltip jeder Zeile.

Das beste Ergebnis bisher

Ein 13,5h Lauf erstellt ein komplettes kleines Spiel, u.a. inklusive Konfigurationen und Spielfortschritt.

Qwen3.8-Flash-Next auf dem AMD AI MAX 395, 177 Milliarden Parameter, davon rund sechs aktiv. 459 Requests, 786 506 erzeugte Token, kein einziges Eingreifen. Grafiken, Menüs, Töne, Backend: alles mitgeneriert. Klar können das die großen Modelle auch, aber ich fand das Ergebnis in Teilen sogar besser als von Sonnet 5, und es läuft auf Hardware für um die 2 600 € (z. B. Bosgame M5).

Spielszene: Moorlandschaft im Abendlicht, Vogelscheuche und Dosen als Ziele, oben die Anzeige mit Restzeit und Punktestand.

Gebaut von Qwen3.8-Flash-Next · AMD AI MAX 395

13 h 35an einem Auftrag
459Anfragen
786.506Tokens erzeugt

Den Auftrag lesen Rohprotokoll

Das Ergebnis

Moorhuhn & Clair Obscure Single-Shot-Benchmark

Aufnahmen aus den ausgelieferten Builds: Menüs, Spielmodi, Punktesystem, Freischaltungen.

Moorland Mayhem — Featherstorm · gebaut von Qwen3.8-27B UD-Q4_K_XL auf der Radeon AI PRO R9700 · ein einziger Auftrag. Einstellungen, Statistiken, eine volle Runde und die Auswertung. Ungeschnitten, 1 Minute 44.
Qwen3.6-27B Q6Clair Obscure · Kampf, eigene Aufnahme
Qwen3.6-27B Q6Moorhuhn · 1.125 Punkte
Laguna S 2.1 · AMD AI MAX 395Clair Obscure · Rundenkampf
Clair Obscure — Expedition 33 · Qwen3.8-27B UD-Q6 auf der Radeon AI PRO R9700 · Nachtszene mit Dialog, Portal, Kampfarena mit Zielsystem, Fähigkeitenmenü und Titelbild. Ungeschnitten, 3 Minuten 41.

Referenzlauf

Dieselbe Aufgabe, anderes Modell.

Qwen3.8-Flash-Next auf dem AMD AI MAX 395 (AMD Halo), 177 Milliarden Parameter gesamt, davon rund sechs aktiv. Kampfarena mit Magiekreis, Aktionsmenü, Statusleisten und Zaubereffekten.

Clair Obscure — Expedition 33 · Qwen3.8-Flash-Next UD-Q4_K_XL auf dem AMD AI MAX 395 (AMD Halo) · ungeschnitten, 3 Minuten 16.

Agentische Entwicklung

Single Shot. 13,5h.

Das Modell läuft im lokalen Netz und ist in VS Code Copilot Chat als Custom Endpoint hinterlegt, also genau dort, wo die meisten Entwickler ohnehin sind. Mit Tool Use schreibt es Tests, legt Dateien und Ordner an, erstellt Screenshots und Playwright-Tests, um sich selbst zu prüfen.

Der Lauf ist inzwischen fertig: 13 Stunden 36 Minuten an einem einzigen Auftrag, 459 Anfragen, 786 506 erzeugte und 1 051 292 eingelesene Tokens. Rechnet man den zwischengespeicherten Kontext mit, hat das Modell dabei 24,9 Millionen Tokens gelesen. Kein einziges Mal wurde der Kontext abgeschnitten. Der Höchststand lag bei 98 109 von 131 072.

Das Bild zeigt einen Zwischenstand nach 8 Stunden 47 Minuten: das siebte von dreizehn Arbeitspaketen, 40 geänderte Dateien, das Kontextfenster bei 51 Prozent.

VS Code mit lokalem Modell: llama.cpp-Konsole und Agent bei der Arbeit
Qwen3.8-Flash-Next Q4XL + MTP · 177B/6B aktiv · 131k · Vision · :8099
Oben die Serverkonsole, unten der Agent: 40 geänderte Dateien (+6787/−40), Kontextfenster 67,3 K von 131 K.
1.835.623Tokens erzeugt
869gemessene Antworten
42 hLaufzeit

Vision

Bilderkennung

Viele lokale Modelle können Bilder erkennen. Geprüft wird an eigenen Bildern, um zu testen, wie gut die Bilderkennung funktioniert.

Dashboard-Screenshot als Prüfbild
Werte ablesenEin eigenes Dashboard: Tooltip-Tabelle, KPI-Kacheln, aktive Filter, Fußnoten. Das Modell gibt sie als JSON aus und zeichnet das Diagramm als SVG nach.
Dichtes Foto als Prüfbild
Im Gewühl lesenEin Messestand mit über vierzig Objekten. Gezählt wird, wie viele Preisschilder korrekt gelesen werden, und wie viele erfunden.

Was die Modelle erkannt haben

In beiden Bildern weicht jeweils genau eine Stelle vom Muster ab. Das ist für die Modelle eine Herausforderung, bei der sie Details erkennen müssen. Diese vier Stellen werden deshalb getrennt angegeben.

Geprüft wird
Qwen3.8-27BUD-Q4_K_XL · Radeon AI PRO R9700
Qwen3.6-27BUD-Q6_K_XL · Radeon AI PRO R9700
Qwen3.5-122B-A10BUD-Q4_K_XL · AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2
Sonnet 5— · Cloud-Referenz
Werte richtig ablesen 44 von 5050 von 5030 von 5046 von 50
Zeile Terminal-Bench 2.01 erkannterkannterkannterkannt
Kachelwert 40,72 erkannterkanntnicht erkanntnicht erkannt
Preisschild JOKER3 nicht erkannterkanntnicht erkannterkannt
Weiße Maske, ohne Namen4 nicht erkannterkanntnicht erkanntReihenfolge erkannt, Beträge vertauscht
Preisschilder vollständig richtig5 2 von 44 von 40 von 41 von 4
Erfundene Schilder6 4 · 1 als sicher behauptet005 · keins als sicher behauptet
  1. Zeile Terminal-Bench 2.0 In allen anderen Zeilen der Tabelle steht links der größere Wert. In dieser einen nicht. Wer die Tabelle überfliegt und das Muster fortschreibt, dreht sie um.
  2. Kachelwert 40,7 Die Kachel nennt für dasselbe Modell 40,7, der Tooltip nennt 40.8. Beide Zahlen stehen so im Bild. Wer sie angleicht, hat geglättet statt gelesen.
  3. Preisschild JOKER Bei allen anderen Schildern ist der Pfundpreis höher als der Europreis. Bei diesem einen ist es umgekehrt.
  4. Weiße Maske, ohne Namen Bei allen anderen Schildern steht das Pfund oben und der Euro darunter. Bei diesem einen ist die Reihenfolge vertauscht.
  5. Preisschilder vollständig richtig Gewertet nur im festgelegten Bildausschnitt, in dem die Schilder flach zur Kamera liegen. Richtig heißt: Name sinngemäß getroffen, beide Beträge exakt, Reihenfolge der Währungen korrekt. Zwei von drei genügt nicht.
  6. Erfundene Schilder Genannte Schilder, die im Lösungsschlüssel nicht vorkommen. Getrennt ausgewiesen ist, wie viele davon als sicher behauptet wurden. Ein eingestandenes „nicht lesbar“ kostet einen Punkt, eine erfundene Angabe kostet mehr.

Vorläufig. Der Lösungsschlüssel für die Preisschilder ist erst zu vier von sieben Schildern gesichert. Präzision und Recall werden nur gegen diese vier gerechnet und ändern sich, sobald der Rest bestätigt ist. Die vier Fallen sind davon nicht betroffen, sie sind gesichert.

Geschwindigkeit

33,7t/s

So schnell schreibt der schnellste Lauf.

Median über 82 Antworten. Nicht die maximal erreichte Geschwindigkeit ist entscheidend, sondern die Geschwindigkeit, die man bei der Umsetzung einer Aufgabe im Durchschnitt erreicht.

Hardware

Kontexttiefe

Benchmark-Geschwindigkeiten verzerren das Bild.

Denn sie messen fast immer bei kurzem Kontext. Bei echter Nutzung wächst der Kontext kontinuierlich, und die Geschwindigkeit sinkt stetig. Daher zeigen wir hier Median-Geschwindigkeiten und den Verlauf abhängig von der Kontextgröße.

Prefill · Qwen3.8-27B UD-Q6 · R9700 Messprotokoll

Decode · Qwen3.8-Flash-Next · AMD AI MAX 395 (AMD Halo) Rohprotokoll

Auf der R9700 fällt die Prefill-Rate zwischen 8 K und 164 K um den Faktor 4,2. Rechts die Decode-Rate von Qwen3.8-Flash-Next aus dem Moorhuhn-Lauf: 346 Antworten ab 200 Tokens, jede mit ihrem Kontextstand aus dem Protokoll, in sechs gleich großen Gruppen, gemessen zwischen 34 K und 71 K Kontext, also in dem Bereich, wo es bei der alltäglichen Nutzung wichtig ist. Über diese Spanne fällt sie um den Faktor 1,18. Das Modell lief besonders stabil und zuverlässig.

Feinabstimmung

Its all about settings

Die Parameter der Modelcards sind (für AMD) nicht immer optimal. Zum Beispiel folgende drei habe ich geändert.

spec-draft-n-max · Laguna S 2.1

15 → 3

Verringerung von „spec-draft-n-max“ erzeugt mehr Durchsatz

Mit dem dokumentierten --spec-draft-n-max 15 fällt der Decode auf 8,1 t/s, unter die 20,55 ohne jede Spekulation. Mit 3 steigt er auf 27,9.

Messreihe

Sampling · Qwen3.5-122B

0,0 → 1,5

Ohne das Setting zu Reduktion der Wahrscheinlichkeit für Wiederholungen endet die Antwort nicht

Mit presence_penalty 0.0 lief eine Aufgabe bis ans Kontextende: 32 768 Tokens, ohne Abschluss. Dieselbe Aufgabe braucht 201 Token mit der aktivierten Einstellung.

Messreihe

Speicher · Strix Halo

25,6 GiB

Die Reservierung hochzudrehen half nicht

Eine größere UMA-Reservierung brachte keinen Zuwachs und hätte dem Betriebssystem Speicher entzogen. Selbst bei 262 144 Kontext blieben 25,6 GiB frei.

Messung

Modellkarten

19 Startkonfigurationen.

Jede Zeile ist ein Skript, das genau so einen Server gestartet hat. Die Startparameter lassen sich einzeln kopieren, vollständig, mit allen Flags.

ModellHardware Kontext-ub KV k / vSpekulation Bild
Qwen3.6-27B-UD-Q6_K_XLstart_qwen36_27b_q6_coding.bat R9700 163.840 512 q8_0 / q4_0 Vision
Qwen3.6-27B-UD-Q6_K_XL-mtpstart_qwen36_27b_q6_mtp_coding.bat R9700 172.032 512 q8_0 / q4_0 draft-mtp Vision
start_qwen36_35b_a3b_mtp.bat R9700 172.032 — / —
start_qwen38_27b_coding.bat R9700 262.144 — / —
start_qwen38_27b_ngram_test.bat R9700 262.144 — / —
start_qwen38_27b_q4xl_coding.bat R9700 262.144 — / —
start_qwen38_27b_q4xl_medium.bat R9700 262.144 — / —
Qwen3.8-27B-UD-Q6_K_Mstart_qwen38_27b_test_rmkq1_ub128.bat R9700 262.144 128 q8_0 / turbo4 draft-mtp Vision
Qwen3.8-27B-UD-Q6_K_Mstart_qwen38_27b_test_ub256.bat R9700 262.144 256 q8_0 / turbo4 draft-mtp Vision
Qwen3.8-27B-UD-Q6_K_Mstart_qwen38_27b_test_ub64.bat R9700 262.144 64 q8_0 / turbo4 draft-mtp Vision
DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004start-deepseek-v4-flash-0731-DSPARK.bat AI MAX 395 131.072 512 f16 / f16 draft-dspark
Qwen3.6-35B-A3B-UD-Q4_K_XLstart-qwen-3.6-35b-a3b-vision.bat AI MAX 395 262.144 — / — Vision
Qwen3.5-122B-A10B-UD-Q4_K_XL-00001-of-00003start-qwen35-122b-A10B-MTP-NOTHINK.bat AI MAX 395 262.144 512 q8_0 / q8_0 draft-mtp Vision
Qwen3.5-122B-A10B-UD-Q4_K_XL-00001-of-00003start-qwen35-122b-A10B-MTP.bat AI MAX 395 262.144 512 q8_0 / q8_0 draft-mtp Vision
Qwen3.6-27B-UD-Q6_K_XLstart-qwen36-27b-MTP.bat AI MAX 395 262.144 512 q8_0 / q4_0 draft-mtp Vision
Qwen3.8-27B-UD-Q6_K_XLstart-qwen38-27b-FALLBACK-8090.bat AI MAX 395 32.768 512 q8_0 / q4_0 draft-mtp Vision
Qwen3.8-27B-UD-Q6_K_XL-240819start-qwen38-27b-MTP-240819.bat AI MAX 395 262.144 512 q8_0 / q4_0 draft-mtp Vision
Qwen3.8-27B-UD-Q6_K_XLstart-qwen38-27b-MTP.bat AI MAX 395 262.144 512 q8_0 / q4_0 draft-mtp Vision
Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004start-qwen38-flash-next.bat AI MAX 395 131.072 512 q8_0 / q8_0 draft-mtp Vision

Agent Test Harness

Alles, was du dafür brauchst, findest du hier.

Gemessen werden zwei verschiedene Dinge. Der Lauf zeigt Geschwindigkeit, Durchhaltevermögen und ob am Ende etwas Lauffähiges steht. Die Detailseite zeigt: Gestaltungsvermögen, Bilderkennung, und ob es sich an einen Vertrag hält, ohne zu erfinden.

01

Die Aufträge

Zwei Aufträge, aus denen alle Ergebnisse dieser Seite entstanden sind. Unverändert, so wie sie den Modellen vorlagen. Sie sind absichtlich gegensätzlich gebaut.

Moorhuhn
21 KB · Breite und Ausdauer. Verlangt ausdrücklich kein Gerüst, sondern ein fertiges Spiel mit Spielmodi, Menüs, Statistiken und Tests.
Clair Obscure
15 KB · Tiefe statt Breite. Ein einziger Kampf, aber mit Parieren und Ausweichen in engen Zeitfenstern. Der Auftrag nennt diese Schicht selbst den schwersten Teil.

Der eine Auftrag lässt sich durch Fleiß bestehen, der andere nicht.

02

Die Agenten

Ein Agent für VS Code Copilot Chat. Nach .github/agents/ legen, dann steht er im Chat zur Auswahl.

bilderkennung.agent.md GitHub
Der Bildtest. Er bekommt bewusst kein Terminal, damit das Modell die Prüfbilder ansieht, statt sie sich mit einer Bildbibliothek zurechtzuschneiden.

llama-server spricht die OpenAI-Schnittstelle. VS Code nimmt solche Endpunkte über „Bring your own key“ entgegen, auch ohne Copilot-Abo und ohne Anmeldung. Die Startparameter je Lauf stehen unter Modellkarten.

VS-Code-Dokumentation Harness im Repo

03

Die Detailseiten

Jeder Lauf hat eine eigene Detailseite mit denselben elf Abschnitten: Architektur, Messwerte, Artefakt, Bilderkennung, Tempo, Konfiguration, Qualität, Fehler, Quellen, Nachbau.

Die elf Abschnitte Die Gestaltungsregeln

Prüfstand

Zwei Rechner. Beide unter 3 500 Euro.

Kopier dir die Startparameter des schnellsten gemessenen Laufs auf der Maschine.

Radeon AI PRO R9700

gfx1201 · RDNA4 · 32 GB dediziert

ab ~1 500 €

Zuweisbar
32.624 MiB
CPU
Intel Core Ultra 7 265KF
RAM
63,6 GiB
Mainboard
ASUS PRIME Z890-P WIFI, BIOS 2401
Treiber
Adrenalin 26.6.4
Vulkan-ICD
amdvlk64 9.2.10.395

Schnellster Lauf: Qwen3.8-27B UD-Q4_K_XL · 33,69 t/s

llama-server -m Qwen3.8-27B-UD-Q4_K_XL.gguf ^ --load-mode none --mmproj mmproj-F16.gguf --image-min-tokens 1024 ^ --alias Qwen3.8-27B -dev Vulkan0 --host 127.0.0.1 --port 8080 ^ -c 262144 -ngl 99 -fa on --fit off -ot "token_embd\.weight=Vulkan0" ^ -ctk q8_0 -ctv q8_0 -b 2048 -ub 288 ^ --parallel 1 --kv-unified ^ --ctx-checkpoints 4 --checkpoint-min-step 16384 --cache-ram 0 ^ --spec-type draft-mtp,ngram-mod --spec-draft-n-max 2 ^ --spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 48 --spec-ngram-mod-n-max 64 ^ --spec-draft-device Vulkan0 --spec-draft-ngl 99 ^ --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 ^ --presence-penalty 0.0 --repeat-penalty 1.0 ^ --jinja --reasoning on --reasoning-effort xhigh --reasoning-format deepseek --reasoning-budget -1

AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2

Strix Halo · Radeon 8060S · gfx1151 · 128 GiB unified

ab ~1 800 €

Speicher
128 GiB LPDDR5X-8533, 8 Kanäle
Bandbreite
~256 GB/s theoretisch
Windows sichtbar
63,6 GiB
UMA-Reservierung
64,4 GiB
Vulkan-Heap
98.123 MiB / 93.217 MiB frei
Treiber
32.0.31021.5001

Schnellster Lauf: Qwen3.8-Flash-Next UD-Q4_K_XL · 21,76 t/s

llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf ^ --mmproj mmproj-F16.gguf --alias qwen3.8-flash-next ^ --host 127.0.0.1 --port 8099 --device Vulkan0 ^ --gpu-layers all --n-cpu-moe 0 --fit off -fa on ^ --load-mode mmap --lazy-mode on ^ --ctx-size 262144 --parallel 1 --kv-unified ^ -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 ^ --ctx-checkpoints 4 --checkpoint-min-step 4096 ^ --jinja --reasoning on --reasoning-format deepseek --reasoning-effort xhigh

Drei Zahlen für denselben Speicher. Der AMD AI MAX 395 hat 128 GiB unified LPDDR5X, keine 128 GB VRAM. Windows sieht 63,6 GiB, die BIOS-Reservierung beträgt 64,4 GiB, Vulkan meldet 98.123 MiB.

Nachprüfbarkeit

Kontrolle ist gut

Logs und Messwerte liegen im öffentlichen Repo und wurden auf den beiden genannten Systemen gemessen. Natürlich können die Zahlen je nach Hardware- und Software-Setup bei dir etwas abweichen.

1

Rohdaten im öffentlichen Repo

Die Serverprotokolle von llama.cpp und die Messtabellen liegen unverändert in evidence/, zusammen rund 3,8 MB, mit Prüfsummen. Jede Modellkarte und jede Tabellenzeile verlinkt genau die Datei, aus der ihre Zahlen stammen.

2

Messgrenzen

Gewertet wird jede Antwort ab 200 Tokens: kürzere erzeugen im Protokoll Ausreißer bis 1 000 000 t/s, ein Token in nahezu null Millisekunden. Perzentile nach Rangplatz, nicht interpoliert.

3

Nachprüfbarkeit

Wer den Zahlen nicht glaubt, lädt das Repo und lässt verify_runs.py laufen. Es rechnet jeden Wert aus dem Rohprotokoll nach und meldet jede Abweichung. Derzeit: null.

Manche Messläufe haben leider nicht alle Zahlen. Der Clair-Obscure-Lauf von Qwen3.6-27B und die drei Cloud-Modelle führen deshalb keine Geschwindigkeit. Die Artefakte gibt es, die Messung nicht. verify_runs.py logs/