Lokal gelaufen
DeepSeek-V4-Flash-0731
AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2
- Hardware
- AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2Strix Halo · Radeon 8060S · gfx1151
- Speicher
- 128 GiB unified
- Aufgaben
- Clair Obscure
- Quantisierungen
- UD-IQ3_XXS
Beschreibung des Modells
Mixture-of-Experts-Modell der DeepSeek-V4-Reihe, veröffentlicht als offizielle Fassung von DeepSeek-V4-Flash unter MIT-Lizenz. Die config.json des Repositorys nennt 43 Schichten, eine Hidden Size von 4096, 256 geroutete Experten und einen geteilten Experten, davon 6 aktive Experten je Token, 64 Attention-Köpfe, ein Vokabular von 129 280 Token sowie max_position_embeddings 1 048 576. Die Gewichte liegen in FP8 vor (Format e4m3, Blockgröße 128 x 128), zusätzlich trägt der Checkpoint ein Modul für spekulatives Dekodieren, das die Modellkarte DSpark nennt und das in der Konfiguration als num_nextn_predict_layers 1 auftaucht. Der technische Bericht zur Vorschaufassung gibt für DeepSeek-V4-Flash 284 Milliarden Parameter bei 13 Milliarden aktiven Parametern und eine hybride Attention aus Compressed Sparse Attention und Heavily Compressed Attention an, während das Hugging-Face-Repository dieser Fassung 304B params ausweist.
- Architektur
- Mixture of Experts, model_type deepseek_v4
- Schichten (num_hidden_layers)
- 43
- Hidden Size
- 4096
- Geroutete Experten
- 256
- Geteilte Experten
- 1
- Aktive Experten je Token
- 6
- Attention-Köpfe
- 64
- Vokabulargröße
- 129 280
Angaben des Herstellers: Quelle · Modellkarte · Hersteller
Die Zahlen auf einen Blick
Decode, Median
7,02 t/s
98 gewertete Antworten
Decode, p10 bis p90
4,85–9,89 t/s
Antworten ab 200 Tokens werden gewertet; kürzere erzeugen im Protokoll Ausreißer bis über 1 000 000 t/s, weil dort ein einzelnes Token in nahezu null Millisekunden fällt. Median klassisch, Perzentile nach Rangplatz. Beim Prefill gilt diese Schwelle NICHT, dort zählt jede Auswertung.
Spitze
10,83 t/s
einzelne Antwort
Prefill, Median
15,2 t/s
Ausgabe erzeugt
150.800 Token
nur die gewerteten Antworten ab 200 Tokens
Laufzeit
8,4 h
502 Minuten
Selbstkorrekturen
12
Antworten gesamt
152
98 davon gewertet
Eingabe gesamt
7,81 Mio. Token
Kontext aller 152 Anfragen zusammengezählt
davon neu berechnet
254.590 Token
7,55 Mio. lagen im Prompt-Cache
Durch das Modell gelaufen
7,97 Mio. Token
Eingabe und Ausgabe zusammen
Bei einem Anbieter
0,14 USD
DeepSeek-V4-Flash-0731 gehostet, günstigster Tarif
Was dieser Lauf gekostet hätte, wenn DeepSeek-V4-Flash-0731 bei einem Anbieter gelaufen wäre
| Anbieter | Eingabeje Mio. | Ausgabeje Mio. | Cacheje Mio. | Dieser Laufohne Cache | Dieser Laufmit Cache |
|---|---|---|---|---|---|
| OpenInference | 0,05 | 0,16 | 0,013 | 0,42 | 0,14 |
| DeepInfra | 0,06 | 0,18 | 0,015 | 0,50 | 0,16 |
| Relace | 0,07 | 0,18 | 0,016 | 0,54 | 0,17 |
| Wafer | 0,10 | 0,25 | 0,050 | 0,82 | 0,44 |
Alle Beträge in USD. Die ersten drei Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit denselben Token wie links: 7 808 346 Eingabe über alle Anfragen, davon 254 590 neu berechnet und 7 553 756 aus dem Prompt-Cache, dazu 158 469 Ausgabe. Die Spalte „ohne Cache“ setzt die ganze Eingabe zum Eingabetarif an, die Spalte „mit Cache“ rechnet den zwischengespeicherten Teil zum Cache-Tarif des Anbieters. Anbieter mit Cache-Tarif sind der Regelfall, deshalb ist die rechte Spalte die realistischere. Es sind die Preise für DeepSeek-V4-Flash-0731 selbst, bei Anbietern die genau dieses Modell hosten, nicht die eines fremden Cloud-Modells. Stand 08.09.2026, Listenpreise ohne Mengenrabatt. Lokal kostet der Lauf statt dessen Strom und die Anschaffung der Karte. Preise bei OpenRouter, abgerufen am 2026-09-08.
Was dieser Lauf gekostet hätte, wenn Sonnet 5 mit gleichem Tokenverbrauch gelaufen wäre
| Modell | Eingabeje Mio. | Ausgabeje Mio. | Cache schreibenje Mio. | Cache lesenje Mio. | Dieser Laufohne Cache | Dieser Laufmit Cache |
|---|---|---|---|---|---|---|
| Sonnet 5 | 2,00 | 10,00 | 2,50 | 0,20 | 17,20 | 3,73 |
Alle Beträge in USD. Die ersten vier Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit genau den Token dieses Laufs: 7 808 346 Eingabe, davon 254 590 neu und 7 553 756 aus dem Cache, dazu 158 469 Ausgabe. Ohne Cache zum Eingabetarif, mit Cache zahlt der neue Teil den Schreibtarif und der zwischengespeicherte den Lesetarif. Das ist ein Vergleich unter der Annahme gleichen Tokenverbrauchs. Ein anderes Modell löst dieselbe Aufgabe mit anderer Tokenzahl, meist mit weniger; die Zeile sagt also, was diese Token bei Sonnet 5 gekostet hätten, nicht was Sonnet 5 für diese Aufgabe gekostet hätte. Preisliste von Anthropic, abgerufen am 2026-09-08.
llama.cpp-Serverlog · 98 von 152 Antworten ab 200 Tokens. Der Server lief 506,8 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 502,3 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die langen Lücken zwischen Logzeilen sind Rechenblöcke, kein Leerlauf. Die reine Rechenzeit auf der GPU beträgt 500,3 Minuten. · Rohprotokoll
Ergebnisse
Clair Obscur: Expedition 33 — Battle Stage
Öffnet in einer eigenen EbeneMaus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.
Lädt erst auf Klick · 0,3 MB Übertragung · 1,6 MB entpackt
Prefill über Kontexttiefe
Ein Spitzenwert bei kurzem Kontext sagt wenig darüber, wie sich ein Modell nach Stunden anfühlt.
Kontexttiefe in tausend Token · Momentanrate innerhalb eines einzigen durchgehenden Prefills: Aufgabe 136538 dieses Laufs verarbeitete 36 962 Token am Stück. llama.cpp meldet dabei alle 2 048 Token einen Zwischenstand; die Rate ist der Quotient aus Token und Zeit zwischen zwei aufeinanderfolgenden Ständen. 17 Schritte bleiben übrig, Reststücke unter 1 500 Token sind verworfen, weil dort der Aufruf-Overhead misst statt der Tiefe. Von 2 048 auf 36 446 Token fällt die Rate um den Faktor 2,87. Jeder Punkt ist aus dem verlinkten Serverprotokoll nachrechenbar.
llama.cpp Startparameter
- Kontext
- 131.072
- KV-Cache
- f16 / f16
- Micro-Batch
- 512
- Spekulativ
- draft-dspark · n_max 3
- Build
- 580e88d
llama-server -m DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf ^ --alias deepseek-v4-flash --host 127.0.0.1 --port 8100 --device Vulkan0 ^ --gpu-layers all --n-cpu-moe 0 --fit off -fa on --load-mode mmap ^ --ctx-size 131072 --parallel 1 --kv-unified ^ -ctk f16 -ctv f16 -b 2048 -ub 512 ^ --ctx-checkpoints 4 --checkpoint-min-step 4096 ^ -md DSpark-draft.gguf --spec-type draft-dspark --spec-draft-n-max 3 ^ --spec-draft-device Vulkan0 --spec-draft-ngl 99 ^ --jinja --reasoning on --reasoning-format deepseek --reasoning-effort high
Einordnung
16 / 40
Die Note ist eine persönliche also subjektive Einschätzung.
SpielgefühlLäuft es, und spielt es sich?
4/10
Artefakt liegt vor, zwölf Selbstkorrekturen im Protokoll.
PräsentationMenüs, Anzeigen, Grafik, Ton
4/10
Keine Aufnahme vorhanden.
CodequalitätTests, Struktur, Selbstkorrekturen
4/10
Keine Testdateien.
UmfangWie viel vom Auftrag wurde erfüllt?
4/10
24 Dateien, 3 901 Zeilen, der kleinste Umfang im Feld.
Diese Bewertung ist ein Vorschlag und von Kai Bennett noch nicht bestätigt. Codequalität und Umfang stützen sich auf ausgezählte Dateien, Quell- und Testzeilen sowie Reparaturskripte im Belegrepo.
Wie sehen Sie das? Die Note oben ist eine persönliche Einschätzung. Hier zählt Ihre, unabhängig davon.
Was schiefging
Es gab zwölf Selbstkorrekturen des Modells.
llama.cpp-Serverlog · 98 von 152 Antworten ab 200 Tokens. Der Server lief 506,8 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 502,3 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die langen Lücken zwischen Logzeilen sind Rechenblöcke, kein Leerlauf. Die reine Rechenzeit auf der GPU beträgt 500,3 Minuten.
Quellen
- Modellgewichtehuggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
- Modellkartehuggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- Herstellerseitedeepseek.com
- Messdaten-Repogithub.com/KaiFelixBennett/local-ai-amd-benchmark
- Rohprotokoll dieses Laufsgithub.com/KaiFelixBennett/local-ai-amd-benchmark/blob/main/evidence/logs/deepseek-v4-flash-clairobscur-halo.log
- Quelltext · Clair Obscure · UD-IQ3_XXS · Reasoning highgithub.com/KaiFelixBennett/local-ai-amd-benchmark/tree/main/benchmarks/deepseek-v4-flash/clairobscure
Selbst ausprobieren
- Gewichte laden · Bezugsquelle
- llama-server mit der Startzeile oben starten
- Den Endpunkt in VS Code als eigenes Modell eintragen und den Agenten wählen
Auftrag, Agentdateien und Werkzeuge: Agent Test Harness
Zitieren: Kai Felix Bennett, „Nutzbarkeitstest von lokaler KI auf AMD-Hardware", benchmark.securesight.ai, Lauf deepseek-v4-flash-clairobscure-evox2. Messdaten CC-BY-4.0.
Messdaten CC-BY-4.0, Code MIT.