Zum Inhalt springen
benchmark.securesight.ai
EN

Lokal gelaufen

DeepSeek-V4-Flash-0731

AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2

Hardware
AMD AI MAX 395 (AMD Halo) · GMKtec EVO-X2Strix Halo · Radeon 8060S · gfx1151
Speicher
128 GiB unified
Aufgaben
Clair Obscure
Quantisierungen
UD-IQ3_XXS

Beschreibung des Modells

Mixture-of-Experts-Modell der DeepSeek-V4-Reihe, veröffentlicht als offizielle Fassung von DeepSeek-V4-Flash unter MIT-Lizenz. Die config.json des Repositorys nennt 43 Schichten, eine Hidden Size von 4096, 256 geroutete Experten und einen geteilten Experten, davon 6 aktive Experten je Token, 64 Attention-Köpfe, ein Vokabular von 129 280 Token sowie max_position_embeddings 1 048 576. Die Gewichte liegen in FP8 vor (Format e4m3, Blockgröße 128 x 128), zusätzlich trägt der Checkpoint ein Modul für spekulatives Dekodieren, das die Modellkarte DSpark nennt und das in der Konfiguration als num_nextn_predict_layers 1 auftaucht. Der technische Bericht zur Vorschaufassung gibt für DeepSeek-V4-Flash 284 Milliarden Parameter bei 13 Milliarden aktiven Parametern und eine hybride Attention aus Compressed Sparse Attention und Heavily Compressed Attention an, während das Hugging-Face-Repository dieser Fassung 304B params ausweist.

Architektur
Mixture of Experts, model_type deepseek_v4
Schichten (num_hidden_layers)
43
Hidden Size
4096
Geroutete Experten
256
Geteilte Experten
1
Aktive Experten je Token
6
Attention-Köpfe
64
Vokabulargröße
129 280

Angaben des Herstellers: Quelle · Modellkarte · Hersteller

Die Zahlen auf einen Blick

Decode, Median

7,02 t/s

98 gewertete Antworten

Decode, p10 bis p90

4,85–9,89 t/s

Antworten ab 200 Tokens werden gewertet; kürzere erzeugen im Protokoll Ausreißer bis über 1 000 000 t/s, weil dort ein einzelnes Token in nahezu null Millisekunden fällt. Median klassisch, Perzentile nach Rangplatz. Beim Prefill gilt diese Schwelle NICHT, dort zählt jede Auswertung.

Spitze

10,83 t/s

einzelne Antwort

Prefill, Median

15,2 t/s

Ausgabe erzeugt

150.800 Token

nur die gewerteten Antworten ab 200 Tokens

Laufzeit

8,4 h

502 Minuten

Selbstkorrekturen

12

Antworten gesamt

152

98 davon gewertet

Eingabe gesamt

7,81 Mio. Token

Kontext aller 152 Anfragen zusammengezählt

davon neu berechnet

254.590 Token

7,55 Mio. lagen im Prompt-Cache

Durch das Modell gelaufen

7,97 Mio. Token

Eingabe und Ausgabe zusammen

Bei einem Anbieter

0,14 USD

DeepSeek-V4-Flash-0731 gehostet, günstigster Tarif

Was dieser Lauf gekostet hätte, wenn DeepSeek-V4-Flash-0731 bei einem Anbieter gelaufen wäre
Anbieter Eingabeje Mio. Ausgabeje Mio. Cacheje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
OpenInference 0,050,16 0,013 0,42 0,14
DeepInfra 0,060,18 0,015 0,50 0,16
Relace 0,070,18 0,016 0,54 0,17
Wafer 0,100,25 0,050 0,82 0,44

Alle Beträge in USD. Die ersten drei Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit denselben Token wie links: 7 808 346 Eingabe über alle Anfragen, davon 254 590 neu berechnet und 7 553 756 aus dem Prompt-Cache, dazu 158 469 Ausgabe. Die Spalte „ohne Cache“ setzt die ganze Eingabe zum Eingabetarif an, die Spalte „mit Cache“ rechnet den zwischengespeicherten Teil zum Cache-Tarif des Anbieters. Anbieter mit Cache-Tarif sind der Regelfall, deshalb ist die rechte Spalte die realistischere. Es sind die Preise für DeepSeek-V4-Flash-0731 selbst, bei Anbietern die genau dieses Modell hosten, nicht die eines fremden Cloud-Modells. Stand 08.09.2026, Listenpreise ohne Mengenrabatt. Lokal kostet der Lauf statt dessen Strom und die Anschaffung der Karte. Preise bei OpenRouter, abgerufen am 2026-09-08.

Was dieser Lauf gekostet hätte, wenn Sonnet 5 mit gleichem Tokenverbrauch gelaufen wäre
Modell Eingabeje Mio. Ausgabeje Mio. Cache schreibenje Mio. Cache lesenje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Sonnet 5 2,0010,00 2,500,20 17,20 3,73

Alle Beträge in USD. Die ersten vier Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit genau den Token dieses Laufs: 7 808 346 Eingabe, davon 254 590 neu und 7 553 756 aus dem Cache, dazu 158 469 Ausgabe. Ohne Cache zum Eingabetarif, mit Cache zahlt der neue Teil den Schreibtarif und der zwischengespeicherte den Lesetarif. Das ist ein Vergleich unter der Annahme gleichen Tokenverbrauchs. Ein anderes Modell löst dieselbe Aufgabe mit anderer Tokenzahl, meist mit weniger; die Zeile sagt also, was diese Token bei Sonnet 5 gekostet hätten, nicht was Sonnet 5 für diese Aufgabe gekostet hätte. Preisliste von Anthropic, abgerufen am 2026-09-08.

llama.cpp-Serverlog · 98 von 152 Antworten ab 200 Tokens. Der Server lief 506,8 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 502,3 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die langen Lücken zwischen Logzeilen sind Rechenblöcke, kein Leerlauf. Die reine Rechenzeit auf der GPU beträgt 500,3 Minuten. · Rohprotokoll

Ergebnisse

Clair Obscur: Expedition 33 — Battle Stage

Öffnet in einer eigenen Ebene

Maus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.

Lädt erst auf Klick · 0,3 MB Übertragung · 1,6 MB entpackt

Prefill über Kontexttiefe

Ein Spitzenwert bei kurzem Kontext sagt wenig darüber, wie sich ein Modell nach Stunden anfühlt.

184470 3,1 K · 65,3 t/s 9,2 K · 43,8 t/s 13,3 K · 36,2 t/s 19,5 K · 29,8 t/s 25,6 K · 32,0 t/s 29,7 K · 25,7 t/s 35,6 K · 22,7 t/s 3,1 K35,6 K t/s

Kontexttiefe in tausend Token · Momentanrate innerhalb eines einzigen durchgehenden Prefills: Aufgabe 136538 dieses Laufs verarbeitete 36 962 Token am Stück. llama.cpp meldet dabei alle 2 048 Token einen Zwischenstand; die Rate ist der Quotient aus Token und Zeit zwischen zwei aufeinanderfolgenden Ständen. 17 Schritte bleiben übrig, Reststücke unter 1 500 Token sind verworfen, weil dort der Aufruf-Overhead misst statt der Tiefe. Von 2 048 auf 36 446 Token fällt die Rate um den Faktor 2,87. Jeder Punkt ist aus dem verlinkten Serverprotokoll nachrechenbar.

llama.cpp Startparameter

Kontext
131.072
KV-Cache
f16 / f16
Micro-Batch
512
Spekulativ
draft-dspark · n_max 3
Build
580e88d
llama-server -m DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf ^
  --alias deepseek-v4-flash --host 127.0.0.1 --port 8100 --device Vulkan0 ^
  --gpu-layers all --n-cpu-moe 0 --fit off -fa on --load-mode mmap ^
  --ctx-size 131072 --parallel 1 --kv-unified ^
  -ctk f16 -ctv f16 -b 2048 -ub 512 ^
  --ctx-checkpoints 4 --checkpoint-min-step 4096 ^
  -md DSpark-draft.gguf --spec-type draft-dspark --spec-draft-n-max 3 ^
  --spec-draft-device Vulkan0 --spec-draft-ngl 99 ^
  --jinja --reasoning on --reasoning-format deepseek --reasoning-effort high

Einordnung

16 / 40

Die Note ist eine persönliche also subjektive Einschätzung.

SpielgefühlLäuft es, und spielt es sich?

Artefakt liegt vor, zwölf Selbstkorrekturen im Protokoll.

PräsentationMenüs, Anzeigen, Grafik, Ton

Keine Aufnahme vorhanden.

CodequalitätTests, Struktur, Selbstkorrekturen

Keine Testdateien.

UmfangWie viel vom Auftrag wurde erfüllt?

24 Dateien, 3 901 Zeilen, der kleinste Umfang im Feld.

Diese Bewertung ist ein Vorschlag und von Kai Bennett noch nicht bestätigt. Codequalität und Umfang stützen sich auf ausgezählte Dateien, Quell- und Testzeilen sowie Reparaturskripte im Belegrepo.

Was schiefging

Es gab zwölf Selbstkorrekturen des Modells.

llama.cpp-Serverlog · 98 von 152 Antworten ab 200 Tokens. Der Server lief 506,8 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 502,3 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die langen Lücken zwischen Logzeilen sind Rechenblöcke, kein Leerlauf. Die reine Rechenzeit auf der GPU beträgt 500,3 Minuten.

Selbst ausprobieren

  1. Gewichte laden · Bezugsquelle
  2. llama-server mit der Startzeile oben starten
  3. Den Endpunkt in VS Code als eigenes Modell eintragen und den Agenten wählen

Auftrag, Agentdateien und Werkzeuge: Agent Test Harness

Zitieren: Kai Felix Bennett, „Nutzbarkeitstest von lokaler KI auf AMD-Hardware", benchmark.securesight.ai, Lauf deepseek-v4-flash-clairobscure-evox2. Messdaten CC-BY-4.0.

Messdaten CC-BY-4.0, Code MIT.