Zum Inhalt springen
benchmark.securesight.ai
EN

Lokal gelaufen

Qwen3.8-27B

Radeon AI PRO R9700 · 3 Läufe

Hardware
Radeon AI PRO R9700gfx1201 · RDNA4
Speicher
32 GB dediziert
Aufgaben
Moorhuhn, Clair Obscure, Bilderkennung
Quantisierungen
UD-Q4_K_XL, UD-Q6_K_M
Kai Bennett

Persönliche Meinung

Kai Bennett

Es ist für mich das erste Modell, das ich auf meiner Hardware auch ernsthaft für Coding einsetzen würde. Klar, der Vorgänger, das Qwen 3.6 27b, war auch schon stark, aber aus meiner Sicht wurde hier nochmal in Sachen Qualität, agentischem Coding und der Fähigkeit die eigenen Ergebnisse zu reviewen, eine ordentliche Schippe draufgelegt. Für Setups zwischen 24 und 128 GB VRAM ist das für mich im September 2026 das beste Modell.

Spannend finde ich, dass es nun auch unzensierte Varianten davon gibt, bei denen die Guardrails komplett deaktiviert sind, das hat natürlich Vor- und Nachteile zugleich.

Beschreibung des Modells

Dichtes Modell mit 27 Milliarden Parametern und 262 144 Token nativem Kontext, laut Modellkarte erweiterbar auf 1 000 000 Token. Die Karte nennt 64 Schichten mit dem Aufbau 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)), die config.json setzt full_attention_interval auf 4. Als Typ gibt die Karte ein kausales Sprachmodell mit Vision-Encoder an, für den die config.json 27 Schichten angibt (Feld vision_config.depth). Die Karte nennt außerdem Multi-Token-Prediction im Training, die Lizenz ist Apache 2.0.

Architektur
Dicht (Modellkarte: „dense model“)
Parameter
27B
Schichten
64
Schichtaufbau
16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
Kontext nativ
262 144 Token
Kontext erweiterbar
bis 1 000 000 Token
Lizenz
Apache 2.0

Angaben des Herstellers: Quelle · Modellkarte · Hersteller

Lauf: Moorhuhn · UD-Q4_K_XL · Reasoning xhigh · 31. August 2026

Die Zahlen auf einen Blick

Decode, Median

33,69 t/s

82 gewertete Antworten

Decode, p10 bis p90

27,83–45,34 t/s

Antworten ab 200 Tokens werden gewertet; kürzere erzeugen im Protokoll Ausreißer bis über 1 000 000 t/s, weil dort ein einzelnes Token in nahezu null Millisekunden fällt. Median klassisch, Perzentile nach Rangplatz. Beim Prefill gilt diese Schwelle NICHT, dort zählt jede Auswertung.

Spitze

84,92 t/s

einzelne Antwort

Prefill, Median

234,9 t/s

Ausgabe erzeugt

332.405 Token

nur die gewerteten Antworten ab 200 Tokens

Laufzeit

9,0 h

540 Minuten

Selbstkorrekturen

4

Antworten gesamt

108

82 davon gewertet

Eingabe gesamt

8,04 Mio. Token

Kontext aller 108 Anfragen zusammengezählt

davon neu berechnet

503.681 Token

7,54 Mio. lagen im Prompt-Cache

Durch das Modell gelaufen

8,38 Mio. Token

Eingabe und Ausgabe zusammen

Bei einem Anbieter

1,24 USD

Qwen3.8-27B gehostet, günstigster Tarif

Was dieser Lauf gekostet hätte, wenn Qwen3.8-27B bei einem Anbieter gelaufen wäre
Anbieter Eingabeje Mio. Ausgabeje Mio. Cacheje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Darkbloom 0,152,00 · 1,88 ·
Parasail 0,242,20 0,050 2,67 1,24
Chutes 0,322,50 0,032 3,41 1,24
Alibaba Cloud 0,422,55 0,085 4,28 1,71

Alle Beträge in USD. Die ersten drei Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit denselben Token wie links: 8 043 931 Eingabe über alle Anfragen, davon 503 681 neu berechnet und 7 540 250 aus dem Prompt-Cache, dazu 336 107 Ausgabe. Die Spalte „ohne Cache“ setzt die ganze Eingabe zum Eingabetarif an, die Spalte „mit Cache“ rechnet den zwischengespeicherten Teil zum Cache-Tarif des Anbieters. Anbieter mit Cache-Tarif sind der Regelfall, deshalb ist die rechte Spalte die realistischere. Es sind die Preise für Qwen3.8-27B selbst, bei Anbietern die genau dieses Modell hosten, nicht die eines fremden Cloud-Modells. Stand 07.09.2026, Listenpreise ohne Mengenrabatt. Lokal kostet der Lauf statt dessen Strom und die Anschaffung der Karte. Preise bei OpenRouter, abgerufen am 2026-09-07.

Was dieser Lauf gekostet hätte, wenn Sonnet 5 mit gleichem Tokenverbrauch gelaufen wäre
Modell Eingabeje Mio. Ausgabeje Mio. Cache schreibenje Mio. Cache lesenje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Sonnet 5 2,0010,00 2,500,20 19,45 6,13

Alle Beträge in USD. Die ersten vier Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit genau den Token dieses Laufs: 8 043 931 Eingabe, davon 503 681 neu und 7 540 250 aus dem Cache, dazu 336 107 Ausgabe. Ohne Cache zum Eingabetarif, mit Cache zahlt der neue Teil den Schreibtarif und der zwischengespeicherte den Lesetarif. Das ist ein Vergleich unter der Annahme gleichen Tokenverbrauchs. Ein anderes Modell löst dieselbe Aufgabe mit anderer Tokenzahl, meist mit weniger; die Zeile sagt also, was diese Token bei Sonnet 5 gekostet hätten, nicht was Sonnet 5 für diese Aufgabe gekostet hätte. Preisliste von Anthropic, abgerufen am 2026-09-08.

Thinking Token: Sie stecken in den Ausgabetoken, lassen sich aber nicht herausrechnen. llama.cpp weist beim Start selbst darauf hin: „chat template supports preserving reasoning, consider enabling it via --reasoning-preserve“. Die Option war nicht gesetzt, deshalb trennt das Protokoll Denken und Antwort nicht.

llama.cpp-Serverlog · 82 Antworten ab 200 Tokens. Laufzeit rund 9 h in zwei Sitzungen (31.08. ab 15:58, 01.09. bis 09:50), am Ende manuell gestoppt. Das Protokoll deckt nur die erste Sitzung ab (3,2 h); danach lief der Server neu. · Rohprotokoll

Ergebnisse

Moorland Mayhem — Featherstorm: Classic Hunt auf Nebelmoor, 22 Sekunden ungeschnitten aus einer 120-Sekunden-Runde.

Moorland Mayhem — Featherstorm

Öffnet in einer eigenen Ebene

Zielen und schießen mit Maus oder Finger, R lädt nach. Der Start liegt hinter Modus- und Kartenauswahl, nicht direkt hinter dem ersten Knopf. Braucht WebGL. Der erste Klick nach dem Laden wird verschluckt, der zweite wirkt.

Eingriff der Website: Der Build liest localStorage ohne Absicherung. Im Sandkasten wirft das, und der Ladebildschirm bliebe stehen. Die eingebettete Fassung bekommt deshalb einen Ersatzspeicher, der nur im Arbeitsspeicher lebt; ein Spielstand überlebt kein Neuladen. Das Original im Repo ist unverändert.

Lädt erst auf Klick · 0,3 MB Übertragung · 1,3 MB entpackt

Prefill über Kontexttiefe

Ein Spitzenwert bei kurzem Kontext sagt wenig darüber, wie sich ein Modell nach Stunden anfühlt.

171282393 35 K · 371,4 t/s 65 K · 280,3 t/s 95 K · 252,7 t/s 125 K · 192,3 t/s 35 K125 K t/s

Kontexttiefe in tausend Token · Median je 30K-Band aus dem Serverlog. Gewertet werden nur Auswertungen ab 1 000 Token, weil die Rate sonst am Aufruf-Overhead hängt statt an der Tiefe: unter 300 Token liegt der Median bei 158 t/s, ab 5 000 Token bei 333. Der Kontextstand stammt aus pos_max, nicht aus der Zahl der ausgewerteten Token, denn unter Prompt-Caching zählt „prompt eval time“ nur das Neue. 7 bis 17 Messungen je Band, tiefster erreichter Stand 140 016 Token. Unter 20K gibt es keine Messung, so lang ist schon der Auftrag.

llama.cpp Startparameter

Kontext
262.144
KV-Cache
q8_0 / q8_0
Micro-Batch
288
Spekulativ
draft-mtp + ngram-mod 24/48/64 · n_max 2
Build
b10717
llama-server -m Qwen3.8-27B-UD-Q4_K_XL.gguf ^
  --load-mode none --mmproj mmproj-F16.gguf --image-min-tokens 1024 ^
  --alias Qwen3.8-27B -dev Vulkan0 --host 127.0.0.1 --port 8080 ^
  -c 262144 -ngl 99 -fa on --fit off -ot "token_embd\.weight=Vulkan0" ^
  -ctk q8_0 -ctv q8_0 -b 2048 -ub 288 ^
  --parallel 1 --kv-unified ^
  --ctx-checkpoints 4 --checkpoint-min-step 16384 --cache-ram 0 ^
  --spec-type draft-mtp,ngram-mod --spec-draft-n-max 2 ^
  --spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 48 --spec-ngram-mod-n-max 64 ^
  --spec-draft-device Vulkan0 --spec-draft-ngl 99 ^
  --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 ^
  --presence-penalty 0.0 --repeat-penalty 1.0 ^
  --jinja --reasoning on --reasoning-effort xhigh --reasoning-format deepseek --reasoning-budget -1

Einordnung

31 / 40

Die Note ist eine persönliche also subjektive Einschätzung.

SpielgefühlLäuft es, und spielt es sich?

Es gibt ein gutes Spielgefühl im Moorhuhn Test und ist abwechslungreich, ich hab tatsächlich auch Spaß beim spielen auch wenn es ein paar kleinere Fehler gibt.

PräsentationMenüs, Anzeigen, Grafik, Ton

Hauptmenü mit elf Einträgen, HUD, Fortschrittsmenü, die Anleitung ist etwas bedürftig, auch muss ich 2x auf Starten klicken damit es losgeht, es sind noch kleinere Bugs vorhanden, insgesamt aber schon beeindruckend für einen Single Shot.

CodequalitätTests, Struktur, Selbstkorrekturen

11 Testdateien mit 1 257 Testzeilen, keine Reparaturskripte. Vorgegebene Struktur wurde umgesetzt.

UmfangWie viel vom Auftrag wurde erfüllt?

42 Dateien, 10 838 Zeilen; Spielmodi, Menüs und Statistiken vollständig.

Was schiefging

Es gab vier Selbstkorrekturen des Modells.

llama.cpp-Serverlog · 82 Antworten ab 200 Tokens. Laufzeit rund 9 h in zwei Sitzungen (31.08. ab 15:58, 01.09. bis 09:50), am Ende manuell gestoppt. Das Protokoll deckt nur die erste Sitzung ab (3,2 h); danach lief der Server neu.

Lauf: Moorhuhn · UD-Q4_K_XL · Reasoning medium · 01. September 2026

Die Zahlen auf einen Blick

Kein Serverprotokoll, deshalb keine Geschwindigkeit. Der Ablauf stammt aus dem Chatverlauf und dem ausgelieferten Quelltext, die Laufzeit aus der Anzeige in VS Code.

Laufzeit

6,5 h

388 Minuten

Selbstkorrekturen

2

Zweiter Durchgang desselben Modells mit derselben Startzeile, nur mit --reasoning-effort medium statt xhigh. Laufzeit 6 h 28 min, von Kai Bennett aus der Anzeige in VS Code abgelesen. Ein Auftrag und ein Klick auf „Continue to iterate“, sonst kein Eingriff. Der Chatverlauf zählt 95 Terminalbefehle, 110 abgeschlossene Werkzeugaufrufe und 17 Test-, Build- oder Lint-Läufe. Eine Decode-Geschwindigkeit gibt es nicht: dafür bräuchte es das Serverprotokoll, und das liegt für diesen Lauf nicht vor.

Ergebnisse

Moorland Mayhem — Featherstorm

Öffnet in einer eigenen Ebene

Zielen und schießen mit Maus oder Finger. Braucht WebGL.

Lädt erst auf Klick · — MB Übertragung · — MB entpackt

llama.cpp Startparameter

Kontext
262.144
KV-Cache
q8_0 / q8_0
Micro-Batch
288
Spekulativ
draft-mtp + ngram-mod 24/48/64 · n_max 2
Build
b10717
llama-server -m Qwen3.8-27B-UD-Q4_K_XL.gguf ^
  --load-mode none --mmproj mmproj-F16.gguf --image-min-tokens 1024 ^
  --alias Qwen3.8-27B -dev Vulkan0 --host 127.0.0.1 --port 8080 ^
  -c 262144 -ngl 99 -fa on --fit off -ot "token_embd\.weight=Vulkan0" ^
  -ctk q8_0 -ctv q8_0 -b 2048 -ub 288 ^
  --parallel 1 --kv-unified ^
  --ctx-checkpoints 4 --checkpoint-min-step 16384 --cache-ram 0 ^
  --spec-type draft-mtp,ngram-mod --spec-draft-n-max 2 ^
  --spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 48 --spec-ngram-mod-n-max 64 ^
  --spec-draft-device Vulkan0 --spec-draft-ngl 99 ^
  --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 ^
  --presence-penalty 0.0 --repeat-penalty 1.0 ^
  --jinja --reasoning on --reasoning-effort medium --reasoning-format deepseek --reasoning-budget -1

Einordnung

26 / 40

Die Note ist eine persönliche also subjektive Einschätzung.

SpielgefühlLäuft es, und spielt es sich?

Startet und ist spielbar, aber das Hauptmenü trägt fünf statt elf Einträge.

PräsentationMenüs, Anzeigen, Grafik, Ton

Keine Aufnahme vorhanden, beurteilt am ausgelieferten Build.

CodequalitätTests, Struktur, Selbstkorrekturen

10 Testdateien mit 604 Testzeilen, kein Reparaturskript.

UmfangWie viel vom Auftrag wurde erfüllt?

44 Dateien, 8 530 Zeilen; gegenüber dem xhigh-Lauf fehlen Modi.

Diese Bewertung ist ein Vorschlag und von Kai Bennett noch nicht bestätigt. Codequalität und Umfang stützen sich auf ausgezählte Dateien, Quell- und Testzeilen sowie Reparaturskripte im Belegrepo.

Was schiefging

Es gab zwei Selbstkorrekturen des Modells.

Zweiter Durchgang desselben Modells mit derselben Startzeile, nur mit --reasoning-effort medium statt xhigh. Laufzeit 6 h 28 min, von Kai Bennett aus der Anzeige in VS Code abgelesen. Ein Auftrag und ein Klick auf „Continue to iterate“, sonst kein Eingriff. Der Chatverlauf zählt 95 Terminalbefehle, 110 abgeschlossene Werkzeugaufrufe und 17 Test-, Build- oder Lint-Läufe. Eine Decode-Geschwindigkeit gibt es nicht: dafür bräuchte es das Serverprotokoll, und das liegt für diesen Lauf nicht vor.

Lauf: Clair Obscure · UD-Q6_K_M · Reasoning an, ohne Begrenzung · 24. August 2026

Die Zahlen auf einen Blick

Decode, Median

26,30 t/s

30 gewertete Antworten

Decode, p10 bis p90

15,55–34,22 t/s

Antworten ab 200 Tokens werden gewertet; kürzere erzeugen im Protokoll Ausreißer bis über 1 000 000 t/s, weil dort ein einzelnes Token in nahezu null Millisekunden fällt. Median klassisch, Perzentile nach Rangplatz. Beim Prefill gilt diese Schwelle NICHT, dort zählt jede Auswertung.

Spitze

42,39 t/s

einzelne Antwort

Prefill, Median

159,4 t/s

Ausgabe erzeugt

118.919 Token

nur die gewerteten Antworten ab 200 Tokens

Laufzeit

1,9 h

115 Minuten

Selbstkorrekturen

6

Antworten gesamt

35

30 davon gewertet

Eingabe gesamt

3,24 Mio. Token

Kontext aller 35 Anfragen zusammengezählt

davon neu berechnet

293.109 Token

2,95 Mio. lagen im Prompt-Cache

Durch das Modell gelaufen

3,36 Mio. Token

Eingabe und Ausgabe zusammen

Bei einem Anbieter

0,48 USD

Qwen3.8-27B gehostet, günstigster Tarif

Was dieser Lauf gekostet hätte, wenn Qwen3.8-27B bei einem Anbieter gelaufen wäre
Anbieter Eingabeje Mio. Ausgabeje Mio. Cacheje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Darkbloom 0,152,00 · 0,73 ·
Parasail 0,242,20 0,050 1,04 0,48
Chutes 0,322,50 0,032 1,34 0,49
Alibaba Cloud 0,422,55 0,085 1,68 0,68

Alle Beträge in USD. Die ersten drei Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit denselben Token wie links: 3 240 306 Eingabe über alle Anfragen, davon 293 109 neu berechnet und 2 947 197 aus dem Prompt-Cache, dazu 119 627 Ausgabe. Die Spalte „ohne Cache“ setzt die ganze Eingabe zum Eingabetarif an, die Spalte „mit Cache“ rechnet den zwischengespeicherten Teil zum Cache-Tarif des Anbieters. Anbieter mit Cache-Tarif sind der Regelfall, deshalb ist die rechte Spalte die realistischere. Es sind die Preise für Qwen3.8-27B selbst, bei Anbietern die genau dieses Modell hosten, nicht die eines fremden Cloud-Modells. Stand 07.09.2026, Listenpreise ohne Mengenrabatt. Lokal kostet der Lauf statt dessen Strom und die Anschaffung der Karte. Preise bei OpenRouter, abgerufen am 2026-09-07.

Was dieser Lauf gekostet hätte, wenn Sonnet 5 mit gleichem Tokenverbrauch gelaufen wäre
Modell Eingabeje Mio. Ausgabeje Mio. Cache schreibenje Mio. Cache lesenje Mio. Dieser Laufohne Cache Dieser Laufmit Cache
Sonnet 5 2,0010,00 2,500,20 7,68 2,52

Alle Beträge in USD. Die ersten vier Spalten sind Tarife je Million Token, die letzten beiden die Summe für diesen Lauf. Gerechnet mit genau den Token dieses Laufs: 3 240 306 Eingabe, davon 293 109 neu und 2 947 197 aus dem Cache, dazu 119 627 Ausgabe. Ohne Cache zum Eingabetarif, mit Cache zahlt der neue Teil den Schreibtarif und der zwischengespeicherte den Lesetarif. Das ist ein Vergleich unter der Annahme gleichen Tokenverbrauchs. Ein anderes Modell löst dieselbe Aufgabe mit anderer Tokenzahl, meist mit weniger; die Zeile sagt also, was diese Token bei Sonnet 5 gekostet hätten, nicht was Sonnet 5 für diese Aufgabe gekostet hätte. Preisliste von Anthropic, abgerufen am 2026-09-08.

llama.cpp-Serverlog · 30 von 35 Antworten ab 200 Tokens · Lauf vom 28.08.2026. Der Server lief 115,8 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 114,9 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die reine Rechenzeit auf der GPU beträgt davon 114,5 Minuten, davon 88,8 Minuten Erzeugung. · Rohprotokoll

Ergebnisse

Clair Obscure — Expedition 33 (Reactive Combat Study)

Öffnet in einer eigenen Ebene

Maus und Tastatur. Angriffe des Gegners werden angekündigt, Parieren und Ausweichen laufen in Echtzeit. Braucht WebGL.

Lädt erst auf Klick · 0,4 MB Übertragung · 1,9 MB entpackt

Prefill über Kontexttiefe

Ein Spitzenwert bei kurzem Kontext sagt wenig darüber, wie sich ein Modell nach Stunden anfühlt.

72308544 8 K · 498,3 t/s 16 K · 423,1 t/s 34 K · 323,0 t/s 67 K · 223,3 t/s 100 K · 172,4 t/s 132 K · 139,6 t/s 164 K · 118,0 t/s 8 K164 K t/s

Kontexttiefe in tausend Token · Momentanrate innerhalb eines einzigen durchgehenden Prefills: Task 0 dieses Laufs verarbeitete 180 396 Token am Stück. llama.cpp meldet dabei alle 2 048 Token einen Zwischenstand; die Rate ist der Quotient aus Token und Zeit zwischen zwei aufeinanderfolgenden Ständen. 92 Stützstellen liegen vor, gezeigt sind sieben davon. Weil alle aus demselben Prefill stammen, ist die Kurve frei von Unterschieden zwischen Anfragen. Von 8 K auf 164 K fällt die Rate um den Faktor 4,2. Jeder Punkt ist aus dem verlinkten Serverprotokoll nachrechenbar.

llama.cpp Startparameter

Kontext
262.144
KV-Cache
q8_0 / turbo4
Micro-Batch
128
Spekulativ
draft-mtp + ngram-mod · Annahme 0,553
Build
bd9bd1b
llama-server -m Qwen3.8-27B-UD-Q6_K_M.gguf ^
  --load-mode none --mmproj mmproj-F16.gguf --image-min-tokens 1024 ^
  -dev Vulkan0 --host 127.0.0.1 --port 8080 ^
  -c 262144 -ngl 99 -fa on --fit off -ot "token_embd\.weight=Vulkan0" ^
  -ctk q8_0 -ctv turbo4 -b 2048 -ub 128 ^
  --parallel 1 --kv-unified ^
  --ctx-checkpoints 4 --checkpoint-min-step 16384 --cache-ram 0 ^
  --spec-type draft-mtp,ngram-mod --spec-draft-n-max 2 ^
  --spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 48 --spec-ngram-mod-n-max 64 ^
  --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 ^
  --jinja --reasoning on --reasoning-format deepseek --reasoning-budget -1

Einordnung

28 / 40

Die Note ist eine persönliche also subjektive Einschätzung.

SpielgefühlLäuft es, und spielt es sich?

Im Browser spielbar; Angriffe werden angekündigt, Parieren und Ausweichen laufen in Echtzeit.

PräsentationMenüs, Anzeigen, Grafik, Ton

Aufnahme vorhanden, Kampf-HUD vollständig.

CodequalitätTests, Struktur, Selbstkorrekturen

Keine Testdateien; sechs protokollierte Selbstkorrekturen.

UmfangWie viel vom Auftrag wurde erfüllt?

36 Dateien, 11 115 Zeilen, der umfangreichste Clair-Obscure-Lauf auf lokaler Hardware.

Diese Bewertung ist ein Vorschlag und von Kai Bennett noch nicht bestätigt. Codequalität und Umfang stützen sich auf ausgezählte Dateien, Quell- und Testzeilen sowie Reparaturskripte im Belegrepo.

Was schiefging

Es gab sechs Selbstkorrekturen des Modells.

llama.cpp-Serverlog · 30 von 35 Antworten ab 200 Tokens · Lauf vom 28.08.2026. Der Server lief 115,8 Minuten am Stück. Von der ersten Aufgabe bis zum Ende der letzten sind es 114,9 Minuten, ohne eine einzige Pause über 60 Sekunden dazwischen. Die reine Rechenzeit auf der GPU beträgt davon 114,5 Minuten, davon 88,8 Minuten Erzeugung.

Bilderkennung

Eigener Testlauf mit demselben Modell auf derselben Maschine, Teil eines anderen Laufs. Die Zeit ist aus der VS Code Chatanzeige notiert.

Werte ablesen

44 von 50

Dashboard, 50 prüfbare Angaben

Preisschilder

2 von 4

vollständig richtig gelesen

Erfundene Schilder

4

1 davon als sicher behauptet

Fallen bestanden

2 von 4

Stellen, die vom Muster abweichen

Vorläufig: der Lösungsschlüssel für die Preisschilder ist noch nicht vollständig gesichert.

Aufgabe 1 · Werte ablesen

Das Prüfbild, ein eigenes Dashboard
Das Prüfbild. Screenshot von securesight.ai
10203040506070`22`24`25`26NOWIntelligenz-IndexGPT-4GPT-4oClaude 3.5 SonnetOpus 4.6GPT-5.5Claude Fable 5Gemma 3 27BGemma 4 12BGemma 4 31B ★Qwen3-Next 80B (reasoning)Qwen3.5 39BQwen3.6 27B ★Ministral 3 14BMistral Small 4Proprietäre FlaggschiffeQwen openGemma openMistral
Was das Modell daraus als SVG nachgezeichnet hat.

Was das Modell aus der Tooltip-Tabelle gelesen hat

Claude Opus 4.5Qwen3.6 27B
Intelligence Index40.837.1
GPQA Diamond8784
Humanity's Last Exam2922
Terminal-Bench 2.05061

Und aus den Kennzahlkacheln

  • QWEN3.6 27B · OPEN 37.1 · AA Intelligence Index — Open-Weight, kein API-Key, läuft auf ihrer eigenen GPU.
  • VS. OPUS 4.5 (40,7) 91% · des Opus-4.5-Niveaus im Gesamtindex. Bei Coding-Benchmarks: gleichauf.
  • PROPRIETÄRE SPIEZE · HEUTE 59.9 · Das Rechenzentrum klettert weiter — doch der Abstand schrumpft jedes Quartal.

Aufgabe 2 · Komplexe Schrifterkennung

Geprüft wird das Lesen von winzigen, schräg stehenden, teils verdeckten Schriften in einem Foto mit über vierzig Objekten, dazu zwei Währungszeichen, die sich bei starker Drehung kaum unterscheiden. Zum Test werden die Preisschilder verwendet.

Das zweite Prüfbild, ein Messestand
Eingezeichnet ist, wo das Modell die Schilder verortet hat, und der Ausschnitt, in dem gewertet wird. Die Ziffern entsprechen der Tabelle daneben.

Was das Modell gelesen hat

Was das Modell dort las £ Reihenfolgesicher
1 REDHOOD ARKHAM 80 65 gbp zuerst ja
2 JOKER 50 40 gbp zuerst nein
3 ohne Namen 45 35 gbp zuerst ja
4 REDHOOD (BATTL) DARK RED 80 65 gbp zuerst nein
5 BANE nicht lesbar nicht lesbar · nein
6 HULK nicht lesbar nicht lesbar · nein
7 BATMAN nicht lesbar nicht lesbar · nein

Das Modell zählte 7 Schilder im Wertungsbereich. Der Lösungsschlüssel steht hier bewusst nicht daneben, sonst könnte ein späteres Modell ihn von dieser Seite ablesen.

Das Modell über die schwierigste Stelle: „Der dicht beieinander liegende Datenpunkt-Cluster im rechten Diagrammbereich (Qwen/Gemma/Mistral-Labels überlappen) und die kleinen Währungssymbole auf den schräg stehenden Preisschildern in Bild B (€ vs. £ kaum unterscheidbar).“

Wo sich das Modell selbst unsicher war (9 Stellen)
  • Bild A: zweiter X-Achsen-Tick — ich lese '24', nicht ausschließen, dass es '23 ist
  • Bild A: Y-Achsenlabel hinter 'INTELLIGENZ-INDEX (…)' nicht vollständig lesbar
  • Bild A: Kachel 2, Klammerwert liest sich wie '(40,7)', passt aber nicht zu '40.8' im Tooltip — möglicher Lesefehler
  • Bild A: Fußzeile des Tooltips nur teilweise lesbar
  • Bild A: grauer Legendeneintrag rechts ('Claude+open'?) unscharf
  • Bild B: JOKER-Schild — zweites Währungssymbol (£ oder €?)
  • Bild B: REDHOOD (BATTL) DARK RED — zweites Währungssymbol unsicher
  • Bild B: Namen BANE, HULK, BATMAN sind Vermutungen; dazugehörige Preise nicht lesbar (null statt Raten)
  • Bild B: ob das rote Klebeschild am orangefarbenen Helm (ca. y 890–955) noch in den Wertungsbereich fällt, war grenzwertig

Diese Liste hat das Modell selbst geschrieben, nicht der Auswerter. Sie zählt in die Wertung: ein eingestandenes „nicht lesbar“ kostet einen Punkt, eine erfundene Angabe kostet mehr.

Die vollständige Antwort des Modells als JSON · Die Auswertung dazu steht nicht daneben: sie nennt zu jedem Fehler den richtigen Wert, und damit läge der Lösungsschlüssel offen.

Selbst ausprobieren

  1. Gewichte laden · Bezugsquelle
  2. llama-server mit der Startzeile oben starten
  3. Den Endpunkt in VS Code als eigenes Modell eintragen und den Agenten wählen

Auftrag, Agentdateien und Werkzeuge: Agent Test Harness

Zitieren: Kai Felix Bennett, „Nutzbarkeitstest von lokaler KI auf AMD-Hardware", benchmark.securesight.ai, Lauf qwen38-27b-q4xl-moorhuhn-r9700. Messdaten CC-BY-4.0.

Messdaten CC-BY-4.0, Code MIT.