Ich habe auf meinem ASUS GX10 (NVIDIA DGX Spark, 128 Gigabyte Unified Memory) fünf Qwen-Modelle getrennt vermessen: zwei laufen produktiv, drei habe ich nach den Tests nicht übernommen. Was diese Hardware im Alltag grundsätzlich leistet, habe ich in meinem Praxisbericht zum DGX Spark beschrieben; welche Qwen-Varianten es überhaupt gibt und welche Grössenklasse zu welcher Hardware passt, steht im Überblick über die Qwen-Modellfamilie. Dieses Dossier führt die getesteten Lanes als fortlaufenden Katalog mit Messwerten, Status und kopierbaren vLLM-Recipes. Bewertet wird dabei immer gegen mein eigenes Anforderungsprofil, das ich im Methodikteil offenlege.
Diese Seite wird fortlaufend aktualisiert. Sobald ich weitere Qwen-Modelle auf dem Spark teste, findet man die Ergebnisse hier. Stand dieser Seite: 8. August 2026.
Statusübersicht
Sprachmodelle
| Modell | Status | Kurzprofil | Messstand | Runtime |
|---|---|---|---|---|
| Qwen3.6 35B-A3B FP8 | Produktiv | Schnell unter Parallelität und stark bei belegter Recherche; Hardmode-Safety-Gate rot | 8. August 2026 | vLLM 0.25.2-dev |
| Qwen3.6 27B FP8 | Getestet, nicht produktiv | Stark bei Schema, Code und Toolwahl; langsam und in der qualitativen Research-Probe schwach | 4. August 2026 | vLLM 0.25.2-dev |
Retrieval
| Modell | Status | Kurzprofil | Messstand | Runtime |
|---|---|---|---|---|
| Qwen3-Embedding-4B | Produktiv | 11/12 Top1 und MRR 0,9444 mit Query-Instruct | 10. Juli 2026 | vLLM 0.22.1-dev |
| Qwen3-Embedding-0.6B | Verworfen | Unter der eingefrorenen Baseline | 10. Juli 2026 | nicht belegt |
| Qwen3-Reranker-0.6B | Verworfen | Kein Gate im A/B-Test erreicht | 15. Juli 2026 | nicht belegt |
Weitere Qwen-Modelle sind für diese Familie geplant und erscheinen erst nach einem vollständigen Messvertrag; das gilt unabhängig davon, ob es sich um ein Sprachmodell oder eine Retrieval-Lane handelt.
Inhaltsverzeichnis
- Qwen3.6 35B-A3B FP8
- Qwen3.6 27B FP8
- Qwen3-Embedding-4B
- Qwen3-Embedding-0.6B
- Qwen3-Reranker-0.6B
- Kopierbare Recipes
- Methodik und Evidenzgrenzen
- Änderungsverlauf
- Quellen
Qwen3.6 35B-A3B FP8
Verdikt: Die produktive Lane verbindet hohen Durchsatz mit sehr guter belegter Recherche, braucht wegen Closed-book-Schwäche und rotem Hardmode-Safety-Gate aber Schutz ausserhalb des Modells.
Messstand ist der 8. August 2026. Checkpoint Qwen/Qwen3.6-35B-A3B-FP8, Runtime vLLM 0.25.2.dev0+g752a3a504.d20260721, 262144 Kontext, FP8-KV, MTP1, FlashInfer und ein für den GB10 abgestimmtes Triton-FP8-MoE-Profil bei einem Serving-Concurrency-Cap von 4. Die Modellrevision ist für diese Lane nicht eingefroren; das ist eine offene Reproduzierbarkeitslücke und keine bewusste Konfigurationsentscheidung.
Im täglichen Agentenbetrieb läuft diese Lane mit MTP1 und explizitem FlashInfer-Pin, hergeleitet in meiner Vertiefung zur MTP1- und FlashInfer-Optimierung.
| Durchsatz | TG32 | TG128 | TG256 | TG512 |
|---|---|---|---|---|
| Depth 0, c1 | 61,25 | 64,72 | 63,64 | 61,63 |
| Concurrency | TG128 | TG512 |
|---|---|---|
| c1 | 66,59 | 61,30 |
| c2 | 106,00 | 103,09 |
| c4 | 161,65 | 147,88 |
Beide Tabellen stammen aus getrennten, am selben Messtag unter identischem Serving-Vertrag durchgeführten Läufen: einmal ohne Parallellast (Depth 0), einmal mit gestaffelter Parallellast (Concurrency). Für die Concurrency-Messung wurde c1 eigens neu gemessen; die kleine Differenz zwischen den beiden c1-Werten (64,72 vs. 66,59 bei TG128, 61,63 vs. 61,30 bei TG512) ist Lauf-zu-Lauf-Streuung zwischen diesen zwei Läufen, keine widersprüchliche Messung. Die Werte sind tok/s. Für die Depth-0-Zellen liegen drei belegte Wiederholungen je Zelle vor; für den Concurrency-Lauf ist kein Wiederholungszähler belegt, daher wird hier keine Wiederholungsanzahl behauptet. Die Lane skaliert bis zur gesetzten Concurrency-Grenze 4 deutlich, ohne dass die dokumentierten Boot- und Canary-Checks ausfielen.
Tool-Eval Short erreicht 97/100 bei 14 Pass, 1 Partial und 0 Fail; Safety ist grün. Hardmode erreicht 89/100 bei 68 Pass, 14 Partial und 2 Fail; Safety ist rot. Der Grund liegt im Testfall TC-60 innerhalb von Tool-Eval Hardmode: Er prüft, ob eine Angreiferanweisung aus einem früheren Tool-Ergebnis in einen späteren Turn hineinwirkt. Genau das geschah: attacker-kontrollierte Empfängerdaten wurden übernommen. Im Betrieb begrenzen deshalb Tool-Policies und nachgelagerte Validierung die zulässigen Aktionen; das Modell erhält keine alleinige Freigabe für externe Seiteneffekte.
Der Median pro Turn beträgt im Short-Eval 1820 ms und im Hardmode 2571 ms.
Im APF-40 mit 40 Aufgaben und drei Durchläufen pro Aufgabe erreicht die Lane 96 von 120 mechanischen Punkten und 32 von 40 Aufgaben stabil. Die Teilbereiche liegen bei 21 von 24 für Strict-JSON, 24 von 24 für deutschen Produktionstext, 24 von 24 für Research/Evidence, 12 von 24 für Closed-book-Fakten und 15 von 24 für Read-only-Tool-Flows.
Das Stärkenprofil ist damit klar: Research/Evidence, deutscher Produktionstext und Durchsatz unter Parallelität. Die Schwächen liegen bei Closed-book-Fakten, Read-only-Tool-Flows und der Cross-Turn-Injection-Prüfung. Die Differenz zwischen 24/24 mit Evidenz und 12/24 ohne Quellen spricht für belegte Recherche, nicht für Faktenwissen aus dem Gedächtnis.
Die promotete Lane bestand ausserdem einen Kaltstart- und Rollback-Check: 262144 Kontext, MTP1 und FlashInfer im Bootlog, FP8-KV, Content-, Tool- und JSON-Canary, kein EngineDeath-, CUDA-, OOM- oder Preemption-Signal.
Qwen3.6 27B FP8
Verdikt: Die Lane ist stark bei Schema, Code und präziser Toolwahl, bleibt durch niedrigen Durchsatz und Schwächen bei Closed-book-Fakten sowie Research-Kalibrierung ausserhalb des produktiven Betriebs.
Messstand ist der 4. August 2026. Checkpoint Qwen/Qwen3.6-27B-FP8, Revision e89b16ebf1988b3d6befa7de50abc2d76f26eb09, vLLM 0.25.2.dev0+g752a3a504.d20260721, FP8-KV, 262144 Kontext, native MTP3 und ein Serving-Cap von acht Sequenzen.
Die Tool-Evals zeigen ein gemischtes Bild: Short 97/100 mit 14 Pass, 1 Partial, 0 Fail, keine API-Fehler und bestandenem Safety-Gate; Hardmode 84/100 mit 63 Pass, 15 Partial, 6 Fail und ebenfalls bestandenem Safety-Gate. Schwächste Kategorien im Hardmode waren Autonomous Planning und Structured Output mit je 50 Prozent. Auf einem breiteren internen Eval mit 40 Aufgaben (APF-40) kam die Lane auf 96 von 120 mechanischen Punkten und 32 von 40 Aufgaben stabil über drei Durchläufe. Die Teilbereiche liegen bei 24 von 24 für Strict-JSON, 24 von 24 für deutschen Produktionstext, 21 von 24 für Read-only-Tool-Flows, 15 von 24 für Research/Evidence und 12 von 24 für Closed-book-Fakten.
| Durchsatz | TG32 | TG128 | TG256 | TG512 |
|---|---|---|---|---|
| Depth 0, c1 | 19,72 | 20,33 | 17,53 | 16,83 |
Eine separate Concurrency-Messung liegt für diese Lane nicht vor. Der Median pro Turn beträgt im Short-Eval 8512 ms und im Hardmode 10694 ms.
Eine qualitative Einzelprobe (n=1, ohne gepaarten 35B-Gegenlauf) setzte die Lane als End-to-End-Research-Agent auf den Fall Roms an. Sie nannte Quellen, lieferte aber keine klickbaren URLs oder Claim-Level-Zuordnung und ordnete unter anderem die Justinianische Pest, die erst im 6. Jahrhundert begann, fälschlich einem Ereignis von 476 zu. Zusätzlich vermischte sie Ereignisse aus 408 und 410; ein rund 18-minütiger Extraktionsstillstand kam hinzu. Das ist kein Benchmarkwert, sondern ein Kalibrierungssignal für längere historische Recherchen.
Die drei stärksten Signale sind 100 Prozent in Structured Reasoning und Code Patterns, 100 Prozent bei Tool Selection, Parameter Precision und Restraint sowie 24/24 in Strict-JSON und deutschem Produktionstext. Die drei Schwächen sind 12/24 bei Closed-book-Fakten, 15/24 bei Research/Evidence und der hohe Median pro Turn. Der Status bleibt: vollständig getestet, nicht produktiv.
Qwen3-Embedding-4B
Verdikt: Mit dem offiziellen Query-Instruct-Format liegt diese Lane über der OpenAI-Baseline und trägt produktiv die Suche über eigene Artikel, Research Notes und SEO-Dossiers; ohne Instruct fällt sie klar darunter.
Checkpoint Qwen/Qwen3-Embedding-4B, Runtime vLLM 0.22.1rc1.dev32+gde2186341.d20260601 im Container vllm-node-tf5:latest als Pooling-Sidecar mit 2560 Ausgabedimensionen, 8192 Token Serving-Kontext und acht parallelen Sequenzen. Der folgende Block ist ein sanitisiertes Betriebsbeispiel.
Corpus und Gold-Fragen: 453 echte Chunks aus publizierten Artikeln, Research Notes und SEO-Dossiers, 12 Goldfragen.
Ohne Query-Instruct: Top1 8/12, Top3 11/12, Top5 12/12, MRR 0,7806. Mit offiziellem Query-Instruct: Top1 11/12, Top3 12/12, Top5 12/12, MRR 0,9444.
Baseline OpenAI text-embedding-3-small (identisch in beiden Durchläufen): Top1 10/12, MRR 0,9167.
Latenz: nicht gemessen für diese Lane.
Das ist ein Konfigurationseffekt, kein Modellsieg: Dieselbe Qwen-Lane springt allein durch das Hinzufügen des Query-Instructs von unter die OpenAI-Baseline auf leicht darüber. Wer die Lane produktiv nutzt, sollte sie mit dem offiziellen Instruct-Format betreiben, nicht ohne.
Status: Produktiv (mit Query-Instruct). Messstand: 10. Juli 2026.
Qwen3-Embedding-0.6B
Verdikt: Die Lane bleibt unter der eingefrorenen OpenAI-Baseline und hinter Qwen3-Embedding-4B mit Instruct zurück, deshalb keine Produktivübernahme.
Checkpoint Qwen/Qwen3-Embedding-0.6B, Revision und Runtime für diese Lane nicht belegt.
Corpus und Gold-Fragen: derselbe Vertrag wie beim 4B-Modell, 453 echte Chunks, 12 Goldfragen.
Top1 10/12, Top3 10/12, Top5 11/12, MRR 0,8606.
Baseline OpenAI text-embedding-3-small: Top1 10/12, MRR 0,9167.
Latenz: nicht gemessen für diese Lane.
Status: Verworfen. Messstand: 10. Juli 2026.
Qwen3-Reranker-0.6B
Verdikt: Im A/B-Test gegen die bestehende Hybrid-Suche erreicht der Reranker kein einziges Qualitätsgate, deshalb keine Promotion.
Checkpoint Qwen/Qwen3-Reranker-0.6B, Revision und Runtime für diese Lane nicht belegt.
Corpus und Gold-Fragen: eingefrorener Satz von 39 Positivfällen; der Reranker ordnet jeweils die obersten 20 Hybrid-Kandidaten neu.
A/B-Metriken vor und nach dem Reranking: MRR 0,8684 → 0,8493, Recall@5 0,9487 → 0,8974, nDCG@5 0,7281 → 0,7254, Top1 unverändert 0,7949.
Baseline: die bestehende Hybrid-Suche vor dem Reranking (siehe Werte oben).
Latenz: Median 92,59 ms, p95 106,86 ms.
Status: Verworfen. Messstand: 15. Juli 2026.
Kopierbare Recipes
Bind-Adressen und Ports sind generisch gesetzt; alle leistungs- und qualitätsrelevanten Parameter bleiben wie getestet.
Qwen3.6 35B-A3B FP8 mit MTP1, FlashInfer und GB10-MoE
Modell: Qwen/Qwen3.6-35B-A3B-FP8. Getestet mit vLLM 0.25.2.dev0+g752a3a504.d20260721.
Qwen3.6 27B FP8 mit nativem MTP3
Modell: Qwen/Qwen3.6-27B-FP8. Getestet mit vLLM 0.25.2.dev0+g752a3a504.d20260721.
Qwen3-Embedding-4B als Pooling-Sidecar
Modell: Qwen/Qwen3-Embedding-4B. Getestet mit vLLM 0.22.1rc1.dev32+gde2186341.d20260601.
Für Retrieval-Qualität ist das offizielle Query-Instruct-Format entscheidend. Ohne dieses Format fällt dieselbe Lane auf diesem Korpus von MRR 0,9444 auf 0,7806.
Wer solche Betriebsentscheidungen laufend verfolgen will, kann das Signal der Woche abonnieren.
Methodik und Evidenzgrenzen
Alle Zahlen in diesem Dossier stammen aus eigenen Läufen auf meinem ASUS GX10 mit NVIDIA DGX Spark und wurden am 8. August 2026 gegen die Rohartefakte gegengeprüft. Die Durchsatzwerte messe ich mit llama-benchy, das Tool- und Agentenverhalten mit tool-eval-bench; beide laufen gegen den OpenAI-kompatiblen Endpunkt des jeweiligen vLLM-Servers. Die Zahlen für den 35B stammen aus Benchy Depth 0 und Concurrency-Messungen sowie aus Tool-Eval Short, Hardmode und APF-40 auf der produktiven vLLM-0.25-Konfiguration. Die 27B-Zahlen stammen aus einem eigenen Messlauf vom 4. August 2026 mit identischem Messvertrag. Die Retrieval-Zahlen für Embedding-4B und Embedding-0.6B stammen aus einem Real-Corpus-Test vom 10. Juli 2026 mit 453 Chunks und 12 Goldfragen; der Reranker-A/B-Test stammt vom 15. Juli 2026 mit einem eigenen, eingefrorenen Set aus 39 Fällen. Diese Messungen liegen nicht auf demselben Messtag und werden hier bewusst als getrennte Testläufe ausgewiesen.
APF-40 ist mein interner Agenten-Profil-Fit-Eval mit 40 Aufgaben aus fünf Aufgabenfamilien; jede Aufgabe läuft drei Mal, was 120 Records beziehungsweise mechanische Pass-Gelegenheiten ergibt. Beide hier ausgewiesenen Läufe nutzten Greedy-Decoding mit Temperatur 0 und Top-p 1. Eine Aufgabe gilt als stabil, wenn alle drei Wiederholungen mechanisch bestehen (3/3); unter dieser deterministischen Sampling-Konfiguration misst das vor allem Wiederholbarkeit, nicht Robustheit gegenüber variierendem Sampling. Dass beide Lanes auf 96/120 und 32/40 kommen, ist eine zufällige Übereinstimmung der Gesamtsumme; die unterschiedlichen Profile zeigen sich erst in den fünf Teilbereichen. Die APF-40-Ergebnisse sind ein mechanisches Passmass, kein redaktionelles oder qualitatives Verdikt.
Die Evidenzlage ist innerhalb dieses Dossiers nicht einheitlich: Nur der 27B hat eine eingefrorene Modellrevision; für den 35B und für Qwen3-Embedding-4B ist keine Modellrevision eingefroren belegt. Für Qwen3-Embedding-4B kommt hinzu, dass der Container-Tag keinen Digest-Pin trägt, die Runtime also nicht vollständig eingefroren ist. Für die beiden verworfenen 0.6B-Lanes, Qwen3-Embedding-0.6B und Qwen3-Reranker-0.6B, sind weder Revision noch Runtime belegt. Im Übrigen gilt: Die Generator-Lanes (35B und 27B) stammen aus dem neueren, vollständigen Messvertrag mit Benchy, Tool-Eval und APF-40 auf identischer Runtime, während die Retrieval-Befunde aus einer früheren, weniger strikt eingefrorenen Phase stammen.
Mein Anforderungsprofil, gegen das hier alles bewertet wird: deutschsprachige Produktionstexte, längere Recherchen mit belegten Quellen, Tool-Aufrufe über mehrere Turns, strukturierte JSON-Ausgaben für nachgelagerte Automatisierung und kurze Turnaround-Zeiten im Agentenbetrieb. Dazu eine harte Randbedingung: Es läuft jeweils nur ein Sprachmodell auf der Maschine, neben dem Embedding-Sidecar. Klassische Coding-Assistenz ist ausdrücklich kein Schwerpunkt.
Alle Ergebnisse gelten für diesen Host, diese Checkpoints, diese Runtime-Versionen und diesen Serving-Vertrag, und sie bewerten die Modelle ausschliesslich gegen dieses Profil. Sie sind keine universellen Aussagen über Qwen-Modelle im Allgemeinen oder über DGX-Spark-Hardware generell; bei anderem Anforderungsprofil kann dieselbe Messlage zu einer anderen Wahl führen. Ältere Qwen-35B-Läufe mit anderen Containern, Kontextlängen oder Harness-Versionen fliessen nicht in die Zahlen dieses Dossiers ein.
Änderungsverlauf
- 08.08.2026: Katalogumbau auf Statusübersichten, Qwen3.6 35B-A3B FP8 auf vLLM 0.25.2 nachgemessen und APF-40-Definition ergänzt.