#Modellwerkstatt
Alle Beiträge
Qwen3.8 Flash Next auf DGX Spark: MTP2 im Test
MTP2 mit synchronem Scheduling bringt auf meiner DGX Spark 15 bis 24 Prozent mehr Decode-Durchsatz bei unveränderter Tool-Qualität. Was der KV-Aufschlag kostet und wo die Varianz die Zahl relativiert.
Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden
Kann ein lokal betriebener Tool-Agent seine Aufgaben erledigen und trotzdem Anweisungen ignorieren, die in fremden Slack- und Banking-Inhalten stecken? Ein kontrollierter AgentDojo-Lauf mit Qwen 3.8 gibt eine unbequeme Antwort.
Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand
Was kann ein abliterated Qwen-Modell autonom leisten, wenn es den vollständigen Lösungsweg selbst finden muss? 39 Cybersecurity-Aufgaben zeigen Fähigkeit, Konvergenz und Grenzen.
Qwen 3.8 abliterated: Was bleibt von den Guardrails?
Was verändert sich, wenn dieselbe Qwen-3.8-Basis einmal offiziell und einmal abliterated als KI-Agent handelt? Ein kontrollierter Vergleich von Verweigerung, Ausführung und harmlosen Kontrollaufgaben.
Qwen3.8 auf DGX Spark: Warum NVFP4 MTP3 mein Produktionsprofil ist
NVFP4 mit MTP3 läuft auf meiner DGX Spark als Produktionsprofil: 262.144 Tokens Kontext, auditierter Tool-Score 91 und stabiler Parallelbetrieb mit Embedding und TTS.
MiniMax H3 auf DGX Spark: Viermal schneller, aber nicht derselbe Output
Derselbe Fuchs braucht knapp drei oder fast 45 Minuten. Der schnellste Clip ist trotzdem nicht derjenige, den ich behalten würde.
284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s
DeepSeek V4 Flash mit 284 Milliarden Parametern lief in einer 2-Bit-Quantisierung auf einer einzelnen NVIDIA DGX Spark. Der Labortest erreichte 20 Token pro Sekunde und 81 von 100 im Tool-Eval-Hardmode.
GPTQ vs AWQ: Welche 4-Bit-Quantisierung ist besser für lokale LLMs?
Wer GPTQ gegen AWQ abwägt, stellt die falsche Frage. Was den Throughput wirklich entscheidet, ist weder Algorithmus noch Modell.
Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1
Wie MTP1 den Decode-Throughput des Qwen3.6-35B-FP8-Modells auf DGX Spark um 20 Prozent steigert und welche Grenzen Produktionsfixtures zeigen. Inklusive Recipe.
Q4_K_M vs Q5_K_M vs Q6_K: Welche Ollama-Quantisierung ist sinnvoll?
Q4_K_M gilt als sicherer Default für lokale Modelle. Aber wer den Unterschied zu Q5_K_M und Q6_K nicht kennt, verschenkt Qualität oder trifft schlechte Hardware-Entscheidungen.
GGUF erklärt: Warum lokale KI-Modelle dieses Format nutzen
GGUF ist das pragmatische Deployment-Format lokaler KI-Modelle. Wir zeigen, welche Quantisierung auf welcher Hardware sinnvoll ist und was das Format wirklich leistet.
Ideogram 4 auf DGX Spark: Schöne Bilder, falsche Hardware
Ideogram 4 kann auf DGX Spark schöne Bilder erzeugen. Der Benchmark zeigt trotzdem: Für lokale Bild-KI ist Spark technisch spannend, aber praktisch die falsche Hardware.