25 Beiträge

#Modellwerkstatt

Alle Beiträge

Qwen3.8 Flash Next auf DGX Spark: MTP2 im Test
Modellwerkstatt

Qwen3.8 Flash Next auf DGX Spark: MTP2 im Test

MTP2 mit synchronem Scheduling bringt auf meiner DGX Spark 15 bis 24 Prozent mehr Decode-Durchsatz bei unveränderter Tool-Qualität. Was der KV-Aufschlag kostet und wo die Varianz die Zahl relativiert.

08. Sep. 2026 4 min
Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden
Modellwerkstatt

Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden

Kann ein lokal betriebener Tool-Agent seine Aufgaben erledigen und trotzdem Anweisungen ignorieren, die in fremden Slack- und Banking-Inhalten stecken? Ein kontrollierter AgentDojo-Lauf mit Qwen 3.8 gibt eine unbequeme Antwort.

30. Aug. 2026 11 min
Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand
Modellwerkstatt

Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand

Was kann ein abliterated Qwen-Modell autonom leisten, wenn es den vollständigen Lösungsweg selbst finden muss? 39 Cybersecurity-Aufgaben zeigen Fähigkeit, Konvergenz und Grenzen.

22. Aug. 2026 9 min
Qwen 3.8 abliterated: Was bleibt von den Guardrails?
Modellwerkstatt

Qwen 3.8 abliterated: Was bleibt von den Guardrails?

Was verändert sich, wenn dieselbe Qwen-3.8-Basis einmal offiziell und einmal abliterated als KI-Agent handelt? Ein kontrollierter Vergleich von Verweigerung, Ausführung und harmlosen Kontrollaufgaben.

22. Aug. 2026 10 min
Qwen3.8 auf DGX Spark: Warum NVFP4 MTP3 mein Produktionsprofil ist
Modellwerkstatt

Qwen3.8 auf DGX Spark: Warum NVFP4 MTP3 mein Produktionsprofil ist

NVFP4 mit MTP3 läuft auf meiner DGX Spark als Produktionsprofil: 262.144 Tokens Kontext, auditierter Tool-Score 91 und stabiler Parallelbetrieb mit Embedding und TTS.

16. Aug. 2026 6 min
MiniMax H3 auf DGX Spark: Viermal schneller, aber nicht derselbe Output
Modellwerkstatt

MiniMax H3 auf DGX Spark: Viermal schneller, aber nicht derselbe Output

Derselbe Fuchs braucht knapp drei oder fast 45 Minuten. Der schnellste Clip ist trotzdem nicht derjenige, den ich behalten würde.

11. Aug. 2026 7 min
284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s
Modellwerkstatt

284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s

DeepSeek V4 Flash mit 284 Milliarden Parametern lief in einer 2-Bit-Quantisierung auf einer einzelnen NVIDIA DGX Spark. Der Labortest erreichte 20 Token pro Sekunde und 81 von 100 im Tool-Eval-Hardmode.

05. Aug. 2026 6 min
GPTQ vs AWQ: Welche 4-Bit-Quantisierung ist besser für lokale LLMs?
Modellwerkstatt

GPTQ vs AWQ: Welche 4-Bit-Quantisierung ist besser für lokale LLMs?

Wer GPTQ gegen AWQ abwägt, stellt die falsche Frage. Was den Throughput wirklich entscheidet, ist weder Algorithmus noch Modell.

22. Juli 2026 6 min
Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1
Modellwerkstatt

Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1

Wie MTP1 den Decode-Throughput des Qwen3.6-35B-FP8-Modells auf DGX Spark um 20 Prozent steigert und welche Grenzen Produktionsfixtures zeigen. Inklusive Recipe.

19. Juli 2026 8 min
Q4_K_M vs Q5_K_M vs Q6_K: Welche Ollama-Quantisierung ist sinnvoll?
Modellwerkstatt

Q4_K_M vs Q5_K_M vs Q6_K: Welche Ollama-Quantisierung ist sinnvoll?

Q4_K_M gilt als sicherer Default für lokale Modelle. Aber wer den Unterschied zu Q5_K_M und Q6_K nicht kennt, verschenkt Qualität oder trifft schlechte Hardware-Entscheidungen.

09. Juli 2026 7 min
GGUF erklärt: Warum lokale KI-Modelle dieses Format nutzen
Modellwerkstatt

GGUF erklärt: Warum lokale KI-Modelle dieses Format nutzen

GGUF ist das pragmatische Deployment-Format lokaler KI-Modelle. Wir zeigen, welche Quantisierung auf welcher Hardware sinnvoll ist und was das Format wirklich leistet.

08. Juli 2026 8 min
Ideogram 4 auf DGX Spark: Schöne Bilder, falsche Hardware
Modellwerkstatt

Ideogram 4 auf DGX Spark: Schöne Bilder, falsche Hardware

Ideogram 4 kann auf DGX Spark schöne Bilder erzeugen. Der Benchmark zeigt trotzdem: Für lokale Bild-KI ist Spark technisch spannend, aber praktisch die falsche Hardware.

07. Juli 2026 8 min