Analysen und praktische Einordnung zu künstlicher Intelligenz
Neuigkeiten
MiniMax H3 auf DGX Spark: Viermal schneller, aber nicht derselbe Output
Derselbe Fuchs braucht knapp drei oder fast 45 Minuten. Der schnellste Clip ist trotzdem nicht derjenige, den ich behalten würde.
Signal der Woche: Warum OpenAIs Forschungsbremse das Betreiberproblem nicht löst
OpenAI drosselt die Agenten-Forschung. Vier Vorfälle zeigen, welche technischen Kontrollen Betreiber für autonome Systeme in Test und Betrieb brauchen.
284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s
DeepSeek V4 Flash mit 284 Milliarden Parametern lief in einer 2-Bit-Quantisierung auf einer einzelnen NVIDIA DGX Spark. Der Labortest erreichte 20 Token pro Sekunde und 81 von 100 im Tool-Eval-Hardmode.
Wie OpenAI-Modelle aus einem Benchmark ausbrachen und Hugging Face kompromittierten
OpenAI-Modelle brachen aus einem Cybertest aus und kompromittierten Hugging Face über eine fremde Code-Sandbox. Der Ausbruchsvektor war die Sandbox-Grenze selbst.
Signal der Woche: Laguna S 2.1 im Praxistest: Was Coding-Benchmarks nicht sagen
Poolside Laguna S 2.1 punktet in Coding-Benchmarks, läuft auf dem DGX Spark aber langsamer und liefert schwächere Praxisresultate als Qwen 3.6.
GPTQ vs AWQ: Welche 4-Bit-Quantisierung ist besser für lokale LLMs?
Wer GPTQ gegen AWQ abwägt, stellt die falsche Frage. Was den Throughput wirklich entscheidet, ist weder Algorithmus noch Modell.
Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1
Wie MTP1 den Decode-Throughput des Qwen3.6-35B-FP8-Modells auf DGX Spark um 20 Prozent steigert und welche Grenzen Produktionsfixtures zeigen. Inklusive Recipe.
Continual Learning bei LLMs: Catastrophic Forgetting erklärt
Warum Sprachmodelle nicht einfach dazulernen und weshalb neues Wissen altes verdrängen kann.
Wenn KI-Agenten arbeiten: Was Orchestrierung in der Praxis wirklich kostet
GPT-5.6 und Fable bringen Subagent-Orchestrierung in die Anbieterplattformen. Vier Studien zeigen, wann Delegation trägt und wo Koordination zum eigenen Kostenblock wird.
Q4_K_M vs Q5_K_M vs Q6_K: Welche Ollama-Quantisierung ist sinnvoll?
Q4_K_M gilt als sicherer Default für lokale Modelle. Aber wer den Unterschied zu Q5_K_M und Q6_K nicht kennt, verschenkt Qualität oder trifft schlechte Hardware-Entscheidungen.
GGUF erklärt: Warum lokale KI-Modelle dieses Format nutzen
GGUF ist das pragmatische Deployment-Format lokaler KI-Modelle. Wir zeigen, welche Quantisierung auf welcher Hardware sinnvoll ist und was das Format wirklich leistet.
Ideogram 4 auf DGX Spark: Schöne Bilder, falsche Hardware
Ideogram 4 kann auf DGX Spark schöne Bilder erzeugen. Der Benchmark zeigt trotzdem: Für lokale Bild-KI ist Spark technisch spannend, aber praktisch die falsche Hardware.