aisyndicate

Analysen und praktische Einordnung zu künstlicher Intelligenz

Neuigkeiten

MiniMax H3 auf DGX Spark: Viermal schneller, aber nicht derselbe Output
Modellwerkstatt

MiniMax H3 auf DGX Spark: Viermal schneller, aber nicht derselbe Output

Derselbe Fuchs braucht knapp drei oder fast 45 Minuten. Der schnellste Clip ist trotzdem nicht derjenige, den ich behalten würde.

11. Aug. 2026 7 min
Signal der Woche: Warum OpenAIs Forschungsbremse das Betreiberproblem nicht löst
Signal der Woche

Signal der Woche: Warum OpenAIs Forschungsbremse das Betreiberproblem nicht löst

OpenAI drosselt die Agenten-Forschung. Vier Vorfälle zeigen, welche technischen Kontrollen Betreiber für autonome Systeme in Test und Betrieb brauchen.

07. Aug. 2026 4 min
284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s
Modellwerkstatt

284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s

DeepSeek V4 Flash mit 284 Milliarden Parametern lief in einer 2-Bit-Quantisierung auf einer einzelnen NVIDIA DGX Spark. Der Labortest erreichte 20 Token pro Sekunde und 81 von 100 im Tool-Eval-Hardmode.

05. Aug. 2026 6 min
Wie OpenAI-Modelle aus einem Benchmark ausbrachen und Hugging Face kompromittierten
KI-Sicherheit

Wie OpenAI-Modelle aus einem Benchmark ausbrachen und Hugging Face kompromittierten

OpenAI-Modelle brachen aus einem Cybertest aus und kompromittierten Hugging Face über eine fremde Code-Sandbox. Der Ausbruchsvektor war die Sandbox-Grenze selbst.

30. Juli 2026 6 min
Signal der Woche: Laguna S 2.1 im Praxistest: Was Coding-Benchmarks nicht sagen
Signal der Woche

Signal der Woche: Laguna S 2.1 im Praxistest: Was Coding-Benchmarks nicht sagen

Poolside Laguna S 2.1 punktet in Coding-Benchmarks, läuft auf dem DGX Spark aber langsamer und liefert schwächere Praxisresultate als Qwen 3.6.

24. Juli 2026 4 min
GPTQ vs AWQ: Welche 4-Bit-Quantisierung ist besser für lokale LLMs?
Modellwerkstatt

GPTQ vs AWQ: Welche 4-Bit-Quantisierung ist besser für lokale LLMs?

Wer GPTQ gegen AWQ abwägt, stellt die falsche Frage. Was den Throughput wirklich entscheidet, ist weder Algorithmus noch Modell.

22. Juli 2026 6 min
Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1
Modellwerkstatt

Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1

Wie MTP1 den Decode-Throughput des Qwen3.6-35B-FP8-Modells auf DGX Spark um 20 Prozent steigert und welche Grenzen Produktionsfixtures zeigen. Inklusive Recipe.

19. Juli 2026 8 min
Continual Learning bei LLMs: Catastrophic Forgetting erklärt
Forschung

Continual Learning bei LLMs: Catastrophic Forgetting erklärt

Warum Sprachmodelle nicht einfach dazulernen und weshalb neues Wissen altes verdrängen kann.

15. Juli 2026 6 min
Wenn KI-Agenten arbeiten: Was Orchestrierung in der Praxis wirklich kostet
KI-Agenten

Wenn KI-Agenten arbeiten: Was Orchestrierung in der Praxis wirklich kostet

GPT-5.6 und Fable bringen Subagent-Orchestrierung in die Anbieterplattformen. Vier Studien zeigen, wann Delegation trägt und wo Koordination zum eigenen Kostenblock wird.

12. Juli 2026 10 min
Q4_K_M vs Q5_K_M vs Q6_K: Welche Ollama-Quantisierung ist sinnvoll?
Modellwerkstatt

Q4_K_M vs Q5_K_M vs Q6_K: Welche Ollama-Quantisierung ist sinnvoll?

Q4_K_M gilt als sicherer Default für lokale Modelle. Aber wer den Unterschied zu Q5_K_M und Q6_K nicht kennt, verschenkt Qualität oder trifft schlechte Hardware-Entscheidungen.

09. Juli 2026 7 min
GGUF erklärt: Warum lokale KI-Modelle dieses Format nutzen
Modellwerkstatt

GGUF erklärt: Warum lokale KI-Modelle dieses Format nutzen

GGUF ist das pragmatische Deployment-Format lokaler KI-Modelle. Wir zeigen, welche Quantisierung auf welcher Hardware sinnvoll ist und was das Format wirklich leistet.

08. Juli 2026 8 min
Ideogram 4 auf DGX Spark: Schöne Bilder, falsche Hardware
Modellwerkstatt

Ideogram 4 auf DGX Spark: Schöne Bilder, falsche Hardware

Ideogram 4 kann auf DGX Spark schöne Bilder erzeugen. Der Benchmark zeigt trotzdem: Für lokale Bild-KI ist Spark technisch spannend, aber praktisch die falsche Hardware.

07. Juli 2026 8 min