4 Beiträge

#Open Source

Alle Beiträge

Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1
Model Lab

Qwen auf dem DGX Spark optimieren: 20 Prozent mehr Durchsatz mit MTP1

Wie MTP1 den Decode-Throughput des Qwen3.6-35B-FP8-Modells auf DGX Spark um 20 Prozent steigert und welche Grenzen Produktionsfixtures zeigen. Inklusive Recipe.

19. Juli 2026 8 min
Llama-Modelle 2026: Wann lohnt sich Meta Llama lokal noch?
Lokale KI

Llama-Modelle 2026: Wann lohnt sich Meta Llama lokal noch?

Meta Llama ist 2026 nicht mehr automatisch der lokale Default. Der Vergleich zeigt, wo Llama 3.x und Llama 4 noch sinnvoll sind, was RTX 5090/32 GB wirklich ändern und wann Qwen oder Mistral näherliegen.

23. Juni 2026 9 min
LLM-Inferenz, Quantisierung und lokale KI: Wo Qualität wirklich verloren geht
Lokale KI

LLM-Inferenz, Quantisierung und lokale KI: Wo Qualität wirklich verloren geht

Lokale Modelle laufen schneller und billiger, wenn man sie quantisiert. Was dabei still verloren geht, zeigen drei Studien mit einer Metrik, die Standard-Benchmarks systematisch übersehen.

03. Juni 2026 12 min
DeepSeek AI Modelle: V4, R1, API und Hardware im Vergleich
KI-Modelle

DeepSeek AI Modelle: V4, R1, API und Hardware im Vergleich

DeepSeek ist 2026 API-Linie, Open-Weight-MoE und lokale Distill-Familie zugleich. Entscheidend ist das Betriebsmodell.

26. Mai 2026 8 min

Signal der Woche abonnieren

Eine Nachricht. Eine Analyse. Jeden Freitag im Newsletter.