25 Beiträge

#Modellwerkstatt

Alle Beiträge

Llama-Modelle 2026: Wann lohnt sich Meta Llama lokal noch?
Modellwerkstatt

Llama-Modelle 2026: Wann lohnt sich Meta Llama lokal noch?

Meta Llama ist 2026 nicht mehr automatisch der lokale Default. Der Vergleich zeigt, wo Llama 3.x und Llama 4 noch sinnvoll sind, was RTX 5090/32 GB wirklich ändern und wann Qwen oder Mistral näherliegen.

23. Juni 2026 9 min
Lokale LLM-Benchmarks: Welche Tests für welchen Zweck taugen
Modellwerkstatt

Lokale LLM-Benchmarks: Welche Tests für welchen Zweck taugen

Lokale LLM-Benchmarks helfen nur, wenn klar ist, welche Entscheidung sie absichern. Ein Praxisleitfaden für Speed, Modellqualität und Tool-Verhalten.

17. Juni 2026 7 min
Gemma 4 lokal: Welches Modell passt zu welcher Hardware?
Modellwerkstatt

Gemma 4 lokal: Welches Modell passt zu welcher Hardware?

Gemma 4 gibt es in fünf Grössen von E2B bis 31B. Welche Variante lokal sinnvoll ist, entscheidet der verfügbare Speicher, der Serving-Pfad und die Lizenz.

09. Juni 2026 7 min
Lokale LLM-Inferenz: vLLM, llama.cpp, Ollama, TensorRT-LLM im Vergleich
Modellwerkstatt

Lokale LLM-Inferenz: vLLM, llama.cpp, Ollama, TensorRT-LLM im Vergleich

Vier Frameworks, vier Welten. Welcher Serving-Stack wirklich passt, entscheidet sich an Hardware, Last und Betriebsdisziplin.

07. Juni 2026 13 min
LLM-Inferenz, Quantisierung und lokale KI: Wo Qualität wirklich verloren geht
Modellwerkstatt

LLM-Inferenz, Quantisierung und lokale KI: Wo Qualität wirklich verloren geht

Lokale Modelle laufen schneller und billiger, wenn man sie quantisiert. Was dabei still verloren geht, zeigen drei Studien mit einer Metrik, die Standard-Benchmarks systematisch übersehen.

03. Juni 2026 12 min
FP4 auf Blackwell: Was NVFP4 für lokale KI wirklich ändert
Modellwerkstatt

FP4 auf Blackwell: Was NVFP4 für lokale KI wirklich ändert

NVFP4 macht FP4 auf Blackwell erstmals praktisch relevant. Entscheidend sind Scaling, Layer-Profil und Deployment-Disziplin.

03. Juni 2026 9 min
DGX Spark in der Praxis: Was lokale KI auf eigener Hardware wirklich bringt
Modellwerkstatt

DGX Spark in der Praxis: Was lokale KI auf eigener Hardware wirklich bringt

Lokale KI-Hardware verspricht Kontrolle und Unabhängigkeit. Was DGX Spark und ASUS GX10 im echten Betrieb leisten, ist komplizierter als jede Produktseite.

27. Mai 2026 9 min
DeepSeek V4-Pro und Flash: API, Preise und lokale Hardware
Modellwerkstatt

DeepSeek V4-Pro und Flash: API, Preise und lokale Hardware

DeepSeek V4-Pro, Flash und Vision-Exp im aktuellen Vergleich: API-Unterschiede, Preise, Thinking-Fallen und was lokal tatsächlich läuft.

26. Mai 2026 5 min
Mistral AI Modelle 2026: Hardware, VRAM und Anwendungsfälle
Modellwerkstatt

Mistral AI Modelle 2026: Hardware, VRAM und Anwendungsfälle

Mistral hat seine Modellfamilie neu sortiert. Entscheidend ist jetzt, welche Klasse lokal sinnvoll läuft und welche ins API- oder Server-Setup gehört.

16. Mai 2026 7 min
Open-Source-KI-Modelle vs. APIs: Wann sich lokaler Betrieb lohnt
Modellwerkstatt

Open-Source-KI-Modelle vs. APIs: Wann sich lokaler Betrieb lohnt

Open-Source-KI-Modelle, offene Gewichte und proprietäre APIs klingen wie eine Familie. Sind sie nicht. Wer die Begriffe verwechselt, trifft die falsche Betriebsentscheidung.

15. Apr. 2026 8 min
Ollama auf dem Mac Mini: Welche Modelle auf welcher Ausstattung sinnvoll laufen
Modellwerkstatt

Ollama auf dem Mac Mini: Welche Modelle auf welcher Ausstattung sinnvoll laufen

Der Mac mini ist ein starker lokaler KI-Rechner, wenn Speicher, Modell und Runtime zusammenpassen. Seit dem MLX-Start hat sich die Kaufentscheidung verschoben.

06. Apr. 2026 6 min
Nvidia GTC 2026: Vera Rubin, CUDA 20 und die KI-Roadmap
Modellwerkstatt

Nvidia GTC 2026: Vera Rubin, CUDA 20 und die KI-Roadmap

Nvidia GTC 2026 erklärt: Vera Rubin, CUDA 20, Inference-Markt, DLSS 5 und was die Roadmap für Entwickler und DACH-Unternehmen bedeutet.

18. März 2026 6 min