#Modellwerkstatt
Alle Beiträge
Llama-Modelle 2026: Wann lohnt sich Meta Llama lokal noch?
Meta Llama ist 2026 nicht mehr automatisch der lokale Default. Der Vergleich zeigt, wo Llama 3.x und Llama 4 noch sinnvoll sind, was RTX 5090/32 GB wirklich ändern und wann Qwen oder Mistral näherliegen.
Lokale LLM-Benchmarks: Welche Tests für welchen Zweck taugen
Lokale LLM-Benchmarks helfen nur, wenn klar ist, welche Entscheidung sie absichern. Ein Praxisleitfaden für Speed, Modellqualität und Tool-Verhalten.
Gemma 4 lokal: Welches Modell passt zu welcher Hardware?
Gemma 4 gibt es in fünf Grössen von E2B bis 31B. Welche Variante lokal sinnvoll ist, entscheidet der verfügbare Speicher, der Serving-Pfad und die Lizenz.
Lokale LLM-Inferenz: vLLM, llama.cpp, Ollama, TensorRT-LLM im Vergleich
Vier Frameworks, vier Welten. Welcher Serving-Stack wirklich passt, entscheidet sich an Hardware, Last und Betriebsdisziplin.
LLM-Inferenz, Quantisierung und lokale KI: Wo Qualität wirklich verloren geht
Lokale Modelle laufen schneller und billiger, wenn man sie quantisiert. Was dabei still verloren geht, zeigen drei Studien mit einer Metrik, die Standard-Benchmarks systematisch übersehen.
FP4 auf Blackwell: Was NVFP4 für lokale KI wirklich ändert
NVFP4 macht FP4 auf Blackwell erstmals praktisch relevant. Entscheidend sind Scaling, Layer-Profil und Deployment-Disziplin.
DGX Spark in der Praxis: Was lokale KI auf eigener Hardware wirklich bringt
Lokale KI-Hardware verspricht Kontrolle und Unabhängigkeit. Was DGX Spark und ASUS GX10 im echten Betrieb leisten, ist komplizierter als jede Produktseite.
DeepSeek V4-Pro und Flash: API, Preise und lokale Hardware
DeepSeek V4-Pro, Flash und Vision-Exp im aktuellen Vergleich: API-Unterschiede, Preise, Thinking-Fallen und was lokal tatsächlich läuft.
Mistral AI Modelle 2026: Hardware, VRAM und Anwendungsfälle
Mistral hat seine Modellfamilie neu sortiert. Entscheidend ist jetzt, welche Klasse lokal sinnvoll läuft und welche ins API- oder Server-Setup gehört.
Open-Source-KI-Modelle vs. APIs: Wann sich lokaler Betrieb lohnt
Open-Source-KI-Modelle, offene Gewichte und proprietäre APIs klingen wie eine Familie. Sind sie nicht. Wer die Begriffe verwechselt, trifft die falsche Betriebsentscheidung.
Ollama auf dem Mac Mini: Welche Modelle auf welcher Ausstattung sinnvoll laufen
Der Mac mini ist ein starker lokaler KI-Rechner, wenn Speicher, Modell und Runtime zusammenpassen. Seit dem MLX-Start hat sich die Kaufentscheidung verschoben.
Nvidia GTC 2026: Vera Rubin, CUDA 20 und die KI-Roadmap
Nvidia GTC 2026 erklärt: Vera Rubin, CUDA 20, Inference-Markt, DLSS 5 und was die Roadmap für Entwickler und DACH-Unternehmen bedeutet.