#Sprachmodelle
Alle Beiträge
284B in 2 Bit auf 128 GB: DeepSeek V4 Flash mit 20 tok/s
DeepSeek V4 Flash mit 284 Milliarden Parametern lief in einer 2-Bit-Quantisierung auf einer einzelnen NVIDIA DGX Spark. Der Labortest erreichte 20 Token pro Sekunde und 81 von 100 im Tool-Eval-Hardmode.
DeepSeek V4-Pro und Flash: API, Preise und lokale Hardware
DeepSeek V4-Pro, Flash und Vision-Exp im aktuellen Vergleich: API-Unterschiede, Preise, Thinking-Fallen und was lokal tatsächlich läuft.
Vector Database für RAG: Wann SQLite, pgvector oder ein Spezialdienst passt
Eine Vector Database ist keine Pflicht für RAG. Entscheidend sind Korpus, Filter, Lastprofil und die Frage, ob eine einfachere Suche das Problem bereits löst.
Open-Source-KI-Modelle vs. APIs: Wann sich lokaler Betrieb lohnt
Open-Source-KI-Modelle, offene Gewichte und proprietäre APIs klingen wie eine Familie. Sind sie nicht. Wer die Begriffe verwechselt, trifft die falsche Betriebsentscheidung.
Vom ML-Engineering zum AI-Engineering: Ein Paradigmenwechsel
ML Engineers bauen Modelle. AI Engineers bauen darauf Anwendungen. Der Unterschied klingt simpel, hat aber massive Konsequenzen für Skills, Teams und Karrierewege. Was 2026 zählt und wo die Reise hingeht.
Ollama auf dem Mac Mini: Welche Modelle auf welcher Ausstattung sinnvoll laufen
Der Mac mini ist ein starker lokaler KI-Rechner, wenn Speicher, Modell und Runtime zusammenpassen. Seit dem MLX-Start hat sich die Kaufentscheidung verschoben.
RAG erklärt: Wann KI mit eigenen Dokumenten wirklich besser antwortet
Ein Ordner voller PDFs macht noch kein Wissenssystem. RAG lohnt sich erst, wenn Suche, Rechte, Aktualität und Quellenbezug gemeinsam funktionieren.
Qwen-Modelle 2026: Qwen3.8, API, VRAM und RAG
Qwen3.8-27B erreicht Frontier-nahe Benchmarks und läuft lokal oder per API. Der aktualisierte Guide vergleicht Qualität, VRAM, Qwen3.6, Coder-Next und RAG.
KI-Bewusstsein: Was die Forschung 2026 wirklich weiss
Experimente messen Selbstberichte, Unsicherheitsbewertung und Metakognition bei LLMs. Was sagt das 2026 tatsächlich über KI-Bewusstsein aus?
GPT-5.4 ist da: OpenAI launcht sein stärkstes Modell – mit Thinking, Pro und Computer Use
OpenAI hat GPT-5.4 offiziell veröffentlicht – das Modell vereint Coding, extremes Reasoning und Computer Use. Was wir jetzt wissen, und was der Leak von gestern bereits vorweggenommen hat.
GPT-5.4 Leak: Extremes Reasoning, stundenlange Aufgaben und doppelter Kontext
GPT-5.4 soll laut Leak ein 1-Millionen-Token-Kontextfenster, einen extremen Reasoning-Modus und zuverlässige Leistung bei mehrstündigen Aufgaben mitbringen. Was bisher bekannt ist.
Drei neue KI-Modelle gleichzeitig: GPT, Gemini, Claude
OpenAI, Google und Anthropic veröffentlichen heute gleichzeitig neue Frontier-Modelle. Was steckt dahinter – und welches ist das Richtige für dich?