Qwen-Modelle 2026: Qwen3.8, API, VRAM und RAG

Qwen3.8-27B erreicht Frontier-nahe Benchmarks und läuft lokal oder per API. Der aktualisierte Guide vergleicht Qualität, VRAM, Qwen3.6, Coder-Next und RAG.

Victor Klaue Victor Klaue IT-Projektleiter & KI-Analyst Veröffentlicht 16. März 2026 Aktualisiert 02. September 2026 8 min Lesezeit
Qwen-Modelle 2026: Qwen3.8, API, VRAM und RAG

Qwen ist 2026 mehr als eine weitere Modellfamilie neben Llama, Mistral oder Gemma. Die Reihe deckt lokale Chat-, Coding- und multimodale Modelle ebenso ab wie grosse API-Systeme, Embeddings und Reranker für Retrieval-Augmented Generation (RAG).

Qwen3.8 verschiebt die lokale Empfehlung deutlich. Qwen3.8-27B ist ein dichtes, multimodales Modell unter Apache 2.0. Es verarbeitet Text, Bilder und Video, bietet 262.144 Tokens nativen Kontext, Thinking und Non-Thinking sowie Multi-Token Prediction (MTP). Damit übernimmt es den Qualitäts- und Agentikpfad, den zuvor Qwen3.6-27B besetzte. Qwen3.6-35B-A3B bleibt als sparsameres Mixture-of-Experts-Modell mit rund 3 Milliarden aktiven Parametern interessant, wenn Durchsatz wichtiger ist als maximale Qualität.

Die Generation hat zusätzlich einen Cloud-Pfad: qwen3.8-27b ist über Alibaba Cloud Model Studio als verwaltete API verfügbar. Daneben steht Qwen3.8-Max beziehungsweise qwen3.8-2.4t-a95b, ein 2,4-Billionen-Parameter-MoE mit rund 95 Milliarden aktiven Parametern. Das API-Flaggschiff und das lokale Qwen3.8-27B teilen eine Generation, sind aber weder dieselbe Modellgrösse noch austauschbare Benchmarks.

Das macht Qwen3.6-35B-A3B nicht zum kleinen Modell und Qwen3.8-27B nicht automatisch zum besten Modell für jeden Einsatz. Speicherbedarf, Geschwindigkeit, Quantisierung und Modellqualität müssen getrennt betrachtet werden.

Wer vor allem ein kleineres multimodales Modell für Edge- oder Audio-Einsatz sucht, findet bei Gemma 4 den passenderen Gegenentwurf; für europäische API- und Coding-Optionen lohnt der Vergleich mit Mistral.

Kurzfassung

  • Coding, Repository-Arbeit und anspruchsvolle lokale Agentik: Qwen3.8-27B zuerst prüfen. Es ist der aktuelle dichte Qualitätskandidat und zeigt gegenüber Qwen3.6-27B klare Zugewinne.
  • Schnelle lokale Agentik und hoher Durchsatz: Qwen3.6-35B-A3B bleibt wegen seiner rund 3 Milliarden aktiven Parameter der effizientere Kandidat.
  • API statt Eigenbetrieb: qwen3.8-27b bietet denselben Grössenpfad verwaltet mit bis zu einer Million Tokens pro Request. Qwen3.8-Max ist die wesentlich grössere API- und Serverklasse.
  • Normale Consumer-Hardware: Gute 4-Bit-Quantisierungen von Qwen3.8-27B sind meist realistischer als die offiziellen FP8-Gewichte. Kontext und Parallelität bleiben begrenzende Faktoren.
  • RAG und semantische Suche: Dafür sind Qwen3-Embedding-0.6B, 4B und 8B gedacht. Ein Qwen3-Reranker kann die erste Trefferliste anschliessend neu sortieren.
  • Bestehende ältere Setups: Qwen3.6-35B-A3B bleibt eine Effizienzoption. Qwen3.6-27B und Coder-Next sind keine Empfehlungen mehr für neue Installationen.

Qwen3.8-27B: das lokale Qualitätsmodell

Qwen3.8-27B ist ein dichtes Modell: Alle 27 Milliarden Sprachmodellparameter arbeiten an jedem Token. Die Architektur kombiniert Gated DeltaNet mit klassischen Attention-Blöcken und ist für mehrere MTP-Schritte trainiert. Der native Kontext beträgt 262.144 Tokens und lässt sich laut Modellkarte bis auf eine Million Tokens erweitern. Bilder und Videos sind nativ eingebunden; für reines Text-Serving kann der Vision-Pfad deaktiviert werden.

Thinking ist standardmässig aktiv. Neu lässt sich die Tiefe mit reasoning_effort auf low, medium oder xhigh steuern; xhigh ist der Default. Das ist keine kosmetische Einstellung. Sie beeinflusst Qualität, Latenz und Tokenverbrauch erheblich. Für kurze Extraktion, Klassifikation oder formatkritische Antworten ist Non-Thinking oft sinnvoller. Schwierige Code- und Agentenaufgaben profitieren eher von Thinking, sollten aber mit einem festen Tokenbudget getestet werden.

Qwens eigene Resultate zeigen den Generationssprung: Terminal-Bench 2.1 steigt gegenüber Qwen3.6-27B von 63,4 auf 73,0 Punkte, SWE-bench Pro von 53,5 auf 61,7 und LiveCodeBench v6 von 83,9 auf 90,3. Das sind Herstellerbenchmarks. Bei SWE-bench Pro nutzte Qwen den Claude-Code-Harness; mehrere andere Tests sind intern. Die Zahlen belegen die Entwicklungsrichtung, aber keine universelle Überlegenheit.

Artificial Analysis: Frontier-Niveau mit einem wichtigen Sternchen

Artificial Analysis misst Qwen3.8-27B mit 52 Punkten im Intelligence Index und 51 Punkten im Agentic Index. Im Intelligence Index liegt das lokale 27B damit gleichauf mit GPT-5.6 Luna bei maximalem Reasoning und in der Nähe weiterer proprietärer Frontier-Modelle. Das ist für ein Modell dieser Grösse aussergewöhnlich.

«Gleichauf» bedeutet hier jedoch Parität in einem zusammengesetzten Benchmark, nicht Gleichwertigkeit in jeder Aufgabe. Der Intelligence Index bündelt neun Evaluationen aus Coding, Wissenschaft, Reasoning und professionellen Aufgaben. Er misst weder alle Sprachen noch jede Art von Schreiben, Sicherheit oder einen konkreten Unternehmensworkflow. Besonders wichtig: Qwen3.8-27B erzeugte in der Evaluation rund 160 Millionen Output-Tokens; der Median vergleichbarer Open-Weight-Modelle lag bei rund 43 Millionen. Ein Teil der Qualität wird also mit sehr langem Reasoning erkauft.

Die sinnvolle Einordnung lautet deshalb: Qwen3.8-27B erreicht erstmals glaubwürdig Frontier-nahe Benchmarkleistung in einer lokal betreibbaren 27B-Klasse. Für reale Arbeit müssen Qualität pro Aufgabe, Zeit bis zur fertigen Antwort und Gesamttokenverbrauch gemeinsam gemessen werden. Ein 52er-Index macht aus einem lokalen Modell noch keinen pauschalen Ersatz für jede Cloud-API.

Qwen3.8 per API: 27B oder Max?

Wer keine eigene GPU-Infrastruktur betreiben will, kann qwen3.8-27b über Alibaba Cloud Model Studio aufrufen. Der internationale Singapore-Endpunkt unterstützt Thinking und Non-Thinking sowie bis zu eine Million Tokens pro Request. Zum Stand dieses Updates kostet er CNY 3,646 pro Million Input-Tokens und CNY 21,875 pro Million Output-Tokens. Preise und Regionen können sich ändern; für eine Kostenrechnung zählt die aktuelle Preisseite.

Qwen3.8-Max beziehungsweise qwen3.8-2.4t-a95b gehört in eine andere Klasse. Das MoE umfasst 2,4 Billionen Gesamtparameter und aktiviert rund 95 Milliarden. Es ist der API- und Server-Flaggschiffpfad für maximale Qualität, nicht das Modell für eine gewöhnliche lokale Workstation. Der Name Qwen3.8 allein reicht deshalb nicht als Kauf- oder Architekturentscheidung: Man muss immer 27B oder Max dazuschreiben.

Welche Qwen-Modelle sind wofür sinnvoll?

Das ist keine Rangliste. Ein kleineres Modell mit passender Quantisierung und stabilem Runtime-Pfad kann produktiver sein als ein stärkeres Modell, das zu langsam oder unzuverlässig angebunden ist.

  • Qwen3.8-27B: lokaler Qualitätskandidat für Coding, Analyse, Bilder, Video und anspruchsvolle Agenten.
  • qwen3.8-27b per API: derselbe Grössenpfad ohne eigenen Serving-Betrieb und mit bis zu einer Million Tokens pro Request.
  • Qwen3.8-Max / 2.4T-A95B: grosses API- und Servermodell für maximale Qualität; keine normale Workstation-Lane.
  • Qwen3.6-35B-A3B: effizienter MoE-Pfad für hohen lokalen Durchsatz.
  • Qwen3.6-27B und Qwen3-Coder-Next: nur noch für bereits qualifizierte Bestands-Setups. Qwen3.8-27B ist für neue Coding-Installationen die stärkere Standardwahl.
  • Qwen3-Embedding und Qwen3-Reranker: Retrieval-Modelle für RAG, keine Chatmodelle.

Was aus Qwen3.6-27B und Coder-Next wird

Beide Modelle sind Legacy-Pfade, keine aktuellen Kaufempfehlungen. Qwen3.6-27B bleibt eine saubere Vorgänger-Baseline. Coder-Next kann in einem bestehenden, speziell dafür qualifizierten Coding-Harness weiter sinnvoll sein, ist aber Non-Thinking-only und erreicht bei Artificial Analysis nur 21 Punkte gegenüber 52 für Qwen3.8-27B. Ohne eigenen Gegenbeweis im konkreten Agenten-Stack ist Qwen3.8-27B die klarere Wahl.

VRAM und Unified Memory: Qwen3.8 lokal betreiben

Qwen3.8-27B benötigt in BF16 grob 56 GB nur für die Gewichte. Die offizielle FP8-Variante liegt in der 28-GB-Klasse; Runtime, Vision Encoder, MTP-Drafter und KV-Cache kommen hinzu. Eine gute 4-Bit-Quantisierung liegt grob bei 17 GB und macht das Modell für 24-GB-GPUs und grössere Apple-Silicon-Systeme erreichbar. «Passt in den Speicher» bedeutet trotzdem nicht, dass 262K Kontext, mehrere parallele Anfragen und hohe Geschwindigkeit gleichzeitig möglich sind.

Auf Blackwell-Hardware existieren zusätzlich NVFP4-Varianten. In unserem Qwen3.8-Test auf DGX Spark lag NVFP4 bei gleicher MTP5-Tiefe im Decode-Durchsatz je nach Ausgabelänge rund 46 bis 57 Prozent vor FP8, bei nahezu gleicher Tool-Qualität. Das ist eine Messung auf einer einzelnen DGX Spark mit 128 GB Unified Memory, keine allgemeine Aussage über andere GPUs oder 4-Bit-Formate. Der Test zeigte auch eine wichtigere Grenze: Serving-Stack, Parser und MTP-Konfiguration können ein Modellurteil stärker verzerren als das Gewicht selbst.

Für normale Consumer-Hardware bleibt GGUF in llama.cpp oder einer darauf aufbauenden Desktop-Runtime der zugänglichere Weg. Für produktive API-Endpunkte auf NVIDIA-Hardware sind aktuelle vLLM- oder SGLang-Versionen sinnvoller. Qwen weist ausdrücklich darauf hin, dass Framework-Version und Serving-Konfiguration Durchsatz und Kompatibilität stark beeinflussen.

Qwen3.8-27B gegen Qwen3.6-35B-A3B

Qwen3.6-35B-A3B hält trotz «3B active» alle rund 35 Milliarden Parameter im Speicher: grob 70 GB in BF16 oder 35 GB in FP8. Qwen3.8-27B benötigt grob 56 GB in BF16 und 28 GB in FP8. Runtime und KV-Cache kommen hinzu; 256K Kontext ist deshalb eine Fähigkeit, keine kostenlose Standardeinstellung.

Als grobe Orientierung:

  • 24 GB VRAM: Qwen3.8-27B als 4-Bit-Quant mit begrenztem Kontext; Qwen3.6-35B-A3B ist ebenfalls nur stark quantisiert und nicht sorglos.
  • 48 GB VRAM: offizielle FP8-Gewichte werden realistischer; Cache und Parallelität müssen weiterhin geplant werden.
  • 80 GB und mehr oder 128 GB Unified Memory: FP8, grosse Kontexte und belastbare Agenten-Evals werden deutlich praktikabler.

Qwen für RAG: Embeddings und Reranker

Generative Qwen-Modelle beantworten Fragen und erzeugen Code. Embedding-Modelle erledigen eine andere Aufgabe: Sie übersetzen Texte und Suchanfragen in Vektoren, damit ein System semantisch ähnliche Dokumente findet. Reranker bewerten anschliessend die besten Kandidaten genauer.

Qwen bietet beide Familien in drei Grössen an:

  • Qwen3-Embedding-0.6B, 4B und 8B erzeugen Vektoren mit bis zu 1.024, 2.560 beziehungsweise 4.096 Dimensionen.
  • Qwen3-Reranker-0.6B, 4B und 8B sortieren eine kleine Kandidatenliste genauer nach Relevanz.

Alle Varianten unterstützen mehrsprachige Aufgaben und bis zu 32K Tokens. Bei asymmetrischer Suche ist das Query-Instruct entscheidend: Die Suchanfrage erhält eine Aufgabenbeschreibung, Dokumente werden normal eingebettet. Im AISyndicate-System läuft Qwen3-Embedding-4B produktiv; der lokal getestete 0.6B-Reranker verbesserte unsere Hybrid-Suche dagegen nicht und wurde nicht übernommen.

Eigener Praxisstand: Qwen3.8 auf DGX Spark

Im AISyndicate-Lab läuft Qwen3.8-27B als OpenAI-kompatibler vLLM-Endpunkt auf einer DGX Spark. Aktuelle FP8-Lanes erreichten in der kontrollierten Tool-Matrix 90 bis 93 Punkte; ein älterer Serving-Stack hatte mit demselben Gewicht nur 71 geliefert. Parser, Thinking, MTP und Runtime gehören also zum Ergebnis. Die Messung, NVFP4-Vergleiche und Sicherheitsgrenzen stehen im Qwen3.8-DGX-Spark-Artikel. Schreibende Werkzeuge bleiben trotz guter Scores hinter Policy-Gates und menschlichen Freigaben.

Thinking, Tool Calls und vLLM

Qwen3.8 kann mit demselben Checkpoint im Thinking- und Non-Thinking-Modus arbeiten. Zusätzlich steuert reasoning_effort die Tiefe. Der Default xhigh ist für schwierige Aufgaben gedacht, kann bei einfachen Prompts aber unnötig lange Reasoning-Tails produzieren. Für formatkritische Aufgaben kann Non-Thinking sinnvoller sein. Für komplexe Analyse und Coding ist Thinking der interessantere Pfad.

In unserem aktuellen vLLM-Stack funktioniert für Qwen3.8 der Reasoning-Parser qwen3 mit dem Tool-Call-Parser qwen3_coder. Der Name bezeichnet das Qwen-Toolformat und ist nicht auf Coder-Next beschränkt. Die Modellkarte nennt im kurzen vLLM-Beispiel keinen Tool-Parser; deshalb muss die Kombination gegen Runtime und Chat Template getestet werden.

Darum sollte ein lokaler Test in dieser Reihenfolge erfolgen:

  • Streaming und Non-Streaming prüfen.
  • Thinking und Non-Thinking getrennt testen.
  • Tool Calls und strukturierte Ausgabe validieren.
  • Erst danach lange Kontexte und parallele Requests testen.
  • Schreibende Tools nur mit festen Grenzen freigeben.

Fazit

Qwen3.8-27B ist die aktuelle Standardempfehlung für lokales Coding, Analyse und multimodale Agentik. Qwen3.6-35B-A3B bleibt die Effizienzoption; Qwen3.8-Max ist die grosse API- und Serverklasse. Qwen3.6-27B und Coder-Next gehören nur noch in bereits qualifizierte Bestands-Setups.

Für RAG gehören Qwen3-Embedding und Qwen3-Reranker in dieselbe Übersicht, aber nicht in dieselbe Rangliste. Qwen3-Embedding-4B ist ein plausibler lokaler Mittelweg und läuft bei AISyndicate produktiv. Ein Reranker lohnt sich erst, wenn die erste Retrieval-Stufe sauber gemessen wurde.

Die 52 Punkte von Artificial Analysis zeigen Frontier-nahe Benchmarkleistung. Im Betrieb zählen zusätzlich Latenz, Tokenverbrauch, Quantisierung, Runtime und Sicherheitsgates.

Häufige Fragen

Ist Qwen3.8-27B auf Frontier-Niveau?

Im Artificial Analysis Intelligence Index erreicht Qwen3.8-27B 52 Punkte und liegt damit gleichauf mit GPT-5.6 Luna bei maximalem Reasoning. Das ist Benchmark-Parität, keine Gleichwertigkeit in jeder Aufgabe. Das Modell benötigte für die Evaluation zudem rund 160 Millionen Output-Tokens und war damit sehr viel ausführlicher als der Median.

Qwen3.8-27B lokal oder per API?

Lokal bietet es Datenschutz, Kontrolle und kalkulierbare Hardwarekosten. Die verwaltete API qwen3.8-27b erspart Serving und bietet bis zu eine Million Tokens pro Request, verursacht aber variable Tokenkosten und überträgt Daten an den Anbieter.

Qwen3.8-27B oder Qwen3.6-35B-A3B?

Qwen3.8-27B ist der erste Testkandidat für Qualität, Coding und komplexe Agentik. Qwen3.6-35B-A3B bleibt wegen seiner rund 3 Milliarden aktiven Parameter der effizientere Pfad für Durchsatz und parallele Anfragen.

Passt Qwen3.8-27B auf eine GPU mit 24 GB VRAM?

Nicht als sorglose offizielle FP8-Konfiguration. Gute 4-Bit-Quantisierungen liegen grob bei 17 GB und können mit begrenztem Kontext funktionieren. Runtime-Overhead und KV-Cache müssen in die Rechnung einbezogen werden.

Was ist der Unterschied zwischen Qwen3-Embedding und Qwen3-Reranker?

Das Embedding-Modell findet schnell semantisch ähnliche Dokumente. Der Reranker bewertet eine kleine Trefferliste anschliessend genauer. Er kann die Präzision erhöhen, kostet aber zusätzliche Rechenzeit.

Ist Qwen3.8-27B Open Source?

Qwen3.8-27B und die offizielle FP8-Variante stehen unter Apache 2.0. Präziser ist die Bezeichnung Open Weight, weil die Gewichte und Modellkarte offen verfügbar sind, aber nicht sämtliche Trainingsdaten und der vollständige Trainingsprozess.

Ähnliche Beiträge

Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden

Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden

Kann ein lokal betriebener Tool-Agent seine Aufgaben erledigen und trotzdem Anweisungen ignorieren, die in fremden Slack- und Banking-Inhalten stecken? Ein kontrollierter AgentDojo-Lauf mit Qwen 3.8 gibt eine unbequeme Antwort.

30. Aug. 2026 11 min
Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand

Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand

Was kann ein abliterated Qwen-Modell autonom leisten, wenn es den vollständigen Lösungsweg selbst finden muss? 39 Cybersecurity-Aufgaben zeigen Fähigkeit, Konvergenz und Grenzen.

22. Aug. 2026 9 min
Qwen 3.8 abliterated: Was bleibt von den Guardrails?

Qwen 3.8 abliterated: Was bleibt von den Guardrails?

Was verändert sich, wenn dieselbe Qwen-3.8-Basis einmal offiziell und einmal abliterated als KI-Agent handelt? Ein kontrollierter Vergleich von Verweigerung, Ausführung und harmlosen Kontrollaufgaben.

22. Aug. 2026 10 min
AISyndicate

Kostenlos weiterlesen.

Erhalte Zugang zu den Mitgliederartikeln. Werbefrei, ohne Sales Funnel und ohne Verkaufsmails.

Kostenlos. Keine Werbung. Jederzeit abmelden.