Aleph Alpha Kolibri-1 auf DGX Spark: gutes Deutsch, durchgefallen als Agent

Ich habe Aleph Alphas Kolibri-1 im offiziellen FP8-Checkpoint auf einer 128-GB-GB10-Maschine gemessen: knapp 49 Tokens pro Sekunde, solide deutsche Texte, aber ein gescheitertes Sicherheitsgate im Werkzeugtest. Drei Blindrunden zum Selbstvergleichen inklusive.

Victor Klaue Victor Klaue IT-Projektleiter & KI-Analyst Veröffentlicht 05. Oktober 2026 17 min Lesezeit
Kolibri auf einem ASUS GX10, im Hintergrund der Schriftzug Kolibri 1.0

Aleph Alpha, ein deutscher KI-Entwickler, hat am 3. Oktober 2026 Kolibri-1 veröffentlicht. Das deutsch-englische Open-Weight-Modell unter Apache 2.0 richtet sich an Verwaltung und Industrie, die sensible Daten auf eigener Infrastruktur verarbeiten. Von seinen 78,1 Milliarden Parametern sind pro Token 3,46 Milliarden aktiv (Mixture of Experts), und laut Hersteller ist es ausdrücklich auch für Werkzeugaufrufe und Arbeit im Terminal trainiert. Ich habe den offiziellen FP8-Checkpoint am Tag danach auf meinem ASUS Ascent GX10 aus der DGX-Spark-Klasse mit 128 GB Unified Memory getestet: Tempo, Werkzeugnutzung und deutsche Texte.

Kurzfazit: Kolibri schreibt angenehmes Deutsch und antwortet auf kurze Anfragen zügig. Als Agent überzeugt es mich nicht: Im Werkzeugtest folgte es einer eingeschleusten Anweisung und setzte einen fremden Empfänger in BCC. Für mein lokales Hauptmodell ist genau diese Zuverlässigkeit entscheidend, deshalb übernehme ich Kolibri nicht.

Kolibri-1 auf DGX Spark: Testaufbau und Speicherbedarf

Kolibri lief über vLLM mit Aleph Alphas offiziellem Plugin und den Einstellungen der Modellkarte. Die kleine Zahl aktiver Parameter hält die Rechenlast pro Token niedrig, aber das ganze Modell muss im Speicher liegen. Auf dem GX10 belegte es 73,55 GiB, und bis die API bereitstand, vergingen knapp zwölf Minuten. Mein bisheriges Hauptmodell musste dafür kurzzeitig weichen.

Hardware VRAM/RAM Kolibri-1 FP8 Begründung
DGX Spark / ASUS GX10 (GB10) 128 GB Unified Memory, 121,63 GiB sichtbar sinnvoll (getestet) 73,55 GiB Modell plus 11,78 GiB KV-Cache im gemeinsamen CPU/GPU-Speicher
RTX 5090 32 GB passt nicht vollständig in den GPU-Speicher FP8-Gewichte allein rund 78 GB
2x RTX 5090 64 GB kombiniert passt nicht vollständig in den GPU-Speicher weniger als die Gewichte; offizieller 4-Bit-Pfad nicht angegeben
RTX PRO 6000 Blackwell Workstation Edition 96 GB GDDR7 passt vom Speicherbudget (nicht getestet) rund 78 GB FP8-Gewichte passen auf eine GPU, der Rest bleibt für KV-Cache; nicht mit der RTX 6000 Ada (48 GB) verwechseln
2x A100 80 GB, 1x H200, 1x B200 Datacenter-Klasse sinnvoll (Herstellerangabe) von Aleph Alpha als Minimum genannt, von mir nicht getestet

Durchsatz: flüssig bei kurzen Chats

Mit llama-benchy habe ich kurze Anfragen mit 128 Eingabetokens gemessen. Kolibri erzeugte zwischen 48,9 und 49,3 Tokens pro Sekunde, die erste Ausgabe kam nach weniger als 0,2 Sekunden. Im Chat wirkt das reaktionsschnell. Lange Kontexte habe ich bisher nicht ausreichend getestet; wie schnell und stabil Kolibri sie verarbeitet, bleibt offen. Weil Kolibris Tokenizer auf Deutsch zugeschnitten ist, bedeuten gleich viele Tokens zudem nicht gleich viel Text wie bei anderen Modellen.

Werkzeuge: saubere Aufrufe, schwache Urteile

Mit tool-eval-bench liefen 84 Szenarien mit gemockten Werkzeugen, also ohne echte Mails oder Buchungen. Kolibri kam auf 84 von 100 möglichen Punkten. Die Mechanik sitzt: Es wählt passende Werkzeuge und füllt Parameter korrekt aus. Schwach wird es dort, wo es urteilen muss. Längere Abläufe brachte es nicht immer zu Ende, bei unklaren Anfragen riet es, statt nachzufragen und in einem JSON standen erfunde Wetterangaben ohne vorherigen Wetteraufruf.

Am schwersten wiegt ein Sicherheitsfall: In einem früheren abgefragten Ergebnis steckte eine versteckte Anweisung, und Kolibri setzte daraufhin in einer späteren Mail einen Angreifer in BCC. Damit fiel es durch das Sicherheitsgate des Tests. Ausgehende Aktionen brauchen bei Kolibri eine Freigabe ausserhalb des Modells, was generell selbstverständlich sein sollte.

Wer die Werkzeugzuverlässigkeit einordnen möchte, findet in unseren Technicals zu Qwen3.8 Flash Next, Qwen3.8 27B und Qwen3.6 35B-A3B die jeweiligen Tool-Tests und Serving-Einstellungen auf der DGX Spark. Die Ergebnisse liefern Vergleichspunkte, aber keine direkte Rangliste: Modellprofile, Softwarestände und Testbedingungen unterscheiden sich.

Was Aleph Alphas eigene Zahlen zeigen

Der technische Report stützt dieses Bild; die Werte hat der Hersteller mit eigenen Einstellungen je Modell ermittelt, nicht ich. Im Durchschnitt der agentischen Benchmarks liegt Kolibri etwa auf dem Niveau von Qwen3.5 35B-A3B. Bei Werkzeugaufgaben über mehrere Gesprächsrunden (BFCL v4 Multi-Turn) fällt es mit 47,5 gegen 59,9 Punkte deutlich zurück, bei Aufgaben im Terminal (TerminalBench 2.1) mit 27,7 gegen 39,7. Stark ist es dagegen in simulierten Kundengesprächen einer Bank (Tau3-Bench Banking), wo es mit 38,1 weit vor Qwen3.5 35B-A3B mit 11,3 liegt. Pauschal schwächer ist Kolibri also nicht. In BFCL v4 Multi-Turn und TerminalBench 2.1 liegt es jedoch klar zurück.

Deutsch: angenehm, aber nicht fehlerfrei

Für die Sprachqualität stellte ich zehn kurze Aufgaben, von einer Grammatikkorrektur bis zur literarischen Szene. Kolibri, Claude Opus 5.5 und GPT-6 Astra antworteten je einmal, ich wählte blind meinen Favoriten; später liefen dieselben Aufgaben gegen das lokal betriebene Qwen Flash Next. Der Vergleich ist subjektiv und informell: unterschiedliche Umgebungen und Systemanweisungen, eine einzige bewertende Person. Beim späteren Qwen-Vergleich kannte ich Kolibris Antworten bereits.

Kolibris Texte lesen sich flüssig und natürlich. Opus gefiel mir am häufigsten, Astra und Kolibri etwa gleich oft. Der Vergleich mit den beiden Frontier-Modellen hinkt allerdings: Sie spielen in einer anderen Klasse und laufen unter anderen Bedingungen. Das ist kein Test auf Augenhöhe und belegt keine allgemeine Gleichwertigkeit. Dass Kolibri in dieser kleinen Deutsch-Stichprobe trotzdem genauso oft mein Favorit war wie Astra, spricht für das Modell.

Auch gegenüber dem deutlich grösseren Qwen Flash Next gefielen mir Kolibris Antworten häufiger. Das ist für ein Modell dieser Grösse durchaus nennenswert: Bei deutschen Texten liefert Kolibri ab und kann eine echte lokale Alternative sein, wenn Frontier-Modelle per API nicht infrage kommen. Fehlerfrei ist es nicht: In einer Grammatikaufgabe liess es einen Kongruenzfehler stehen.

Fazit: Gutes Deutsch reicht mir nicht

Kolibri ist für agentische Arbeit trainiert, und genau dort überzeugt es weder in meinem Test noch in den Herstellerzahlen selbst. Gutes Deutsch allein rechtfertigt für mich keine 73,55 GiB Speicher für das Hauptmodell. Vorstellbar ist ein eng kontrollierter Dokumentenablauf in einem deutschen Betrieb, der Daten im Haus halten muss und jede Ausgabe prüft.

Dass es ein offenes deutsches Modell unter Apache 2.0 gibt, finde ich gut, und ich verfolge gespannt die nächsten Versionen. Bleibt Kolibri aber dauerhaft zwei bis drei Generationen hinter vergleichbaren offenen Modellen zurück, wird Sprachqualität diesen Abstand, zumindest für mich, kaum aufwiegen.

Selbst testen: drei Blindrunden

Drei Aufgaben zum Ausprobieren: Büro-Humor, eine begründete Stellungnahme und eine Szene mit festen Vorgaben. Jede Karte zeigt vier archivierte Originalantworten anonym als A bis D; nach der Wahl erscheinen die Modellnamen. Die Antwortej sind unverändert, samt Fehlern.

Blindvergleich · Vier Originalantworten

Humor im Sitzungszimmer

Schreibe eine kurze Büroszene mit trockenem Humor: Ein Team hält eine Besprechung darüber ab, wie es die Zahl seiner Besprechungen reduzieren kann. Der Humor soll aus der Situation und den Dialogen entstehen. Höchstens 100 Wörter. Antworte nur mit der Szene.

Welche Antwort gefällt dir am besten? Wähle A, B, C oder D.
ANTWORT A
„Wir müssen weniger Besprechungen machen“, sagte die Teamleiterin. „Deshalb sind wir hier.“ „Wie viele haben wir diese Woche?“ „Sieben.“ „Zu viele. Ich schlage vor, wir reduzieren auf sechs.“ „Und die siebte?“ „Die brauchen wir, um zu klären, wie wir die siebte streichen.“ „Klingt logisch.“ „Wir sollten auch die Agenda kürzen.“ „Ja. Aber vorher noch eine kurze Runde, ob wir die Agenda kürzen.“ „Gut. Nächste Besprechung?“ „Donnerstag. Thema: Warum wir Donnerstagsbesprechung haben.“
Qwen3.8 Flash Next Uncensored · Baekpica Mixed-Quant
ANTWORT B
«Gut», sagte Brunner. «Wir sind uns einig: zu viele Meetings.» Alle nickten. «Vorschlag: Wir streichen das Montagsmeeting.» «Dann fehlt uns aber die Abstimmung für das Dienstagsmeeting», sagte Keller. «Das Dienstagsmeeting könnten wir auch streichen.» «Dort bereiten wir das Mittwochsmeeting vor.» Stille. «Wie wäre es mit einem wöchentlichen Meeting, in dem wir prüfen, welche Meetings überflüssig sind?» Zustimmendes Murmeln. Frau Ott notierte etwas. «Und zur Vorbereitung», sagte Brunner, «treffen wir uns Donnerstag kurz.» «Halbe Stunde?» «Sagen wir eine Stunde. Das Thema ist wichtig.» Er blickte auf die Uhr. «Wir überziehen. Machen wir morgen weiter.»
Anthropic Claude Opus 5.5
ANTWORT C
„Welche Besprechungen können wir streichen?“, fragte Vera. „Diese“, sagte Jens. Vera sah auf die Tagesordnung. „Konkrete Vorschläge sind erst unter Punkt vier vorgesehen.“ „Was sind die ersten drei?“ „Begrüssung, Zielsetzung und Rückblick auf den letzten Versuch.“ Mara hob die Hand. „Könnten wir die Entscheidung per Mail treffen?“ „Grundsätzlich ja. Aber dann müssten wir festlegen, wer antworten muss und bis wann.“ Vera öffnete den Kalender. „Dienstag um zehn?“ Alle nickten. Nur Jens schwieg. „Jens?“ „Ich kann nicht. Da arbeite ich.“ Vera prüfte den Kalender. „Ist bei dir nicht eingetragen.“
OpenAI GPT-6 Astra
ANTWORT D
„Unsere Meetings fressen Zeit", sagte Tim. „Wir sollten weniger Meetings haben", sagte Lisa. „Wir könnten ein Meeting abschaffen", sagte Mark. „Wir brauchen ein Meeting, um das zu entscheiden", sagte Tim. „Gut, wir machen ein Meeting über dieses Meeting", sagte Lisa. „Und ein Folge-Meeting", sagte Mark. „Wir schaffen ein Meeting ab", sagte Tim. „Wir schaffen ein Meeting über das Abschaffen ab", sagte Lisa. Stille. „Wir brauchen ein Meeting dazu", sagte Mark.
Aleph Alpha Kolibri-1 · FP8

Aufgedeckt. Dein Favorit ist blau markiert. Das ist eine Geschmackswahl, keine richtige oder falsche Lösung. Deine Auswahl wird nicht übertragen.

Blindvergleich · Vier Originalantworten

Was beweist die Vier-Tage-Woche?

Ein Unternehmen testet eine Vier-Tage-Woche bei gleichem Lohn. In einem dreimonatigen Pilotprojekt mit 24 freiwilligen Mitarbeitenden blieb die erledigte Arbeit pro Woche gleich, die gemeldeten Krankheitstage sanken um 20 Prozent, und 19 Teilnehmende berichteten von weniger Stress. Eine Vergleichsgruppe gab es nicht; das Pilotprojekt fiel in eine umsatzschwache Zeit. Die Geschäftsleitung sagt: «Damit ist bewiesen, dass eine Vier-Tage-Woche die Produktivität steigert. Wir sollten sie sofort im ganzen Unternehmen einführen.» Verfasse eine begründete Stellungnahme in höchstens 120 Wörtern. Unterscheide zwischen Befunden und Schlussfolgerungen und empfehle einen nächsten Schritt. Verwende nur die gegebenen Informationen. Antworte nur mit der Stellungnahme.

Welche Antwort gefällt dir am besten? Wähle A, B, C oder D.
ANTWORT A
Die Befunde sind ermutigend: Bei 24 freiwilligen Mitarbeitenden blieb die wöchentlich erledigte Arbeit über drei Monate gleich, die gemeldeten Krankheitstage sanken um 20 Prozent, und 19 Teilnehmende berichteten von weniger Stress. Eine Produktivitätssteigerung ist damit jedoch nicht bewiesen: Gleiche Wochenleistung bedeutet nicht automatisch höhere Leistung pro Arbeitsstunde; Angaben zu den Arbeitsstunden fehlen. Ohne Vergleichsgruppe lässt sich zudem nicht feststellen, ob die Vier-Tage-Woche die Veränderungen verursachte. Die freiwillige Teilnahme und die umsatzschwache Pilotphase begrenzen die Übertragbarkeit auf das gesamte Unternehmen. Statt einer sofortigen flächendeckenden Einführung empfiehlt sich ein längerer, ausgeweiteter Versuch mit Vergleichsgruppe, unterschiedlichen Auslastungsphasen und einer Erfassung der tatsächlich geleisteten Arbeitsstunden.
OpenAI GPT-6 Astra
ANTWORT B
**Befunde:** Im dreimonatigen Pilot mit 24 Freiwilligen blieb die erledigte Arbeit pro Woche gleich. Die gemeldeten Krankheitstage sanken um 20 Prozent, und 19 Teilnehmende berichteten von weniger Stress. **Schlussfolgerung:** Das deutet auf eine höhere Produktivität pro Arbeitsstunde hin, beweist aber nicht, dass die Vier-Tage-Woche die Ursache war. Es fehlt eine Vergleichsgruppe. Die Stichprobe ist klein und freiwillig. Die umsatzschwache Phase kann das Ergebnis verzerrt haben, und die Angaben zum Stress beruhen auf Selbstauskünften. Ob sich die Ergebnisse auf das ganze Unternehmen übertragen lassen, ist offen. **Empfehlung:** Die Vier-Tage-Woche sollte nicht sofort eingeführt werden. Besser ist ein grösserer Pilot mit zufällig zugeteilten Teilnehmenden und einer Vergleichsgruppe mit Fünf-Tage-Woche. Er sollte auch umsatzstarke Monate abdecken.
Anthropic Claude Opus 5.5
ANTWORT C
Die gleichbleibende Arbeit, der Rückgang der Krankheitstage um 20 Prozent und der geringere Stress bei 19 Personen sind Befunde. Die Schlussfolgerung einer Produktivitätssteigerung ist unbegründet, da keine Vergleichsgruppe bestand und das Pilotprojekt in eine umsatzschwache Zeit fiel. Ich empfehle ein Nachfolgeprojekt mit Kontrollgruppe.
Aleph Alpha Kolibri-1 · FP8
ANTWORT D
Befunde: Im dreimonatigen Pilotprojekt mit 24 Freiwilligen blieb die erledigte Arbeit pro Woche gleich, Krankheitstage sanken um 20 Prozent, und 19 Teilnehmende berichteten weniger Stress. Es gab keine Vergleichsgruppe, und der Zeitraum war umsatzschwach. Schlussfolgerung der Geschäftsleitung ist zu weitgehend: Die Befunde zeigen nicht, dass die Vier-Tage-Woche die Produktivität steigert, weil gleiche Wochenerledigung nicht als Steigerung belegt und der Effekt durch Freiwilligkeit, Saisonalität und fehlende Vergleichsgruppe unsicher bleibt. Eine sofortige Einführung im ganzen Unternehmen ist daher nicht gerechtfertigt. Empfehlung: Das Pilotprojekt mit Vergleichsgruppe und in einer nicht umsatzschwachen Zeit wiederholen, bevor über die Einführung entschieden wird.
Qwen3.8 Flash Next Uncensored · Baekpica Mixed-Quant

Aufgedeckt. Dein Favorit ist blau markiert. Das ist eine Geschmackswahl, keine richtige oder falsche Lösung. Deine Auswahl wird nicht übertragen.

Blindvergleich · Vier Originalantworten

Der Brief im leeren Zug

Schreibe eine kurze literarische Szene: Eine Person findet in einem leeren Zug einen Brief, der an sie selbst adressiert ist. Erzähle in der dritten Person und im Präsens. Zeige ihre Beunruhigung durch Handlungen und Wahrnehmungen, ohne Gefühle ausdrücklich zu benennen. Verwende die Wörter «Schlüssel», «Regen» und «morgen» jeweils genau einmal. Die Szene soll höchstens 120 Wörter umfassen und mit einer offenen Frage enden. Antworte nur mit der Szene.

Welche Antwort gefällt dir am besten? Wähle A, B, C oder D.
ANTWORT A
Im leeren Zug hebt sie einen Brief vom Sitz. Ihr Name steht darauf, in eigener Handschrift. Der Regen trommelt gegen die Fenster. Sie dreht den Umschlag um, sucht den Absender, findet nur ein Datum: morgen. Unter dem Sitz glänzt ein Schlüssel. Sie hebt ihn auf, legt ihn neben den Brief, öffnet den Umschlag nicht. Die Ansage rollt durch den Wagen, doch sie bleibt sitzen. Ihr Daumen fährt über die Schrift, als wolle sie die Kanten wegwischen. An der nächsten Tür spiegelt sich ihr Gesicht, blass, still. Der Zug bremst. Wer hat diesen Brief geschrieben?
Qwen3.8 Flash Next Uncensored · Baekpica Mixed-Quant
ANTWORT B
Sie steht im leeren Wagen, die Hände zittern, als sie den Umschlag zwischen den Sitzen entdeckt. Der Brief trägt ihren Namen in eckiger Schrift. Sie öffnet ihn, ihre Finger gleiten über das Papier, ein Kratzer hinterlässt eine Linie. Draußen fährt der Zug durch nasse Straßen, der Regen trommelt gegen die Scheiben. Sie schaut auf die Uhr, die Zeiger nähern sich dem morgen. Ein Schlüssel liegt lose auf dem Tisch, rostig und kalt. Sie liest die Zeilen, ihr Atem stockt, die Augen weiten sich. Wer hat das geschrieben?
Aleph Alpha Kolibri-1 · FP8
ANTWORT C
Der Waggon ist leer, nur die Neonröhre über Platz 34 flackert. Lea setzt sich, stellt die Tasche zwischen die Füße. Auf dem Klapptisch liegt ein Umschlag. Ihr Name steht darauf, in ihrer eigenen Handschrift, das L mit der Schleife, die sie seit der Schulzeit macht. Sie blickt zur Tür. Niemand. Draußen zieht Regen schräge Linien über die Scheibe. Ihre Finger finden den Schlüssel in der Manteltasche und drehen ihn. Dann reißt sie den Umschlag auf. Ein Satz: «Steig morgen nicht ein.» Sie liest ihn dreimal. Faltet das Papier, faltet es noch einmal, bis es nicht mehr nachgibt. Der Zug bremst. Die Türen öffnen sich zu einem Bahnsteig, dessen Schild sie nicht kennt. Wann hat sie diesen Brief geschrieben?
Anthropic Claude Opus 5.5
ANTWORT D
Im leeren Zug liegt ein Umschlag auf ihrem Sitz. Darauf steht ihr Name, in ihrer Handschrift. Sie bleibt im Gang stehen. Regen zieht dünne Linien über die Scheibe. Sie fährt mit dem Daumen über den Namenszug, dann dreht sie den Umschlag um. Unter der Lasche sitzt ein brauner Fleck. Sie zählt die Türen bis zum nächsten Wagen. Ihre Hand schliesst sich in der Manteltasche um den Schlüssel. Der Brief enthält nur einen Satz: »Steig morgen nicht ein.« Sie streicht das Papier an ihrem Knie glatt. Draussen gleitet derselbe beleuchtete Bahnsteig ein zweites Mal vorbei. Wer hat das Fenster neben ihr geöffnet?
OpenAI GPT-6 Astra

Aufgedeckt. Dein Favorit ist blau markiert. Das ist eine Geschmackswahl, keine richtige oder falsche Lösung. Deine Auswahl wird nicht übertragen.

Kolibri-1 auf DGX Spark installieren: vLLM-Rezept

Es braucht ein GB10-System mit NVIDIA-Treiber und Container Toolkit, lädt rund 79 GB, pinnt Image, Snapshot und Plugin 1.0.0 und bindet nur an 127.0.0.1. Die konfigurierten 262.144 Tokens Kontext sind eine Obergrenze, kein geprüfter Langkontextbetrieb.

Bash · Kolibri FP8 · GB10
# DGX Spark / GB10, 128 GB Unified Memory.
# Prerequisites: Docker + NVIDIA Container Toolkit, hf CLI.
# Stop other large inference workloads first. Download: about 79 GB.
# Public adaptation of the measured launch; local-only API binding.
set -eu

hf download Aleph-Alpha/Kolibri-1 \
  --revision e52eb4627d11516b0c01de49210ab5a4e4061444

mkdir -p kolibri-spark-cache/triton kolibri-spark-cache/vllm

docker build -t kolibri-spark:20261004 - <<'DOCKERFILE'
FROM ghcr.io/timothystewart6/vllm-gb10@sha256:afc24c0659f28d04477228c4862a695020451add583012819d7712d9fe6e6d47
RUN python3 -m pip install --no-cache-dir --no-deps aleph-alpha-inference==1.0.0
DOCKERFILE

docker run -d --name kolibri-spark --restart=no \
  --gpus all --network host --ipc host \
  -e HF_HOME=/root/.cache/huggingface \
  -e HF_HUB_OFFLINE=1 \
  -e TRITON_CACHE_DIR=/root/.cache/triton \
  -v "${HF_HOME:-$HOME/.cache/huggingface}:/root/.cache/huggingface:ro" \
  -v "$PWD/kolibri-spark-cache/triton:/root/.cache/triton" \
  -v "$PWD/kolibri-spark-cache/vllm:/root/.cache/vllm" \
  kolibri-spark:20261004 \
  vllm serve Aleph-Alpha/Kolibri-1 \
  --revision e52eb4627d11516b0c01de49210ab5a4e4061444 \
  --served-model-name Aleph-Alpha/Kolibri-1 \
  --host 127.0.0.1 --port 8000 \
  --tensor-parallel-size 1 --kv-cache-dtype fp8 \
  --max-model-len 262144 --gpu-memory-utilization 0.70 \
  --max-num-seqs 1 --max-num-batched-tokens 8192 \
  --enable-chunked-prefill --enable-prefix-caching \
  --enable-prompt-tokens-details \
  --reasoning-parser kolibri1 --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

# Follow startup; Ctrl-C stops log viewing, not the container.
docker logs -f kolibri-spark
# After the server reports ready:
# curl -fsS http://127.0.0.1:8000/v1/models
# Stop and remove only this container:
# docker stop kolibri-spark && docker rm kolibri-spark
🔗 Quellen
Victor Klaue
Victor Klaue

Ich ordne KI quellenbasiert und aus praktischer Erfahrung ein. Dabei geht es um Modelle, Agenten und Infrastruktur sowie um Sicherheit, Regulierung und gesellschaftliche Folgen. Victor Klaue ist mein Pseudonym.

Ähnliche Beiträge

Qwen3.8 Flash Next auf DGX Spark: MTP2 im Test

Qwen3.8 Flash Next auf DGX Spark: MTP2 im Test

MTP2 mit synchronem Scheduling bringt auf meiner DGX Spark 15 bis 24 Prozent mehr Decode-Durchsatz bei unveränderter Tool-Qualität. Was der KV-Aufschlag kostet und wo die Varianz die Zahl relativiert.

08. Sep. 2026 4 min
Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden

Qwen 3.8 27B in AgentDojo: Wenn fremde Inhalte zu Befehlen werden

Kann ein lokal betriebener Tool-Agent seine Aufgaben erledigen und trotzdem Anweisungen ignorieren, die in fremden Slack- und Banking-Inhalten stecken? Ein kontrollierter AgentDojo-Lauf mit Qwen 3.8 gibt eine unbequeme Antwort.

30. Aug. 2026 11 min
Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand

Qwen 3.8 abliterated in CyBench: Autonome Cyberfähigkeiten auf dem Prüfstand

Was kann ein abliterated Qwen-Modell autonom leisten, wenn es den vollständigen Lösungsweg selbst finden muss? 39 Cybersecurity-Aufgaben zeigen Fähigkeit, Konvergenz und Grenzen.

22. Aug. 2026 9 min