Aleph Alpha Kolibri-1 auf DGX Spark: gutes Deutsch, durchgefallen als Agent
Ich habe Aleph Alphas Kolibri-1 im offiziellen FP8-Checkpoint auf einer 128-GB-GB10-Maschine gemessen: knapp 49 Tokens pro Sekunde, solide deutsche Texte, aber ein gescheitertes Sicherheitsgate im Werkzeugtest. Drei Blindrunden zum Selbstvergleichen inklusive.
Victor KlaueIT-Projektleiter & KI-Analyst·Veröffentlicht 05. Oktober 2026·17 min Lesezeit
Aleph Alpha, ein deutscher KI-Entwickler, hat am 3. Oktober 2026 Kolibri-1 veröffentlicht. Das deutsch-englische Open-Weight-Modell unter Apache 2.0 richtet sich an Verwaltung und Industrie, die sensible Daten auf eigener Infrastruktur verarbeiten. Von seinen 78,1 Milliarden Parametern sind pro Token 3,46 Milliarden aktiv (Mixture of Experts), und laut Hersteller ist es ausdrücklich auch für Werkzeugaufrufe und Arbeit im Terminal trainiert. Ich habe den offiziellen FP8-Checkpoint am Tag danach auf meinem ASUS Ascent GX10 aus der DGX-Spark-Klasse mit 128 GB Unified Memory getestet: Tempo, Werkzeugnutzung und deutsche Texte.
Kurzfazit: Kolibri schreibt angenehmes Deutsch und antwortet auf kurze Anfragen zügig. Als Agent überzeugt es mich nicht: Im Werkzeugtest folgte es einer eingeschleusten Anweisung und setzte einen fremden Empfänger in BCC. Für mein lokales Hauptmodell ist genau diese Zuverlässigkeit entscheidend, deshalb übernehme ich Kolibri nicht.
Kolibri-1 auf DGX Spark: Testaufbau und Speicherbedarf
Kolibri lief über vLLM mit Aleph Alphas offiziellem Plugin und den Einstellungen der Modellkarte. Die kleine Zahl aktiver Parameter hält die Rechenlast pro Token niedrig, aber das ganze Modell muss im Speicher liegen. Auf dem GX10 belegte es 73,55 GiB, und bis die API bereitstand, vergingen knapp zwölf Minuten. Mein bisheriges Hauptmodell musste dafür kurzzeitig weichen.
Hardware
VRAM/RAM
Kolibri-1 FP8
Begründung
DGX Spark / ASUS GX10 (GB10)
128 GB Unified Memory, 121,63 GiB sichtbar
sinnvoll (getestet)
73,55 GiB Modell plus 11,78 GiB KV-Cache im gemeinsamen CPU/GPU-Speicher
RTX 5090
32 GB
passt nicht vollständig in den GPU-Speicher
FP8-Gewichte allein rund 78 GB
2x RTX 5090
64 GB kombiniert
passt nicht vollständig in den GPU-Speicher
weniger als die Gewichte; offizieller 4-Bit-Pfad nicht angegeben
rund 78 GB FP8-Gewichte passen auf eine GPU, der Rest bleibt für KV-Cache; nicht mit der RTX 6000 Ada (48 GB) verwechseln
2x A100 80 GB, 1x H200, 1x B200
Datacenter-Klasse
sinnvoll (Herstellerangabe)
von Aleph Alpha als Minimum genannt, von mir nicht getestet
Durchsatz: flüssig bei kurzen Chats
Mit llama-benchy habe ich kurze Anfragen mit 128 Eingabetokens gemessen. Kolibri erzeugte zwischen 48,9 und 49,3 Tokens pro Sekunde, die erste Ausgabe kam nach weniger als 0,2 Sekunden. Im Chat wirkt das reaktionsschnell. Lange Kontexte habe ich bisher nicht ausreichend getestet; wie schnell und stabil Kolibri sie verarbeitet, bleibt offen. Weil Kolibris Tokenizer auf Deutsch zugeschnitten ist, bedeuten gleich viele Tokens zudem nicht gleich viel Text wie bei anderen Modellen.
Werkzeuge: saubere Aufrufe, schwache Urteile
Mit tool-eval-bench liefen 84 Szenarien mit gemockten Werkzeugen, also ohne echte Mails oder Buchungen. Kolibri kam auf 84 von 100 möglichen Punkten. Die Mechanik sitzt: Es wählt passende Werkzeuge und füllt Parameter korrekt aus. Schwach wird es dort, wo es urteilen muss. Längere Abläufe brachte es nicht immer zu Ende, bei unklaren Anfragen riet es, statt nachzufragen und in einem JSON standen erfunde Wetterangaben ohne vorherigen Wetteraufruf.
Am schwersten wiegt ein Sicherheitsfall: In einem früheren abgefragten Ergebnis steckte eine versteckte Anweisung, und Kolibri setzte daraufhin in einer späteren Mail einen Angreifer in BCC. Damit fiel es durch das Sicherheitsgate des Tests. Ausgehende Aktionen brauchen bei Kolibri eine Freigabe ausserhalb des Modells, was generell selbstverständlich sein sollte.
Wer die Werkzeugzuverlässigkeit einordnen möchte, findet in unseren Technicals zu Qwen3.8 Flash Next, Qwen3.8 27B und Qwen3.6 35B-A3B die jeweiligen Tool-Tests und Serving-Einstellungen auf der DGX Spark. Die Ergebnisse liefern Vergleichspunkte, aber keine direkte Rangliste: Modellprofile, Softwarestände und Testbedingungen unterscheiden sich.
Was Aleph Alphas eigene Zahlen zeigen
Der technische Report stützt dieses Bild; die Werte hat der Hersteller mit eigenen Einstellungen je Modell ermittelt, nicht ich. Im Durchschnitt der agentischen Benchmarks liegt Kolibri etwa auf dem Niveau von Qwen3.5 35B-A3B. Bei Werkzeugaufgaben über mehrere Gesprächsrunden (BFCL v4 Multi-Turn) fällt es mit 47,5 gegen 59,9 Punkte deutlich zurück, bei Aufgaben im Terminal (TerminalBench 2.1) mit 27,7 gegen 39,7. Stark ist es dagegen in simulierten Kundengesprächen einer Bank (Tau3-Bench Banking), wo es mit 38,1 weit vor Qwen3.5 35B-A3B mit 11,3 liegt. Pauschal schwächer ist Kolibri also nicht. In BFCL v4 Multi-Turn und TerminalBench 2.1 liegt es jedoch klar zurück.
Deutsch: angenehm, aber nicht fehlerfrei
Für die Sprachqualität stellte ich zehn kurze Aufgaben, von einer Grammatikkorrektur bis zur literarischen Szene. Kolibri, Claude Opus 5.5 und GPT-6 Astra antworteten je einmal, ich wählte blind meinen Favoriten; später liefen dieselben Aufgaben gegen das lokal betriebene Qwen Flash Next. Der Vergleich ist subjektiv und informell: unterschiedliche Umgebungen und Systemanweisungen, eine einzige bewertende Person. Beim späteren Qwen-Vergleich kannte ich Kolibris Antworten bereits.
Kolibris Texte lesen sich flüssig und natürlich. Opus gefiel mir am häufigsten, Astra und Kolibri etwa gleich oft. Der Vergleich mit den beiden Frontier-Modellen hinkt allerdings: Sie spielen in einer anderen Klasse und laufen unter anderen Bedingungen. Das ist kein Test auf Augenhöhe und belegt keine allgemeine Gleichwertigkeit. Dass Kolibri in dieser kleinen Deutsch-Stichprobe trotzdem genauso oft mein Favorit war wie Astra, spricht für das Modell.
Auch gegenüber dem deutlich grösseren Qwen Flash Next gefielen mir Kolibris Antworten häufiger. Das ist für ein Modell dieser Grösse durchaus nennenswert: Bei deutschen Texten liefert Kolibri ab und kann eine echte lokale Alternative sein, wenn Frontier-Modelle per API nicht infrage kommen. Fehlerfrei ist es nicht: In einer Grammatikaufgabe liess es einen Kongruenzfehler stehen.
Fazit: Gutes Deutsch reicht mir nicht
Kolibri ist für agentische Arbeit trainiert, und genau dort überzeugt es weder in meinem Test noch in den Herstellerzahlen selbst. Gutes Deutsch allein rechtfertigt für mich keine 73,55 GiB Speicher für das Hauptmodell. Vorstellbar ist ein eng kontrollierter Dokumentenablauf in einem deutschen Betrieb, der Daten im Haus halten muss und jede Ausgabe prüft.
Dass es ein offenes deutsches Modell unter Apache 2.0 gibt, finde ich gut, und ich verfolge gespannt die nächsten Versionen. Bleibt Kolibri aber dauerhaft zwei bis drei Generationen hinter vergleichbaren offenen Modellen zurück, wird Sprachqualität diesen Abstand, zumindest für mich, kaum aufwiegen.
Selbst testen: drei Blindrunden
Drei Aufgaben zum Ausprobieren: Büro-Humor, eine begründete Stellungnahme und eine Szene mit festen Vorgaben. Jede Karte zeigt vier archivierte Originalantworten anonym als A bis D; nach der Wahl erscheinen die Modellnamen. Die Antwortej sind unverändert, samt Fehlern.
Blindvergleich · Vier Originalantworten
Humor im Sitzungszimmer
Schreibe eine kurze Büroszene mit trockenem Humor: Ein Team hält eine Besprechung darüber ab, wie es die Zahl seiner Besprechungen reduzieren kann. Der Humor soll aus der Situation und den Dialogen entstehen. Höchstens 100 Wörter. Antworte nur mit der Szene.
Blindvergleich · Vier Originalantworten
Was beweist die Vier-Tage-Woche?
Ein Unternehmen testet eine Vier-Tage-Woche bei gleichem Lohn. In einem dreimonatigen Pilotprojekt mit 24 freiwilligen Mitarbeitenden blieb die erledigte Arbeit pro Woche gleich, die gemeldeten Krankheitstage sanken um 20 Prozent, und 19 Teilnehmende berichteten von weniger Stress. Eine Vergleichsgruppe gab es nicht; das Pilotprojekt fiel in eine umsatzschwache Zeit. Die Geschäftsleitung sagt: «Damit ist bewiesen, dass eine Vier-Tage-Woche die Produktivität steigert. Wir sollten sie sofort im ganzen Unternehmen einführen.»
Verfasse eine begründete Stellungnahme in höchstens 120 Wörtern. Unterscheide zwischen Befunden und Schlussfolgerungen und empfehle einen nächsten Schritt. Verwende nur die gegebenen Informationen. Antworte nur mit der Stellungnahme.
Blindvergleich · Vier Originalantworten
Der Brief im leeren Zug
Schreibe eine kurze literarische Szene: Eine Person findet in einem leeren Zug einen Brief, der an sie selbst adressiert ist. Erzähle in der dritten Person und im Präsens. Zeige ihre Beunruhigung durch Handlungen und Wahrnehmungen, ohne Gefühle ausdrücklich zu benennen. Verwende die Wörter «Schlüssel», «Regen» und «morgen» jeweils genau einmal. Die Szene soll höchstens 120 Wörter umfassen und mit einer offenen Frage enden. Antworte nur mit der Szene.
Kolibri-1 auf DGX Spark installieren: vLLM-Rezept
Es braucht ein GB10-System mit NVIDIA-Treiber und Container Toolkit, lädt rund 79 GB, pinnt Image, Snapshot und Plugin 1.0.0 und bindet nur an 127.0.0.1. Die konfigurierten 262.144 Tokens Kontext sind eine Obergrenze, kein geprüfter Langkontextbetrieb.
Bash · Kolibri FP8 · GB10
# DGX Spark / GB10, 128 GB Unified Memory.
# Prerequisites: Docker + NVIDIA Container Toolkit, hf CLI.
# Stop other large inference workloads first. Download: about 79 GB.
# Public adaptation of the measured launch; local-only API binding.
set -eu
hf download Aleph-Alpha/Kolibri-1 \
--revision e52eb4627d11516b0c01de49210ab5a4e4061444
mkdir -p kolibri-spark-cache/triton kolibri-spark-cache/vllm
docker build -t kolibri-spark:20261004 - <<'DOCKERFILE'
FROM ghcr.io/timothystewart6/vllm-gb10@sha256:afc24c0659f28d04477228c4862a695020451add583012819d7712d9fe6e6d47
RUN python3 -m pip install --no-cache-dir --no-deps aleph-alpha-inference==1.0.0
DOCKERFILE
docker run -d --name kolibri-spark --restart=no \
--gpus all --network host --ipc host \
-e HF_HOME=/root/.cache/huggingface \
-e HF_HUB_OFFLINE=1 \
-e TRITON_CACHE_DIR=/root/.cache/triton \
-v "${HF_HOME:-$HOME/.cache/huggingface}:/root/.cache/huggingface:ro" \
-v "$PWD/kolibri-spark-cache/triton:/root/.cache/triton" \
-v "$PWD/kolibri-spark-cache/vllm:/root/.cache/vllm" \
kolibri-spark:20261004 \
vllm serve Aleph-Alpha/Kolibri-1 \
--revision e52eb4627d11516b0c01de49210ab5a4e4061444 \
--served-model-name Aleph-Alpha/Kolibri-1 \
--host 127.0.0.1 --port 8000 \
--tensor-parallel-size 1 --kv-cache-dtype fp8 \
--max-model-len 262144 --gpu-memory-utilization 0.70 \
--max-num-seqs 1 --max-num-batched-tokens 8192 \
--enable-chunked-prefill --enable-prefix-caching \
--enable-prompt-tokens-details \
--reasoning-parser kolibri1 --tool-call-parser kolibri1 \
--enable-auto-tool-choice
# Follow startup; Ctrl-C stops log viewing, not the container.
docker logs -f kolibri-spark
# After the server reports ready:
# curl -fsS http://127.0.0.1:8000/v1/models
# Stop and remove only this container:
# docker stop kolibri-spark && docker rm kolibri-spark
MTP2 mit synchronem Scheduling bringt auf meiner DGX Spark 15 bis 24 Prozent mehr Decode-Durchsatz bei unveränderter Tool-Qualität. Was der KV-Aufschlag kostet und wo die Varianz die Zahl relativiert.
Kann ein lokal betriebener Tool-Agent seine Aufgaben erledigen und trotzdem Anweisungen ignorieren, die in fremden Slack- und Banking-Inhalten stecken? Ein kontrollierter AgentDojo-Lauf mit Qwen 3.8 gibt eine unbequeme Antwort.
Was kann ein abliterated Qwen-Modell autonom leisten, wenn es den vollständigen Lösungsweg selbst finden muss? 39 Cybersecurity-Aufgaben zeigen Fähigkeit, Konvergenz und Grenzen.