Aleph Alpha Kolibri: 78 Milliarden Parameter, Apache 2.0, Deutsch-Schwerpunkt
Aleph Alpha hat Kolibri-1 veröffentlicht: 78,1 Milliarden Parameter, 3,46 Milliarden aktiv pro Token, Deutsch-Schwerpunkt, Apache 2.0. Die FP8-Gewichte brauchen rund 78 GB Speicher, nötig sind GPUs der Rechenzentrumsklasse.

Aleph Alpha hat am 3. Oktober 2026 mit Kolibri-1 ein Sprachmodell mit 78,1 Milliarden Parametern als offene Gewichte veröffentlicht. Es steht unter Apache 2.0 auf Hugging Face und ist auf Deutsch und Englisch ausgelegt. Relevant ist das für Admins, die ein Modell im eigenen Haus betreiben wollen.
Wer nur einen Server mit Consumer-Grafikkarte oder wenig VRAM betreibt, kann Kolibri nach der Modellkarte nicht einfach nachziehen: Allein die FP8-Gewichte belegen rund 78 GB Speicher. Ein akuter Handlungsbedarf besteht nicht, es handelt sich um eine Produktmeldung ohne Sicherheitsbezug. Ein Test lohnt sich dort, wo ohnehin GPU-Server mit 80 GB oder mehr verfügbar sind.
Was ist passiert?
Laut Aleph-Alpha-Blog und Modellkarte erschien Kolibri-1 am 3. Oktober 2026, dem Tag der Deutschen Einheit. Das Modell ist ein Mixture-of-Experts-Transformer: 78,1 Milliarden Parameter insgesamt, davon rechnen pro Token 3,46 Milliarden mit. Die Modellkarte nennt 384 Experten pro Schicht, von denen sechs geroutete plus ein gemeinsamer Experte angesprochen werden.
Der Kontext reicht formal bis 1.048.576 Token. Trainiert wurde der lange Kontext bis 262.144 Token, und genau diese Grenze empfiehlt die Modellkarte für effizientes Serving und komplexe Aufgaben. Das Modell bietet einen Denkmodus mit den Stufen low, medium und high, lässt sich auch ohne Denkphase betreiben und unterstützt Tool Calling.
Trainiert wurde laut Modellkarte mit 20 Billionen Token, rund 23,9 Prozent davon deutsch (der Blogpost nennt 21,3 Prozent, eine Erklärung fehlt). Das Vortraining lief auf 768 NVIDIA B200 in Deutschland und Finnland.
Für wen ist das relevant?
Relevant ist Kolibri für Betriebe und Behörden mit eigener GPU-Infrastruktur, die deutschsprachige Dokumente, Gesetzestexte oder Verwaltungssprache verarbeiten. Aleph Alpha nennt öffentliche Verwaltung, Industrie und Luftfahrt als Zielbereiche.
Weniger relevant ist das Modell für Umgebungen mit einer einzelnen Consumer-GPU, für reine Cloud-Nutzer und für Teams, die Qualität bei Faktenwissen und Werkzeugaufrufen priorisieren. Dort zeigen die Herstellertabellen Schwächen, wie unten beschrieben.
Hardware, Lizenz und Betrieb
- Speicher: Die FP8-Gewichte belegen etwa 78 GB. Das Mixture-of-Experts-Verfahren spart Rechenzeit pro Token, nicht aber Speicher, weil alle Experten geladen sein müssen.
- Mindesthardware laut Modellkarte: 2x A100 80 GB, 2x H100 SXM5, 1x H200, 1x B200 oder 1x B300. Empfohlen werden 2x H100 SXM5, 2x H200, 1x B200 oder 1x B300. Die Karte nennt keine Consumer-Grafikkarten.
- Serving: Nötig ist das Paket
aleph-alpha-inferencemit einem Kolibri-Plugin für vLLM. Es gibt ein Container-Image unterghcr.io/aleph-alpha/aleph-alpha-inference. Ob andere Laufzeiten wie Ollama das Modell unterstützen, geht aus den gelesenen Quellen nicht hervor. - Lizenz: Apache 2.0 für Gewichte und Konfigurationsdateien, auch kommerziell nutzbar. Die Karte stellt klar, dass die Lizenz nicht für Code, Architektur, Parametereinstellungen oder Trainingsmethode gilt.
- Nutzungshinweise: Nachgelagerte KI-Systeme müssen laut Karte die KI-Verordnung (EU) 2024/1689 einhalten.
Wie gut ist das Modell?
Alle Vergleichswerte stammen von Aleph Alpha selbst und sind nicht unabhängig geprüft. Laut Blogspan, das die Tabelle der Modellkarte auswertet, liegt Kolibri im Gesamtwert bei 75,5 Punkten auf Englisch und 70,8 auf Deutsch, nur ein bis zwei Punkte vor Qwen3.5 35B-A3B und GPT-OSS 120B. Stark ist Kolibri laut Aleph Alpha bei Mathematik (AIME 2025: 96,9) und Code (LiveCodeBench v6: 85,9).
Schwächer sind Werkzeugaufrufe (BFCL v4: 61,4 gegen 67,2 bei Qwen3.6-35B-A3B im Blog) und Faktenwissen.
Datenschutz und DSGVO
Aleph Alpha betont, dass Kolibri kompakt genug für den Betrieb im eigenen Haus sei, ohne interne Daten an externe Inferenzdienste zu senden. Das ist ein Vorteil für den Datenschutz, ersetzt aber keine Prüfung: Auftragsverarbeitung, Rechtsgrundlage, Protokollierung und Zugriffsrechte bleiben Aufgaben des Betreibers. Eine DSGVO-Konformität des Modells selbst belegen die gelesenen Quellen nicht. Die Modellkarte rät zudem von unbeaufsichtigtem Einsatz in sensiblen Umgebungen ab.
Was sollten Admins jetzt tun?
- Inventar prüfen: Welche GPU-Server mit mindestens 80 GB nutzbarem VRAM (2x A100 80 GB, H100, H200, B200) stehen frei zur Verfügung, und wie viel Speicher bleibt neben Kontext und KV-Cache?
- Einen isolierten Testlauf mit dem vLLM-Container von Aleph Alpha planen, nicht in der Produktivumgebung.
- Mit eigenen deutschen Dokumenten testen und gegen das bisher genutzte Modell vergleichen, statt Herstellertabellen zu vertrauen.
- Kontextlänge bewusst begrenzen: Die Modellkarte empfiehlt höchstens 262.144 Token.
- Datenschutzbeauftragte früh einbinden, bevor interne Dokumente an das Modell gehen.
Einordnung für Unternehmen
Kolibri ist eine ernstzunehmende Option für deutschsprachige Dokumentenverarbeitung, aber kein Modell für kleine Server. Der Betrieb setzt GPU-Hardware der Rechenzentrumsklasse voraus. Für viele kleine Unternehmen bleibt ein kleineres Modell oder ein Dienst mit Auftragsverarbeitungsvertrag wirtschaftlicher. Unabhängige Tests stehen noch aus.
Passende Anleitungen auf S-EDV
- Offene LLMs mit vLLM selbst hosten: Grundlagen für den Betrieb, auf dem auch Kolibri aufsetzt.
- Ollama-Modelle nach VRAM und Quantisierung auswählen: Hilfe bei der Abschätzung des Speicherbedarfs.
- EU AI Act: Compliance-Roadmap für KMU: Pflichten beim Einsatz von KI-Systemen im Unternehmen.
Quellen
- Aleph Alpha: Blogpost zur Veröffentlichung von Kolibri (3. Oktober 2026)
- Hugging Face: Modellkarte Kolibri-1 mit Lizenz und Hardwareangaben
- Blogspan: Einordnung der Messwerte (4. Oktober 2026)
- All-AI: Bericht zu Tokenizer und Verfügbarkeit (4. Oktober 2026)
- Golem: Meldung zur Veröffentlichung von Kolibri


