Aleph Alpha veröffentlicht Kolibri, ein souveränes deutsch-englisches LLM
Aleph Alpha hat Kolibri vorgestellt, ein Open-Weight-Mixture-of-Experts-Modell, das in Europa trainiert wurde. Es legt Wert auf Datensouveränität und effiziente deutsche Sprachverarbeitung für Self-Hosted-Bereitstellungen.
Automatisch aus dem englischen Original übersetzt.
Aleph Alpha hat am 3. Oktober 2026 Kolibri 1 veröffentlicht und damit ein neues Open-Weight-Large-Language-Model eingeführt, das speziell für Aufgaben in Deutsch und Englisch entwickelt wurde. Das Modell wurde unter Berücksichtigung europäischer Datensouveränität und regulatorischer Compliance konzipiert und bietet Organisationen die Möglichkeit, fortschrittliche KI-Infrastrukturen zu betreiben, ohne von ausländisch kontrollierten Diensten oder Cloud-Anbietern abhängig zu sein.
Was passiert ist
Kolibri ist ein Mixture-of-Experts-Modell mit insgesamt 78,1 Milliarden Parametern, aktiviert jedoch während der Inferenz nur etwa 3,46 Milliarden Parameter pro Token. Diese Architektur ermöglicht hohe Leistung bei einer Rechen-Effizienz, die mit deutlich kleineren Modellen vergleichbar ist. Die Gewichte sind unter der Apache-2.0-Lizenz auf Hugging Face verfügbar, wobei Aleph Alpha die Rechte am zugrunde liegenden Trainingscode und den Methoden behält.
Das Modell wurde von Grund auf neu trainiert, basierend auf ungefähr 24 Billionen Tokens, wobei mehr als ein Fünftel des Datensatzes aus deutschen Texten besteht. Das Training fand vollständig auf Infrastruktur statt, die sich in Deutschland und Finnland befindet, um die Einhaltung europäischer und deutscher Gesetze sicherzustellen. Aleph Alpha beschreibt diesen Ansatz als „souverän“, was bedeutet, dass Kunden volle Freiheit bei der Bereitstellung und Sicherheit des geistigen Eigentums erhalten, wobei Compliance als inhärente Eigenschaft des Systems behandelt wird.
Während das Kerntraining lokal stattfand, wurden im Prozess einige externe Tools integriert. Englische Webtexte wurden mit Googles Gemma 4 umformuliert, deutsche Texte mit Mistral-NeMo, und Qwen3-32B wurde zur Beschriftung von Daten in Qualitätsfiltern verwendet. Das Team filterte auch die Trainingsdaten, um politische Verzerrungen zu reduzieren – ein Schritt, der laut eigenen Messungen der Voreingenommenheit in chinesischen Open-Modellen begründet war.
Wichtige Details
- Architektur: 78,1 Milliarden Gesamtparameter mit 384 Experten pro Ebene; jedes Token aktiviert 6 Experten plus einen gemeinsamen Experten.
- Speicheranforderungen: Etwa 78 GB GPU-Speicher sind erforderlich, um die Gewichte im 8-Bit-Gleitkommaformat zu halten.
- Kontextfenster: Unterstützt nativ 262.144 Tokens und wurde bis zu 1.048.576 Tokens getestet, indem Sliding-Window-Attention verwendet wurde.
- Sprachen: Ausschließlich für Deutsch und Englisch optimiert, mit einem spezialisierten Tokenizer, der die Anzahl der deutschen Tokens im Vergleich zu GPT-5 um 11,2 % reduziert.
- Reasoning: Bietet vier Stufen des Reasoning-Aufwands (keiner, niedrig, mittel, hoch) und zeigt starke Leistungen in deutschen mathematischen Benchmarks.
- Lizenz: Apache 2.0 für Gewichte und Konfigurationsdateien, was kommerzielle Nutzung und Modifikation erlaubt.
Hintergrund
Mixture-of-Experts-Modelle (MoE) unterscheiden sich von traditionellen dichten Modellen dadurch, dass sie die Schichten des neuronalen Netzwerks in mehrere kleinere Subnetzwerke, sogenannte Experten, aufteilen. Ein Router-Mechanismus wählt nur wenige dieser Experten aus, um jedes spezifische Token zu verarbeiten, anstatt das gesamte Netzwerk für jede Operation zu aktivieren. Dieses Design ermöglicht es MoE-Modellen, die Parameteranzahl für die Wissensspeicherung zu skalieren, während die aktive Berechnung gering bleibt, wodurch effektiv die Geschwindigkeit eines kleineren Modells mit der Kapazität eines größeren Modells simuliert wird.
Sovereign AI bezieht sich auf die Fähigkeit einer Nation oder Organisation, ihre eigene künstliche Intelligenz-Infrastruktur zu kontrollieren, einschließlich Datenspeicherung, Modelltraining und Inferenz. Dieses Konzept hat in Europa aufgrund von Regulierungen wie dem EU AI Act, die Datenschutz und Verantwortung betonen, an Bedeutung gewonnen. Durch das lokale Hosting von Modellen auf privaten Servern stellen Organisationen sicher, dass sensible Daten niemals ihren physischen Kontrollebereich verlassen, und mildern so Risiken im Zusammenhang mit Drittanbieter-Cloud-Diensten oder ausländischen Jurisdiktionen.
Warum es wichtig ist
Für Teams, die Self-Hosted-Software betreiben, bietet Kolibri eine tragfähige Alternative zu US-dominierten Large Language Models, die möglicherweise nicht mit strengen europäischen Datenvorschriften konform sind. Das Design des Modells ermöglicht es Ministerien, Automobilzulieferern und anderen regulierten Entitäten, fortschrittliche KI-Funktionen on-premises bereitzustellen. Diese Einrichtung stellt sicher, dass proprietäre Dokumente und Kundendaten innerhalb der sicheren Umgebung der Organisation bleiben und adressiert zentrale Bedenken hinsichtlich Datenlecks und regulatorischer Bußgelder.
Die Effizienz des Modells bei der Verarbeitung deutscher Texte ist besonders signifikant für Unternehmen, die in der DACH-Region tätig sind. Standard-Tokenizer zerlegen deutsche Komposita oft in ineffiziente Fragmente, was die Rechenlast erhöht und die Wirksamkeit des Kontextfensters verringert. Der spezialisierte Tokenizer von Kolibri behandelt diese linguistischen Strukturen nativ, sodass mehr Inhalte in dasselbe Kontextfenster passen und die Kosten pro Token für deutschsprachige Anwendungen sinken.
Allerdings stellen die Hardware-Anforderungen eine Hürde für kleinere Teams dar. Die Notwendigkeit von 78 GB GPU-Speicher bedeutet, dass Standard-Consumer-Hardware unzureichend ist, was datenzentrumstaugliche GPUs wie NVIDIA A100s oder H200s erfordert. Darüber hinaus deutet die schwächere Leistung des Modells bei Multi-Turn-Tool-Calling und Coding-Aufgaben darauf hin, dass es am besten für Dokumentanalyse und Reasoning geeignet ist, weniger für autonome Agent-Workflows.
Was Sie tun können
- Bewerten Sie Ihre aktuelle GPU-Infrastruktur, um festzustellen, ob mindestens 78 GB VRAM für die Modellgewichte verfügbar sind.
- Testen Sie den Tokenizer von Kolibri auf Ihre spezifischen deutschen juristischen oder technischen Dokumente, um die Token-Einsparungen im Vergleich zu Ihrem aktuellen Stack zu quantifizieren.
- Implementieren Sie Retrieval-Augmented-Generation-Pipelines, da Kolibri darauf trainiert ist, zuzugeben, wenn ihm Informationen fehlen, anstatt Antworten zu halluzinieren.
- Konfigurieren Sie den Reasoning-Effort-Parameter basierend auf der Aufgabenkomplexität, verwenden Sie niedrigen Aufwand für einfache Nachschlagen und hohen Aufwand für komplexe Analysen.
- Verfolgen Sie die Updates zum vLLM-Plugin von Aleph Alpha, da dies für die optimale Integration relevant ist.



