Aleph Alpha lance Kolibri, un LLM germano-anglais souverain
Aleph Alpha a lancé Kolibri, un modèle mixture-of-experts à poids ouverts entraîné en Europe. Il privilégie la souveraineté des données et le traitement efficace de la langue allemande pour les déploiements auto-hébergés.
Traduit automatiquement depuis l’original en anglais.
Aleph Alpha a publié Kolibri 1 le 3 octobre 2026, introduisant un nouveau grand modèle de langage (LLM) à poids ouverts conçu spécifiquement pour les tâches en allemand et en anglais. Conçu dans une optique de souveraineté des données européennes et de conformité réglementaire, ce modèle offre aux organisations un moyen d'exécuter une infrastructure IA avancée sans dépendre de services ou de fournisseurs cloud contrôlés par l'étranger.
Ce qui s'est passé
Kolibri est un modèle mixture-of-experts contenant 78,1 milliards de paramètres au total, bien qu'il n'en active que environ 3,46 milliards par token lors de l'inférence. Cette architecture lui permet d'offrir des performances élevées tout en maintenant une efficacité computationnelle comparable à celle de modèles beaucoup plus petits. Les poids sont disponibles sous licence Apache 2.0 sur Hugging Face, mais Aleph Alpha conserve les droits sur le code d'entraînement sous-jacent et les méthodes utilisées.
Le modèle a été entraîné depuis zéro en utilisant environ 24 billions de tokens, dont plus d'un cinquième du jeu de données constituait du texte en allemand. L'entraînement s'est déroulé entièrement sur une infrastructure située en Allemagne et en Finlande, garantissant le respect des lois européennes et allemandes. Aleph Alpha décrit cette approche comme souveraine, ce qui signifie que les clients bénéficient d'une liberté totale de déploiement et d'une sécurité de la propriété intellectuelle, la conformité étant traitée comme une propriété inhérente au système.
Bien que l'entraînement principal ait été local, le processus a intégré certains outils externes. Le texte web en anglais a été reformulé à l'aide de Gemma 4 de Google, le texte allemand avec Mistral-NeMo, et Qwen3-32B a été utilisé pour étiqueter les données dans les filtres de qualité. L'équipe a également filtré les données d'entraînement pour réduire les biais politiques, une étape qu'ils ont notée comme étant informée par leurs propres mesures des biais dans les modèles chinois ouverts.
Détails clés
- Architecture : 78,1 milliards de paramètres totaux avec 384 experts par couche ; chaque token active 6 experts plus un expert partagé.
- Exigences mémoire : Environ 78 Go de mémoire GPU sont nécessaires pour stocker les poids au format virgule flottante 8 bits.
- Fenêtre de contexte : Prend nativement en charge 262 144 tokens et a été testée jusqu'à 1 048 576 tokens en utilisant l'attention à fenêtre glissante.
- Langues : Optimisé exclusivement pour l'allemand et l'anglais, avec un tokenizer spécialisé qui réduit le nombre de tokens allemands de 11,2 % par rapport à GPT-5.
- Raisonnement : Offre quatre niveaux d'effort de raisonnement (aucun, faible, moyen, élevé) et obtient de bons résultats dans les benchmarks mathématiques en allemand.
- Licence : Apache 2.0 pour les poids et les fichiers de configuration, permettant l'utilisation commerciale et la modification.
Contexte
Les modèles mixture-of-experts (MoE) diffèrent des modèles denses traditionnels en divisant les couches du réseau neuronal en plusieurs sous-réseaux plus petits, appelés experts. Un mécanisme de routage ne sélectionne que quelques-uns de ces experts pour traiter chaque token spécifique, plutôt que d'activer l'ensemble du réseau pour chaque opération. Cette conception permet aux modèles MoE d'augmenter le nombre de paramètres pour la rétention de connaissances tout en maintenant un calcul actif faible, simulant efficacement la vitesse d'un modèle plus petit avec la capacité d'un modèle plus grand.
L'IA souveraine fait référence à la capacité d'une nation ou d'une organisation à contrôler sa propre infrastructure d'intelligence artificielle, y compris le stockage des données, l'entraînement des modèles et l'inférence. Ce concept a gagné du terrain en Europe en raison de réglementations telles que l'AI Act de l'UE, qui mettent l'accent sur la confidentialité et la gestion des données. En hébergeant localement les modèles sur des serveurs privés, les organisations s'assurent que les données sensibles ne quittent jamais leur contrôle physique, atténuant ainsi les risques associés aux fournisseurs cloud tiers ou aux juridictions étrangères.
Pourquoi c'est important
Pour les équipes exécutant des logiciels auto-hébergés, Kolibri fournit une alternative viable aux grands modèles de langage dominés par les États-Unis qui peuvent ne pas être conformes aux strictes réglementations européennes sur les données. La conception du modèle permet aux ministères, aux fournisseurs automobiles et à d'autres entités réglementées de déployer des capacités d'IA avancées sur site. Cette configuration garantit que les documents propriétaires et les données clients restent dans l'environnement sécurisé de l'organisation, répondant aux principales préoccupations concernant les fuites de données et les amendes réglementaires.
L'efficacité du modèle dans le traitement du texte allemand est particulièrement significative pour les entreprises opérant dans les régions DACH. Les tokenizers standards cassent souvent les mots composés allemands en fragments inefficaces, augmentant la charge computationnelle et réduisant l'efficacité de la fenêtre de contexte. Le tokenizer spécialisé de Kolibri gère ces structures linguistiques nativement, permettant à plus de contenu de tenir dans la même fenêtre de contexte et réduisant le coût par token pour les applications en langue allemande.
Cependant, les exigences matérielles constituent une barrière pour les petites équipes. Nécessiter 78 Go de mémoire GPU signifie que le matériel standard pour consommateurs est insuffisant, nécessitant des GPUs de niveau centre de données comme les NVIDIA A100 ou H200. De plus, la performance moindre du modèle dans les appels d'outils multi-tours et les tâches de codage suggère qu'il est mieux adapté à l'analyse de documents et au raisonnement plutôt qu'aux flux de travail d'agents autonomes.
Ce que vous pouvez faire
- Évaluez votre infrastructure GPU actuelle pour déterminer si vous disposez d'au moins 78 Go de VRAM disponibles pour les poids du modèle.
- Testez le tokenizer de Kolibri sur vos documents juridiques ou techniques allemands spécifiques pour quantifier les économies de tokens par rapport à votre pile technologique actuelle.
- Implémentez des pipelines de génération augmentée par récupération (RAG), car Kolibri est entraîné à admettre lorsqu'il manque d'informations plutôt qu'à halluciner des réponses.
- Configurez le paramètre d'effort de raisonnement en fonction de la complexité de la tâche, en utilisant un effort faible pour les recherches simples et un effort élevé pour les analyses complexes.
- Surveillez les mises à jour du plugin vLLM d'Aleph Alpha, car le modèle nécessite actuellement des versions spécifiques du moteur d'inférence pour des performances optimales.
- Envisagez des déploiements hybrides où Kolibri gère les requêtes documentaires en allemand/anglais tandis que d'autres modèles prennent en charge le codage ou les tâches multilingues.



