Aleph Alpha lanza Kolibri, un LLM soberano en alemán e inglés
Aleph Alpha ha presentado Kolibri, un modelo de pesos abiertos y arquitectura de mezcla de expertos (MoE) entrenado en Europa. Prioriza la soberanía de los datos y el procesamiento eficiente del idioma alemán para despliegues autoalojados.
Traducido automáticamente del original en inglés.
Aleph Alpha lanzó Kolibri 1 el 3 de octubre de 2026, introduciendo un nuevo gran modelo de lenguaje (LLM) de pesos abiertos diseñado específicamente para tareas en alemán e inglés. Concebido con la soberanía de los datos europeos y el cumplimiento normativo en mente, el modelo ofrece a las organizaciones una forma de ejecutar infraestructura de IA avanzada sin depender de servicios o proveedores de nube controlados por entidades extranjeras.
Qué ha ocurrido
Kolibri es un modelo de mezcla de expertos que contiene 78.100 millones de parámetros totales, aunque solo activa aproximadamente 3.460 millones por token durante la inferencia. Esta arquitectura le permite ofrecer un alto rendimiento manteniendo una eficiencia computacional comparable a la de modelos mucho más pequeños. Los pesos están disponibles bajo la licencia Apache 2.0 en Hugging Face, pero Aleph Alpha conserva los derechos sobre el código de entrenamiento subyacente y los métodos utilizados.
El modelo fue entrenado desde cero utilizando aproximadamente 24 billones de tokens, con más de una quinta parte del conjunto de datos compuesta por texto en alemán. El entrenamiento se realizó íntegramente en infraestructura ubicada en Alemania y Finlandia, garantizando el cumplimiento de las leyes europeas y alemanas. Aleph Alpha describe este enfoque como soberano, lo que significa que los clientes obtienen plena libertad de despliegue y seguridad de propiedad intelectual, tratando el cumplimiento normativo como una propiedad inherente al sistema.
Si bien el entrenamiento principal fue local, el proceso incorporó algunas herramientas externas. El texto web en inglés fue reformulado utilizando Gemma 4 de Google, el texto en alemán con Mistral-NeMo, y Qwen3-32B se usó para etiquetar datos en filtros de calidad. El equipo también filtró los datos de entrenamiento para reducir el sesgo político, un paso que, según señalaron, se basó en sus propias mediciones de sesgo en modelos abiertos chinos.
Detalles clave
- Arquitectura: 78.100 millones de parámetros totales con 384 expertos por capa; cada token activa 6 expertos más uno compartido.
- Requisitos de memoria: Se requieren aproximadamente 78 GB de memoria GPU para almacenar los pesos en formato de punto flotante de 8 bits.
- Ventana de contexto: Soporta nativamente 262.144 tokens y ha sido probada hasta 1.048.576 tokens utilizando atención de ventana deslizante.
- Idiomas: Optimizado exclusivamente para alemán e inglés, con un tokenizador especializado que reduce el conteo de tokens en alemán en un 11,2% en comparación con GPT-5.
- Razonamiento: Ofrece cuatro niveles de esfuerzo de razonamiento (ninguno, bajo, medio, alto) y muestra un sólido desempeño en benchmarks matemáticos en alemán.
- Licencia: Apache 2.0 para los pesos y archivos de configuración, permitiendo el uso comercial y la modificación.
Contexto
Los modelos de mezcla de expertos (MoE) difieren de los modelos densos tradicionales al dividir las capas de la red neuronal en múltiples subredes más pequeñas, conocidas como expertos. Un mecanismo de enrutador selecciona solo unos pocos de estos expertos para procesar cada token específico, en lugar de activar toda la red para cada operación. Este diseño permite a los modelos MoE escalar el número de parámetros para la retención de conocimiento mientras mantienen baja la computación activa, simulando efectivamente la velocidad de un modelo más pequeño con la capacidad de uno mayor.
La IA soberana se refiere a la capacidad de una nación u organización para controlar su propia infraestructura de inteligencia artificial, incluyendo el almacenamiento de datos, el entrenamiento de modelos y la inferencia. Este concepto ha ganado tracción en Europa debido a regulaciones como la Ley de IA de la UE, que enfatizan la privacidad y la custodia de los datos. Al alojar modelos localmente en servidores privados, las organizaciones aseguran que los datos sensibles nunca salgan de su control físico, mitigando los riesgos asociados con proveedores de nube de terceros o jurisdicciones extranjeras.
Por qué importa
Para los equipos que ejecutan software autoalojado, Kolibri proporciona una alternativa viable a los grandes modelos de lenguaje dominados por EE. UU., que pueden no cumplir con las estrictas regulaciones europeas de datos. El diseño del modelo permite a ministerios, proveedores automotrices y otras entidades reguladas desplegar capacidades avanzadas de IA in situ. Esta configuración garantiza que los documentos propietarios y los datos de los clientes permanezcan dentro del entorno seguro de la organización, abordando preocupaciones clave sobre fugas de datos y multas regulatorias.
La eficiencia del modelo en el procesamiento de texto alemán es particularmente significativa para empresas que operan en las regiones DACH. Los tokenizadores estándar a menudo dividen las palabras compuestas alemanas en fragmentos ineficientes, aumentando la carga computacional y reduciendo la eficacia de la ventana de contexto. El tokenizador especializado de Kolibri maneja estas estructuras lingüísticas de forma nativa, permitiendo que más contenido quepa en la misma ventana de contexto y reduciendo el costo por token para aplicaciones en idioma alemán.
Sin embargo, los requisitos de hardware representan una barrera para equipos más pequeños. Requerir 78 GB de memoria GPU significa que el hardware de consumo estándar es insuficiente, siendo necesarias GPUs de grado de centro de datos como las NVIDIA A100 o H200. Además, el menor rendimiento del modelo en llamadas a herramientas multi-turno y tareas de codificación sugiere que está mejor adaptado para el análisis de documentos y el razonamiento, en lugar de flujos de trabajo de agentes autónomos.
Qué puedes hacer
- Evalúa tu infraestructura GPU actual para determinar si tienes al menos 78 GB de VRAM disponible para los pesos del modelo.
- Prueba el tokenizador de Kolibri en tus documentos legales o técnicos específicos en alemán para cuantificar el ahorro de tokens en comparación con tu stack actual.
- Implementa pipelines de generación aumentada por recuperación (RAG), ya que Kolibri está entrenado para admitir cuando carece de información en lugar de alucinar respuestas.
- Configura el parámetro de esfuerzo de razonamiento según la complejidad de la tarea, usando un esfuerzo bajo para búsquedas simples y uno alto para análisis complejos.
- Monitoriza las actualizaciones del plugin vLLM de Aleph Alpha, ya que el modelo actualmente requiere versiones específicas del motor de inferencia.



