AI & mô hình ngôn ngữ

Aleph Alpha ra mắt Kolibri, mô hình LLM tiếng Đức-Anh có chủ quyền

Aleph Alpha đã ra mắt Kolibri, một mô hình hỗn hợp chuyên gia (mixture-of-experts) với trọng số mở được huấn luyện tại châu Âu. Mô hình này ưu tiên tính toàn vẹn dữ liệu và xử lý ngôn ngữ tiếng Đức hiệu quả cho các triển khai tự quản lý (self-hosted).

Ảnh xem trước DocBento

Bài được dịch tự động từ bản gốc tiếng Anh.

Aleph Alpha đã phát hành Kolibri 1 vào ngày 3 tháng 10 năm 2026, giới thiệu một mô hình ngôn ngữ lớn mới với trọng số mở, được thiết kế đặc biệt cho các tác vụ bằng tiếng Đức và tiếng Anh. Được xây dựng với sự chú trọng đến tính toàn vẹn dữ liệu của châu Âu và tuân thủ quy định pháp luật, mô hình này cung cấp cho các tổ chức cách thức vận hành cơ sở hạ tầng AI tiên tiến mà không cần phụ thuộc vào các dịch vụ hoặc nhà cung cấp đám mây do nước ngoài kiểm soát.

Diễn biến chính

Kolibri là một mô hình hỗn hợp chuyên gia chứa tổng cộng 78,1 tỷ tham số, mặc dù chỉ kích hoạt khoảng 3,46 tỷ tham số mỗi token trong quá trình suy luận. Kiến trúc này cho phép mô hình đạt hiệu suất cao trong khi vẫn duy trì hiệu quả tính toán tương đương với các mô hình nhỏ hơn nhiều. Các trọng số có sẵn theo giấy phép Apache 2.0 trên Hugging Face, nhưng Aleph Alpha giữ lại quyền đối với mã nguồn huấn luyện và các phương pháp nền tảng.

Mô hình được huấn luyện từ đầu sử dụng khoảng 24 nghìn tỷ token, với hơn một phần năm tập dữ liệu bao gồm văn bản tiếng Đức. Quá trình huấn luyện diễn ra hoàn toàn trên cơ sở hạ tầng đặt tại Đức và Phần Lan, đảm bảo tuân thủ luật pháp châu Âu và Đức. Aleph Alpha mô tả cách tiếp cận này là "có chủ quyền", nghĩa là khách hàng có toàn quyền tự do triển khai và an toàn về sở hữu trí tuệ, với việc tuân thủ quy định được xem như một thuộc tính kế thừa của hệ thống.

Mặc dù quá trình huấn luyện cốt lõi diễn ra nội bộ, quy trình này vẫn kết hợp một số công cụ bên ngoài. Văn bản web tiếng Anh được viết lại bằng Google’s Gemma 4, văn bản tiếng Đức dùng Mistral-NeMo, và Qwen3-32B được sử dụng để gán nhãn dữ liệu trong các bộ lọc chất lượng. Nhóm cũng đã lọc dữ liệu huấn luyện để giảm thiểu thiên kiến chính trị, một bước mà họ lưu ý rằng dựa trên các phép đo của chính họ về thiên kiến trong các mô hình mở của Trung Quốc.

Chi tiết quan trọng

  • Kiến trúc: Tổng cộng 78,1 tỷ tham số với 384 chuyên gia mỗi lớp; mỗi token kích hoạt 6 chuyên gia cộng thêm một chuyên gia chia sẻ.
  • Yêu cầu bộ nhớ: Cần khoảng 78 GB bộ nhớ GPU để lưu trữ các trọng số ở định dạng dấu phẩy động 8-bit.
  • Cửa sổ ngữ cảnh: Hỗ trợ gốc 262.144 token và đã được thử nghiệm lên đến 1.048.576 token bằng cơ chế attention cửa sổ trượt.
  • Ngôn ngữ: Tối ưu hóa độc quyền cho tiếng Đức và tiếng Anh, với một tokenizer chuyên biệt giúp giảm số lượng token tiếng Đức đi 11,2% so với GPT-5.
  • Lập luận: Cung cấp bốn mức độ nỗ lực lập luận (không, thấp, trung bình, cao) và thể hiện hiệu suất mạnh mẽ trong các bài kiểm tra toán học bằng tiếng Đức.
  • Giấy phép: Apache 2.0 cho các trọng số và tệp cấu hình, cho phép sử dụng thương mại và chỉnh sửa.

Bối cảnh

Các mô hình hỗn hợp chuyên gia (MoE) khác biệt so với các mô hình dày đặc (dense models) truyền thống bằng cách chia các lớp mạng nơ-ron thành nhiều mạng con nhỏ hơn, gọi là các chuyên gia. Một cơ chế định tuyến chọn chỉ vài chuyên gia trong số đó để xử lý từng token cụ thể, thay vì kích hoạt toàn bộ mạng cho mỗi thao tác. Thiết kế này cho phép các mô hình MoE mở rộng số lượng tham số để lưu giữ kiến thức trong khi giữ mức tính toán hoạt động thấp, thực chất mô phỏng tốc độ của một mô hình nhỏ hơn với năng lực của một mô hình lớn hơn.

AI có chủ quyền đề cập đến khả năng của một quốc gia hoặc tổ chức kiểm soát cơ sở hạ tầng trí tuệ nhân tạo của riêng mình, bao gồm lưu trữ dữ liệu, huấn luyện mô hình và suy luận. Khái niệm này đã thu hút sự chú ý ở châu Âu do các quy định như Đạo luật AI của EU, nhấn mạnh vào quyền riêng tư và quản lý dữ liệu. Bằng cách lưu trữ mô hình cục bộ trên các máy chủ riêng, các tổ chức đảm bảo rằng dữ liệu nhạy cảm không bao giờ rời khỏi phạm vi kiểm soát vật lý của họ, giảm thiểu rủi ro liên quan đến các nhà cung cấp đám mây bên thứ ba hoặc quyền tài phán nước ngoài.

Tại sao điều này quan trọng

Đối với các nhóm chạy phần mềm tự quản lý, Kolibri cung cấp một giải pháp thay thế khả thi cho các mô hình ngôn ngữ lớn thống trị bởi Mỹ, vốn có thể không tuân thủ các quy định nghiêm ngặt về dữ liệu của châu Âu. Thiết kế của mô hình cho phép các bộ, nhà cung cấp ô tô và các thực thể chịu quy định khác triển khai các khả năng AI tiên tiến ngay tại chỗ (on-premises). Cấu hình này đảm bảo rằng các tài liệu độc quyền và dữ liệu khách hàng vẫn nằm trong môi trường an toàn của tổ chức, giải quyết những lo ngại chính về rò rỉ dữ liệu và tiền phạt vi phạm quy định.

Hiệu quả của mô hình trong việc xử lý văn bản tiếng Đức đặc biệt quan trọng đối với các doanh nghiệp hoạt động tại khu vực DACH (Đức, Áo, Thụy Sĩ). Các tokenizer tiêu chuẩn thường phá vỡ các từ ghép tiếng Đức thành các mảnh vụn kém hiệu quả, làm tăng tải tính toán và giảm hiệu quả của cửa sổ ngữ cảnh. Tokenizer chuyên biệt của Kolibri xử lý các cấu trúc ngôn ngữ này một cách tự nhiên, cho phép nhiều nội dung hơn phù hợp trong cùng một cửa sổ ngữ cảnh và giảm chi phí mỗi token cho các ứng dụng ngôn ngữ tiếng Đức.

Tuy nhiên, yêu cầu phần cứng tạo ra rào cản cho các nhóm nhỏ hơn. Việc đòi hỏi 78 GB bộ nhớ GPU có nghĩa là phần cứng tiêu dùng thông thường không đủ, necessitating các GPU cấp trung tâm dữ liệu như NVIDIA A100s hoặc H200s. Ngoài ra, hiệu suất yếu hơn của mô hình trong các tác vụ gọi công cụ đa vòng và lập trình cho thấy nó phù hợp nhất với phân tích tài liệu và lập luận hơn là các quy trình làm việc agent tự động.

Bạn có thể làm gì

  • Đánh giá cơ sở hạ tầng GPU hiện tại của bạn để xác định xem bạn có ít nhất 78 GB VRAM khả dụng cho các trọng số mô hình hay không.
  • Kiểm tra tokenizer của Kolibri trên các tài liệu pháp lý hoặc kỹ thuật tiếng Đức cụ thể của bạn để định lượng mức tiết kiệm token so với stack hiện tại.
  • Triển khai các pipeline sinh xuất tăng cường truy xuất (retrieval-augmented generation), vì Kolibri được huấn luyện để thừa nhận khi thiếu thông tin thay vì bịa đặt câu trả lời.
  • Cấu hình tham số nỗ lực lập luận dựa trên độ phức tạp của tác vụ, sử dụng mức thấp cho các tra cứu đơn giản và mức cao cho phân tích phức tạp.
  • Theo dõi các bản cập nhật plugin vLLM của Aleph Alpha, vì mô hình này được tối ưu hóa tốt nhất khi sử dụng qua plugin này.

Tin khác

Tất cả tin