Các giải pháp mã nguồn mở thay thế Jev cho mô hình ra quyết định tự lưu trữ
Năm dự án mã nguồn mở tái tạo giao diện Jev của TypeSafe cho các quyết định AI tự lưu trữ, mang lại độ trễ thấp hơn và chi phí giảm nhưng độ chính xác biến đổi so với phiên bản gốc được lưu trữ.
Bài được dịch tự động từ bản gốc tiếng Anh.
TypeSafe đã phát hành Jev, một mô hình AI mã nguồn đóng dành cho việc ra quyết định có cấu trúc, vào ngày 15 tháng 9 năm 2026. Chỉ trong vài ngày, cộng đồng mã nguồn mở đã tạo ra nhiều bản sao tái hiện hợp đồng API của nó trong khi chạy cục bộ trên hạ tầng riêng tư. Các công cụ mới này cho phép nhà phát triển thay thế các cuộc gọi dịch vụ lưu trữ bằng các instance tự quản lý, đánh đổi một phần độ chính xác sẵn có để lấy quyền kiểm soát và giảm độ trễ.
Chuyện gì đã xảy ra
Jev được thiết kế để xử lý các quyết định phần mềm lặp đi lặp lại, chẳng hạn như định tuyến ticket hỗ trợ hoặc gắn cờ mức độ nghiêm trọng của tin nhắn, mà không tạo ra những đoạn văn bản thừa thãi. Thay vì xuất ra văn bản cần phải phân tích ngược lại thành mã, nó xuất dữ liệu có cấu trúc như lựa chọn, điểm số hoặc xác suất trong một lần xử lý duy nhất. TypeSafe giữ kín mô hình và lưu trữ sau danh sách chờ (waitlist), điều này ngay lập tức thúc đẩy các nhà phát triển độc lập tái tạo giao diện công khai của nó bằng cách sử dụng các mô hình có trọng số mở (open-weight models).
Tính đến ngày 19 tháng 9 năm 2026, AINews đã đếm được sáu bản sao, và danh sách theo dõi awesome-jev hiện đang giám sát hơn một tá dự án. Bản triển khai phổ biến nhất, Laya, đã thu hút hơn 19.000 ngôi sao GitHub, với hàng nghìn ngôi sao được thêm chỉ trong một ngày. Các dự án này khác nhau về phương pháp tiếp cận, từ các mô hình nhỏ được tinh chỉnh (fine-tuned) đến các phương pháp đọc trực tiếp xác suất từ các mô hình ngôn ngữ lớn hiện có mà không cần huấn luyện bổ sung.
Sự gia tăng nhanh chóng của các công cụ này nhấn mạnh nhu cầu về các động cơ ra quyết định cục bộ, độ trễ thấp. Trong khi mô hình Jev gốc vẫn là độc quyền, đặc tả API của nó được công khai, cho phép các nhà phát triển xây dựng các hệ thống tương thích. Điều này đã tạo ra một hệ sinh thái phân mảnh nhưng sôi động, nơi các nhóm có thể lựa chọn giữa sự dễ dàng cài đặt, tính tương thích drop-in (thay thế trực tiếp), hoặc khả năng huấn luyện tùy chỉnh tùy thuộc vào nhu cầu vận hành cụ thể của họ.
Chi tiết chính
- Laya dẫn đầu về độ phổ biến với 19.301 ngôi sao và cung cấp gói cài đặt thân thiện với CPU qua pip, mặc dù các checkpoint cơ sở của nó yêu cầu tinh chỉnh để đạt độ chính xác cao.
- Kev cung cấp các adapter LoRA cho các mô hình Qwen3.5 và hỗ trợ SDK chính thức của TypeSafe, khiến nó trở thành ứng cử viên mạnh mẽ để thay thế trực tiếp các cuộc gọi dịch vụ lưu trữ.
- SemIf tránh hoàn toàn việc huấn luyện mô hình mới bằng cách đọc logits của các lựa chọn từ các mô hình đóng băng (frozen models) như Qwen3.5-4B, giúp giảm đáng kể thời gian suy luận so với việc tạo ra JSON.
- NanoJev là một mô hình chuyên biệt 0.6B được tối ưu hóa cho các vòng lặp điều khiển thời gian thực, vượt trội hơn Jev trong các benchmark trò chơi cụ thể nhưng thiếu tính hữu ích chung cho phân loại.
- jevlike đóng vai trò là một khung huấn luyện chứ không phải một mô hình dựng sẵn, cho phép người dùng huấn luyện các đầu ra quyết định (decision heads) trên tập dữ liệu có nhãn của riêng họ bằng bất kỳ encoder nào.
- Các benchmark độc lập cho thấy Jev đạt độ chính xác macro 0.966 trên nhiều tác vụ đa dạng, trong khi giải pháp thay thế mã nguồn mở tốt nhất, Von, ghi điểm 0.704, cho thấy khoảng cách về hiệu suất zero-shot.
Bối cảnh
Các mô hình System One, giống như Jev, được thiết kế cho các tác vụ hẹp, lặp đi lặp lại nơi cấu trúc đầu ra đã biết trước. Các mô hình ngôn ngữ lớn truyền thống tạo ra văn bản từng token một, quá trình này chậm và đòi hỏi xử lý hậu kỳ để trích xuất dữ liệu hữu ích. Ngược lại, các mô hình ra quyết định này xuất câu trả lời có cấu trúc như một lựa chọn từ danh sách, một điểm số trên thang đo, hoặc một giá trị xác suất trong một lần xử lý song song duy nhất. Cách tiếp cận này loại bỏ nhu cầu phân tích cú pháp và giảm rủi ro lỗi định dạng.
Các bản sao mã nguồn mở đạt được điều này bằng cách tận dụng hợp đồng API công khai do TypeSafe định nghĩa. Nhà phát triển có thể hoặc tinh chỉnh các mô hình nhỏ, hiệu quả như ModernBERT, hoặc trích xuất xác suất trực tiếp từ logits của các mô hình lớn hơn, đóng băng. Logits đại diện cho các điểm số đầu ra thô của mạng nơ-ron trước khi chúng được chuyển đổi thành xác suất. Bằng cách đọc trực tiếp các giá trị này, các công cụ như SemIf có thể bỏ qua hoàn toàn quá trình tạo văn bản chậm chạp, mang lại cải thiện tốc độ đáng kể cho các tác vụ xử lý theo lô.
Tại sao điều này quan trọng
Đối với các nhóm vận hành phần mềm riêng, việc tự lưu trữ các mô hình ra quyết định mang lại quyền kiểm soát lớn hơn đối với quyền riêng tư dữ liệu và chi phí vận hành. Các dịch vụ AI lưu trữ tính phí theo mỗi yêu cầu, điều này có thể trở nên đắt đỏ cho các tác vụ khối lượng lớn, độ phức tạp thấp như định tuyến ticket. Chạy một mô hình nhỏ cục bộ trên phần cứng hiện có sẽ loại bỏ các khoản phí lặp đi lặp lại này và đảm bảo rằng dữ liệu khách hàng nhạy cảm không bao giờ rời khỏi hạ tầng của công ty. Điều này đặc biệt liên quan đến các ngành công nghiệp có yêu cầu tuân thủ nghiêm ngặt về cư trú dữ liệu.
Tuy nhiên, sự đánh đổi nằm ở độ chính xác. Benchmark phân loại jabr độc lập tiết lộ khoảng cách hiệu suất đáng kể giữa mô hình Jev độc quyền và các giải pháp thay thế mã nguồn mở hiện tại. Jev ghi điểm 0.966 trên các tác vụ ngoài miền (out-of-domain), trong khi mô hình mã nguồn mở hàng đầu ghi điểm 0.704. Điều này có nghĩa là mặc dù các giải pháp tự lưu trữ nhanh hơn và rẻ hơn, chúng có thể yêu cầu tinh chỉnh trên dữ liệu nội bộ để đạt mức độ tin cậy chấp nhận được. Các nhóm không thể đơn giản thay thế bằng một mô hình mã nguồn mở và mong đợi kết quả giống hệt nhau mà không có sự xác thực và tiềm năng huấn luyện lại.
Độ trễ là một yếu tố quan trọng khác. Các mô hình tự lưu trữ có thể phản hồi trong mili giây, đặc biệt khi được tối ưu hóa cho phần cứng cụ thể như Apple Silicon hoặc GPU NVIDIA. Điều này làm cho chúng phù hợp với các ứng dụng thời gian thực nơi mỗi mili giây đều có ý nghĩa, chẳng hạn như giao diện người dùng tương tác hoặc hệ thống giao dịch tự động. Khả năng điều chỉnh mô hình cho các cấu hình phần cứng cụ thể cho phép các nhóm kỹ thuật tối ưu hóa hiệu suất theo những cách không thể thực hiện được với một API lưu trữ tiêu chuẩn hóa.
Bạn có thể làm gì
- Đánh giá Kev nếu bạn cần một giải pháp thay thế drop-in cho Jev, vì nó hỗ trợ SDK chính thức và cho phép bạn chỉ thay đổi base URL trong mã của mình.
- Sử dụng SemIf nếu bạn đã lưu trữ các mô hình ngôn ngữ lớn, vì nó có thể trích xuất xác suất quyết định từ các instance hiện có mà không yêu cầu tải xuống hoặc huấn luyện mô hình mới.
- Cân nhắc Laya cho các triển khai dựa trên CPU nếu bạn có tài nguyên để tinh chỉnh mô hình trên tập dữ liệu của riêng mình, lưu ý rằng hiệu suất cơ sở của nó gần với tỷ lệ ngẫu nhiên.
- Kiểm tra NanoJev chỉ nếu trường hợp sử dụng của bạn liên quan đến các vòng lặp điều khiển thời gian thực chặt chẽ, chẳng hạn như robot học hoặc trò chơi điện tử, nơi việc huấn luyện chuyên biệt của nó cung cấp lợi thế rõ rệt.
- Triển khai jevlike nếu bạn có các danh mục phân loại độc đáo không khớp với các benchmark tiêu chuẩn, cho phép bạn huấn luyện một mô hình tùy chỉnh từ đầu trên laptop của mình.
- Theo dõi giao thông trực tiếp (shadow live traffic) bằng cách đường hầm máy chủ cục bộ của bạn tới một endpoint công khai, so sánh các quyết định được đưa ra bởi mô hình mã nguồn mở với hệ thống hiện tại của bạn trước khi chuyển đổi hoàn toàn.


