EmbeddingGemma 2 của Google hợp nhất tìm kiếm đa phương thức trong một mô hình nhỏ gọn chạy trên thiết bị
Google đã phát hành EmbeddingGemma 2, một mô hình mã nguồn mở với 740 triệu tham số, ánh xạ văn bản, mã, hình ảnh, video và âm thanh vào cùng một không gian vector để truy xuất hiệu quả ngay trên máy cục bộ.
Bài được dịch tự động từ bản gốc tiếng Anh.
Google đã phát hành EmbeddingGemma 2, một mô hình mã nguồn mở được thiết kế để xử lý việc tìm kiếm văn bản, mã, hình ảnh, video và âm thanh trong một khung làm việc nhẹ nhàng duy nhất. Được công bố vào ngày 6 tháng 10 năm 2026, mô hình có 740 triệu tham số này cho phép các nhà phát triển thực hiện các tác vụ truy xuất phức tạp trực tiếp trên thiết bị di động mà không cần dựa vào hạ tầng đám mây hay các bước tiền xử lý nặng nề như chuyển đổi giọng nói thành văn bản.
Diễn biến chính
Mô hình mới ánh xạ năm loại đầu vào khác nhau vào một không gian vector chung gồm 768 chiều. Kiến trúc này loại bỏ nhu cầu tạo chú thích văn bản cho hình ảnh hoặc bản ghi chép cho tệp âm thanh trước khi chúng có thể được tìm kiếm. Trong các thử nghiệm nội bộ trên Pixel 11 Pro, mô hình đã được lượng tử hóa hoàn toàn tiêu tốn khoảng 567MB RAM hoạt động. Google đã phát hành trọng số mô hình theo giấy phép Apache 2.0, cho phép sử dụng miễn phí cho mục đích thương mại và cá nhân. Các công cụ triển khai đã có sẵn thông qua LiteRT và MediaPipe Tasks, với tích hợp Android ML Kit hỗ trợ tăng tốc NPU dự kiến sẽ ra mắt trong vài tuần tới.
Một đặc điểm kiến trúc quan trọng là tính mô-đun. Các nhà phát triển không cần tải toàn bộ mô hình 740 triệu tham số nếu ứng dụng của họ chỉ yêu cầu các loại dữ liệu cụ thể. Bộ mã hóa cơ sở cho văn bản và mã sử dụng 270 triệu tham số và chiếm khoảng 191MB RAM. Thêm bộ mã hóa thị giác cho hình ảnh và video sẽ nâng con số lên 440 triệu tham số, trong khi thêm bộ mã hóa âm thanh đưa nó lên 570 triệu. Việc tải tất cả các bộ mã hóa sẽ đạt đến tổng số tham số đầy đủ. Vì mọi cấu hình đều chiếu vào cùng một không gian embedding, các nhóm có thể bắt đầu với chỉ mục văn bản thuần túy và sau đó thêm khả năng hình ảnh hoặc âm thanh mà không cần nhúng lại (re-embed) dữ liệu hiện có.
Chi tiết chính
- Mô hình hỗ trợ cửa sổ ngữ cảnh 8.192 token, tăng từ 2.048 ở phiên bản trước, cho phép xử lý tối đa 5,5 phút âm thanh, 29 hình ảnh hoặc 58 khung hình video trong một lần đầu vào.
- Xử lý video mặc định lấy mẫu một khung hình mỗi giây, nghĩa là giới hạn 58 khung hình bao phủ chưa đầy một phút footage.
- Google đã huấn luyện mô hình bằng kỹ thuật Matryoshka Representation Learning, cho phép cắt ngắn các embedding xuống còn 512, 256 hoặc 128 chiều mà không cần huấn luyện lại.
- Việc cắt ngắn xuống 256 chiều giảm dung lượng chỉ mục một triệu vector từ khoảng 1,5GB xuống còn 500MB, đồng thời vẫn giữ được phần lớn chất lượng cho văn bản và mã, và khoảng 95% chất lượng cho truy xuất đa phương thức.
- Ở mức 128 chiều, chất lượng truy xuất giảm xuống khoảng 90% đối với văn bản và mã, và khoảng 75% đối với hình ảnh, video và giọng nói, đòi hỏi phải kiểm tra cẩn thận trước khi triển khai.
- Mô hình đạt điểm MTEB Code là 78,68, một sự cải thiện đáng kể so với điểm 68,76 của EmbeddingGemma gốc.
Bối cảnh
Các hệ thống Retrieval-Augmented Generation (RAG) thường dựa vào các mô hình embedding để chuyển đổi dữ liệu thành các vector số biểu diễn ý nghĩa ngữ nghĩa. Theo cách truyền thống, việc xử lý các loại phương tiện khác nhau đòi hỏi các quy trình riêng biệt: nhận dạng ký tự quang học (OCR) cho hình ảnh, nhận dạng giọng nói tự động (ASR) cho âm thanh và chuẩn hóa token tiêu chuẩn cho văn bản. Các bước trung gian này làm tăng độ trễ, chi phí và các điểm tiềm ẩn gây lỗi. Các mô hình embedding ánh xạ những đầu vào này vào một không gian vector nhiều chiều, nơi các khái niệm tương tự nằm gần nhau, cho phép các công cụ tìm kiếm xác định thông tin liên quan dựa trên ý nghĩa thay vì chỉ khớp từ khóa.
Matryoshka Representation Learning là một kỹ thuật giải quyết gánh nặng lưu trữ của các vector này. Bằng cách huấn luyện mô hình để duy trì thông tin hữu ích ngay cả khi số chiều của vector bị giảm, nó cho phép các nhà phát triển đánh đổi một chút độ chính xác truy xuất để tiết kiệm đáng kể dung lượng lưu trữ và bộ nhớ. Điều này đặc biệt quan trọng đối với các thiết bị biên như điện thoại thông minh hoặc máy chủ cục bộ, nơi tài nguyên bị hạn chế so với các trung tâm dữ liệu đám mây.
Tại sao điều này quan trọng
Đối với các đội ngũ vận hành phần mềm tự host, sự phát triển này giảm bớt độ phức tạp khi xây dựng các tính năng tìm kiếm đa phương thức. Trước đây, việc tạo ra một hệ thống có thể tìm kiếm qua các bản ghi cuộc họp, tài liệu quét và kho chứa mã đòi hỏi phải duy trì nhiều mô hình chuyên biệt và dịch vụ tiền xử lý. EmbeddingGemma 2 hợp nhất tất cả những thứ này thành một dependency duy nhất. Khả năng chỉ tải các bộ mã hóa cần thiết có nghĩa là một cổng thông tin tài liệu có thể chỉ cần bộ mã hóa văn bản, giữ cho dấu chân bộ nhớ ở mức tối thiểu, trong khi một công cụ quản lý tài sản truyền thông có thể kích hoạt bộ mã hóa thị giác mà không cần thay đổi schema cơ sở dữ liệu bên dưới.
Lợi ích về hiệu suất cũng ảnh hưởng đến cách các agent cục bộ hoạt động. Bằng cách sử dụng mô hình cho các tác vụ phân loại thông qua MediaPipe Decision, các ứng dụng có thể đánh giá hàng trăm lựa chọn trong vài mili giây mà không cần gọi đến một mô hình ngôn ngữ lớn. Điều này ngăn chặn việc tiêu thụ token không cần thiết và giảm độ trễ trong các vòng lặp ra quyết định. Đối với các quản trị viên IT lo ngại về quyền riêng tư dữ liệu, khả năng thực hiện tất cả việc lập chỉ mục và tìm kiếm trên thiết bị đảm bảo rằng dữ liệu âm thanh hoặc hình ảnh nhạy cảm không bao giờ rời khỏi môi trường cục bộ, phù hợp với các yêu cầu tuân thủ nghiêm ngặt.
Bạn có thể làm gì
- Đánh giá các quy trình RAG hiện tại của bạn để xác định xem các bước tiền xử lý riêng biệt cho âm thanh hoặc hình ảnh có thể được thay thế bằng việc nhúng trực tiếp với EmbeddingGemma 2 hay không.
- Kiểm tra các bộ mã hóa mô-đun để xác định xem ứng dụng của bạn có thể hoạt động chỉ với nền tảng văn bản và mã hay không, giúp tiết kiệm gần 300MB RAM so với mô hình đầy đủ.
- Thử nghiệm với việc cắt ngắn Matryoshka ở 256 chiều để giảm chi phí lưu trữ chỉ mục, đồng thời xác minh rằng mức giảm 5% chất lượng truy xuất đa phương thức là chấp nhận được cho trường hợp sử dụng của bạn.
- Chuẩn bị cho tích hợp Android ML Kit sắp ra mắt nếu bạn đang phát triển ứng dụng di động, đảm bảo phần cứng của bạn hỗ trợ tăng tốc NPU để đạt hiệu suất tối ưu.
- Cân nhắc sử dụng mô hình cho các tác vụ phân loại trong quy trình làm việc của agent để giảm sự phụ thuộc vào các mô hình sinh lớn hơn cho các bước ra quyết định đơn giản.
- Xem xét các điều khoản của giấy phép Apache 2.0 để xác nhận sự tuân thủ với chính sách sử dụng mã nguồn mở của tổ chức trước khi tích hợp trọng số vào các hệ thống production.



