EmbeddingGemma 2 de Google unifica la búsqueda multimodal en un modelo compacto para dispositivos locales
Google ha lanzado EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que mapea texto, código, imágenes, vídeo y audio a un único espacio vectorial para una recuperación eficiente local.
Traducido automáticamente del original en inglés.
Google ha lanzado EmbeddingGemma 2, un modelo de código abierto diseñado para gestionar búsquedas de texto, código, imágenes, vídeo y audio dentro de un único marco ligero. Publicado el 6 de octubre de 2026, este modelo de 740 millones de parámetros permite a los desarrolladores ejecutar tareas complejas de recuperación directamente en dispositivos móviles sin depender de infraestructura en la nube ni de pasos de preprocesamiento extensos como la transcripción.
Qué ha ocurrido
El nuevo modelo mapea cinco tipos distintos de entrada a un espacio vectorial compartido de 768 dimensiones. Esta arquitectura elimina la necesidad de generar subtítulos de texto para las imágenes o transcripciones para los archivos de audio antes de poder buscarlos. En pruebas internas realizadas en un Pixel 11 Pro, el modelo completamente cuantizado consumió aproximadamente 567 MB de RAM activa. Google ha publicado los pesos del modelo bajo la licencia Apache 2.0, lo que los hace disponibles gratuitamente para uso comercial y privado. Las herramientas de despliegue ya están accesibles a través de LiteRT y MediaPipe Tasks, y se espera una integración con Android ML Kit que incluya aceleración por NPU en las próximas semanas.
Una característica arquitectónica clave es su modularidad. Los desarrolladores no necesitan cargar todo el modelo de 740 millones de parámetros si su aplicación solo requiere tipos de datos específicos. El codificador base para texto y código utiliza 270 millones de parámetros y ocupa unos 191 MB de RAM. Añadir el codificador de visión para imágenes y vídeo eleva la cifra a 440 millones de parámetros, mientras que añadir el codificador de audio la lleva a 570 millones. Cargar todos los codificadores resulta en el recuento completo de parámetros. Dado que cada configuración proyecta en el mismo espacio de embeddings, los equipos pueden comenzar con un índice solo de texto y añadir capacidades de imagen o audio más tarde sin tener que re-embeddar los datos existentes.
Detalles clave
- El modelo admite una ventana de contexto de 8.192 tokens, frente a los 2.048 de la versión anterior, lo que le permite procesar hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo en una sola entrada.
- El procesamiento de vídeo predeterminado toma una muestra de un fotograma por segundo, lo que significa que el límite de 58 fotogramas cubre poco menos de un minuto de metraje.
- Google entrenó el modelo utilizando Matryoshka Representation Learning, lo que permite truncar los embeddings a 512, 256 o 128 dimensiones sin necesidad de reentrenamiento.
- Truncar a 256 dimensiones reduce un índice de un millón de vectores de aproximadamente 1,5 GB a 500 MB, manteniendo la mayor parte de la calidad para texto y código, y alrededor del 95% de calidad para la recuperación multimodal.
- A 128 dimensiones, la calidad de recuperación cae a alrededor del 90% para texto y código, y aproximadamente al 75% para imagen, vídeo y voz, lo que requiere pruebas cuidadosas antes del despliegue.
- El modelo alcanzó una puntuación MTEB Code de 78,68, una mejora significativa sobre la puntuación de 68,76 del EmbeddingGemma original.
Contexto
Los sistemas de Generación Aumentada por Recuperación (RAG) suelen depender de modelos de embeddings para convertir datos en vectores numéricos que representan el significado semántico. Tradicionalmente, manejar diferentes tipos de medios requería pipelines separados: reconocimiento óptico de caracteres para imágenes, reconocimiento automático de voz para audio y tokenización estándar para texto. Estos pasos intermedios añaden latencia, coste y posibles puntos de fallo. Los modelos de embeddings mapean estas entradas a un espacio vectorial de alta dimensión donde los conceptos similares se ubican cerca unos de otros, permitiendo a los motores de búsqueda encontrar información relevante basada en el significado y no solo en coincidencias de palabras clave.
Matryoshka Representation Learning es una técnica que aborda la carga de almacenamiento de estos vectores. Al entrenar el modelo para mantener información útil incluso cuando se reducen las dimensiones del vector, permite a los desarrolladores intercambiar una pequeña cantidad de precisión de recuperación por ahorros significativos en almacenamiento y uso de memoria. Esto es particularmente crítico para dispositivos de borde como smartphones o servidores locales, donde los recursos son limitados en comparación con los centros de datos en la nube.
Por qué importa
Para los equipos que ejecutan software autoalojado, este desarrollo reduce la complejidad de construir funciones de búsqueda multimodal. Anteriormente, crear un sistema capaz de buscar grabaciones de reuniones, documentos escaneados y repositorios de código requería mantener múltiples modelos especializados y servicios de preprocesamiento. EmbeddingGemma 2 consolida estos elementos en una única dependencia. La capacidad de cargar solo los codificadores necesarios significa que un portal de documentación podría necesitar únicamente el codificador de texto, manteniendo su huella de memoria mínima, mientras que una herramienta de gestión de activos multimedia podría activar el codificador de visión sin cambiar el esquema de la base de datos subyacente.
Las ganancias de eficiencia también impactan cómo operan los agentes locales. Al usar el modelo para tareas de clasificación mediante MediaPipe Decision, las aplicaciones pueden evaluar cientos de opciones en milisegundos sin invocar un gran modelo de lenguaje. Esto previene el consumo innecesario de tokens y reduce la latencia en los bucles de toma de decisiones. Para los gestores de TI preocupados por la privacidad de los datos, la capacidad de realizar toda la indexación y búsqueda en el dispositivo asegura que los datos sensibles de audio o visuales nunca abandonen el entorno local, alineándose con estrictos requisitos de cumplimiento normativo.
Qué puedes hacer
- Evalúa tus pipelines RAG actuales para identificar si los pasos de preprocesamiento separados para audio o imágenes pueden ser reemplazados por embeddings directos con EmbeddingGemma 2.
- Prueba los codificadores modulares para determinar si tu aplicación puede operar solo con la base de texto y código, ahorrando casi 300 MB de RAM en comparación con el modelo completo.
- Experimenta con el truncamiento Matryoshka a 256 dimensiones para reducir los costes de almacenamiento del índice, verificando que la caída del 5% en la calidad de recuperación multimodal es aceptable para tu caso de uso.
- Prepárate para la próxima integración con Android ML Kit si estás desarrollando aplicaciones móviles, asegurándote de que tu hardware soporte la aceleración por NPU para un rendimiento óptimo.
- Considera usar el modelo para tareas de clasificación en flujos de trabajo de agentes para reducir la dependencia de modelos generativos más grandes para pasos simples de toma de decisiones.
- Revisa los términos de la licencia Apache 2.0 para confirmar el cumplimiento con las políticas de uso de código abierto de tu organización antes de integrar los pesos en sistemas de producción.



