Googles EmbeddingGemma 2 vereint multimodale Suche in einem kleinen On-Device-Modell
Google hat EmbeddingGemma 2 veröffentlicht, ein offenes Modell mit 740 Millionen Parametern, das Text, Code, Bilder, Video und Audio in einen einzigen Vektorraum abbildet, um eine effiziente lokale Suche zu ermöglichen.
Automatisch aus dem englischen Original übersetzt.
Google hat EmbeddingGemma 2 veröffentlicht, ein Open-Source-Modell, das für die Verarbeitung von Text-, Code-, Bild-, Video- und Audiosuche innerhalb eines einzigen leichtgewichtigen Frameworks entwickelt wurde. Dieses am 6. Oktober 2026 vorgestellte Modell mit 740 Millionen Parametern ermöglicht es Entwicklern, komplexe Abrufaufgaben direkt auf Mobilgeräten auszuführen, ohne auf Cloud-Infrastruktur oder umfangreiche Vorverarbeitungsschritte wie Transkription angewiesen zu sein.
Was passiert ist
Das neue Modell bildet fünf verschiedene Eingabetypen in einem gemeinsamen 768-dimensionalen Vektorraum ab. Diese Architektur eliminiert die Notwendigkeit, Textbeschreibungen für Bilder oder Transkripte für Audiodateien zu generieren, bevor sie durchsucht werden können. Bei internen Tests auf einem Pixel 11 Pro verbrauchte das vollständig quantisierte Modell etwa 567 MB aktiven RAM. Google hat die Modellgewichte unter der Apache-2.0-Lizenz veröffentlicht, was sie für kommerzielle und private Nutzung frei verfügbar macht. Bereitstellungstools sind bereits über LiteRT und MediaPipe Tasks zugänglich; eine Android ML Kit-Integration mit NPU-Beschleunigung wird in den kommenden Wochen erwartet.
Ein wichtiges architektonisches Merkmal ist die Modularität. Entwickler müssen nicht das gesamte Modell mit 740 Millionen Parametern laden, wenn ihre Anwendung nur bestimmte Datentypen benötigt. Der Basis-Encoder für Text und Code verwendet 270 Millionen Parameter und belegt etwa 191 MB RAM. Das Hinzufügen des Vision-Encoders für Bilder und Videos erhöht die Anzahl auf 440 Millionen Parameter, während das Hinzufügen des Audio-Encoders sie auf 570 Millionen bringt. Das Laden aller Encoder führt zur vollständigen Parameteranzahl. Da jede Konfiguration in denselben Einbettungsraum projiziert wird, können Teams mit einem reinen Textindex beginnen und später Bild- oder Audiokomponenten hinzufügen, ohne vorhandene Daten neu einzubetten.
Wichtige Details
- Das Modell unterstützt einen Kontextfenster von 8.192 Tokens, gegenüber 2.048 in der vorherigen Version, wodurch es bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes in einer einzigen Eingabe verarbeiten kann.
- Die Videoverarbeitung standardmäßig sampelt einen Frame pro Sekunde, was bedeutet, dass das Limit von 58 Frames knapp unter einer Minute Filmmaterial abdeckt.
- Google trainierte das Modell unter Verwendung von Matryoshka Representation Learning, was es ermöglicht, Einbettungen auf 512, 256 oder 128 Dimensionen zu kürzen, ohne das Modell neu trainieren zu müssen.
- Das Kürzen auf 256 Dimensionen reduziert einen Index mit einer Million Vektoren von etwa 1,5 GB auf 500 MB, wobei die Qualität für Text und Code weitgehend erhalten bleibt und bei multimodaler Suche etwa 95 % der Qualität bewahrt werden.
- Bei 128 Dimensionen sinkt die Suchqualität auf etwa 90 % für Text und Code und auf etwa 75 % für Bild, Video und Sprache, was sorgfältige Tests vor dem Einsatz erfordert.
- Das Modell erreichte einen MTEB-Code-Score von 78,68, eine erhebliche Verbesserung gegenüber dem Score von 68,76 des ursprünglichen EmbeddingGemma.
Hintergrund
Retrieval-Augmented Generation (RAG)-Systeme verlassen sich typischerweise auf Einbettungsmodelle, um Daten in numerische Vektoren umzuwandeln, die semantische Bedeutung repräsentieren. Traditionell erforderte die Handhabung verschiedener Medientypen separate Pipelines: optische Zeichenerkennung für Bilder, automatische Spracherkennung für Audio und Standard-Tokenisierung für Text. Diese Zwischenschritte erhöhen Latenz, Kosten und potenzielle Fehlerquellen. Einbettungsmodelle bilden diese Eingaben in einen hochdimensionalen Vektorraum ab, in dem ähnliche Konzepte nah beieinander liegen, sodass Suchmaschinen relevante Informationen basierend auf Bedeutung statt nur auf Schlüsselwortübereinstimmungen finden können.
Matryoshka Representation Learning ist eine Technik, die den Speicherbedarf dieser Vektoren adressiert. Indem das Modell so trainiert wird, dass es nützliche Informationen auch bei reduzierter Vektordimension behält, können Entwickler einen geringen Verlust an Suchgenauigkeit gegen erhebliche Einsparungen bei Speicher- und Speichernutzung eintauschen. Dies ist besonders kritisch für Edge-Geräte wie Smartphones oder lokale Server, wo Ressourcen im Vergleich zu Cloud-Rechenzentren begrenzt sind.
Warum es wichtig ist
Für Teams, die selbst gehostete Software betreiben, reduziert diese Entwicklung die Komplexität beim Aufbau multimodaler Suchfunktionen. Früher erforderte die Erstellung eines Systems, das Meeting-Aufzeichnungen, gescannte Dokumente und Code-Repositories durchsuchen konnte, die Wartung mehrerer spezialisierter Modelle und Vorverarbeitungsdienste. EmbeddingGemma 2 konsolidiert diese in eine einzige Abhängigkeit. Die Möglichkeit, nur die erforderlichen Encoder zu laden, bedeutet, dass ein Dokumentationsportal möglicherweise nur den Text-Encoder benötigt, was seinen Speicherfußabdruck minimal hält, während ein Tool zur Verwaltung von Medienassets den Vision-Encoder aktivieren kann, ohne das zugrunde liegende Datenbank-Schema zu ändern.
Die Effizienzgewinne wirken sich auch darauf aus, wie lokale Agenten operieren. Durch die Nutzung des Modells für Klassifizierungsaufgaben via MediaPipe Decision können Anwendungen Hunderte von Optionen in Millisekunden evaluieren, ohne ein großes Sprachmodell aufzurufen. Dies verhindert unnötigen Token-Verbrauch und reduziert die Latenz in Entscheidungsprozessen. Für IT-Manager, die Bedenken hinsichtlich des Datenschutzes haben, stellt die Fähigkeit, alle Indexierungs- und Suchvorgänge auf dem Gerät durchzuführen, sicher, dass sensible Audio- oder Bilddaten niemals die lokale Umgebung verlassen, was mit strengen Compliance-Anforderungen übereinstimmt.
Was Sie tun können
- Bewerten Sie Ihre aktuellen RAG-Pipelines, um festzustellen, ob separate Vorverarbeitungsschritte für Audio oder Bilder durch direkte Einbettung mit EmbeddingGemma 2 ersetzt werden können.
- Testen Sie die modularen Encoder, um zu bestimmen, ob Ihre Anwendung nur mit dem Text- und Code-Basis-Modul arbeiten kann, was fast 300 MB RAM im Vergleich zum vollständigen Modell einspart.
- Experimentieren Sie mit der Matryoshka-Kürzung auf 256 Dimensionen, um die Speicherkosten für Indizes zu reduzieren, und überprüfen Sie, ob der 5%ige Rückgang der multimodalen Suchqualität für Ihren Anwendungsfall akzeptabel ist.
- Bereiten Sie sich auf die kommende Android ML Kit-Integration vor, wenn Sie mobile Anwendungen entwickeln, und stellen Sie sicher, dass Ihre Hardware NPU-Beschleunigung für optimale Leistung unterstützt.
- Erwägen Sie die Nutzung des Modells für Klassifizierungsaufgaben in Agenten-Workflows, um die Abhängigkeit von größeren generativen Modellen für einfache Entscheidungsschritte zu reduzieren.
- Überprüfen Sie die Bedingungen der Apache-2.0-Lizenz, um die Konformität mit den Open-Source-Nutzungsrichtlinien Ihrer Organisation zu bestätigen, bevor Sie die Gewichte in Produktionssysteme integrieren.



