Produkt · 10. Oktober 2026
Auch veröffentlicht auf Français
Google stellt multimodales Open-Weight-Modell EmbeddingGemma 2 vor
Der Technologiekonzern Google hat am siebten Oktober 2026 das neue KI-Modell EmbeddingGemma 2 veröffentlicht, das Texte, Programmcode, Bilder, Videos und Audiodaten in einem einzigen Vektorraum verarbeitet. Dieses System ermöglicht es Suchmaschinen und künstlichen Assistenten, inhaltsbezogene Übereinstimmungen über verschiedene Dateiformate hinweg zu finden, ohne dass die Dateien explizit mit entsprechenden Schlagworten versehen sein müssen. Die Veröffentlichung erfolgt unter der Apache 2.0-Lizenz als Open-Weight-Modell, was Entwicklern erlaubt, die Modellgewichte herunterzuladen, anzupassen und kommerziell zu nutzen.
Das Modell baut auf der Architektur von Gemma 4 auf und nutzt einen modularen Aufbau, der es Anwendern gestattet, nur die für ihren spezifischen Anwendungsfall notwendigen Komponenten zu laden. Die Basisversion für Text und Code umfasst 270 Millionen Parameter und verarbeitet Eingaben mit einer Länge von bis zu 8192 Token. Durch Hinzufügen des Bildmoduls mit 170 Millionen Parametern steigt die Gesamtgröße auf 440 Millionen Parameter, wobei auch Dokumente mit Bildern sowie Videoframes unterstützt werden. Ein weiteres Modul für Audiodaten fügt 300 Millionen Parameter hinzu, sodass das vollständige System insgesamt 740 Millionen Parameter erreicht. Nicht geladene Module belegen keinen Arbeitsspeicher, was die Effizienz bei der Bereitstellung auf lokaler Hardware erhöht.
Ein zentrales Merkmal der Technologie ist die Abbildung aller Datentypen in einen gemeinsamen 768-dimensionalen Vektorraum. Dies geschieht durch spezielle Encoder für jeden Datentyp, deren Ausgaben in einen gemeinsamen Kern geleitet werden. Dadurch können semantisch ähnliche Inhalte unterschiedlicher Formate, wie ein Textsuchbegriff und eine passende Audiodatei, direkt miteinander verglichen werden. Da alle vier möglichen Konfigurationen des Modells aus derselben Gewichtsdatei stammen, bleiben die Vektorräume kompatibel. Organisationen können somit zunächst eine reine Textlösung einsetzen und später Bild- oder Audiokomponenten nachladen, ohne bestehende Indizes neu berechnen zu müssen.
Hinsichtlich der Leistungsfähigkeit zeigt das neue Modell im Bereich Code-Verständnis eine Verbesserung von 14 Prozent gegenüber dem Vorgänger im Massive Text Embedding Benchmark. Die Genauigkeit bei mehrsprachigen Texten bleibt dabei auf dem bisherigen Niveau. Zur Optimierung des Speicherbedarfs setzt das System auf Matryoshka Representation Learning. Diese Technik erlaubt es, die Vektordimensionen von 768 auf 512, 256 oder 128 zu reduzieren, indem weniger wichtige Informationen am Ende des Vektors abgeschnitten werden. Eine Reduzierung auf 128 Dimensionen verringert den Speicherbedarf um den Faktor sechs, führt jedoch bei der Suche nach Bildern, Videos und Sprache zu einem Qualitätsverlust auf etwa 75 Prozent des Originalwertes.
Die Integration in bestehende Systeme erfolgt über die Bibliothek sentence-transformers ab Version 6.1.0, wobei das Modell unter der Kennung google/embeddinggemma-2 verfügbar ist. Die Nachrichtenplattform Techsauce berichtete über die Einführung und erläuterte, dass das Modell besonders für Retrieval-Augmented Generation und die lokale Indizierung von Code durch KI-Agenten konzipiert wurde. Das mit dem Ereignis verknüpfte finanzielle Volumen beträgt 1000000000 THB.