Kategorier
Produktsläpp

EmbeddingGemma 2 flyttar multimodal sökning till telefonen

Google släppte den 6 oktober EmbeddingGemma 2, en öppen embeddingmodell som är byggd för att köras på själva enheten i stället för i molnet. Till skillnad från föregångaren, som bara hanterade text, lägger EmbeddingGemma 2 text, kod, bilder, ljud och video i ett och samma vektorrum. Det gör att man kan söka med en röstinspelning och få träff på ett videoklipp, eller söka igenom timmar av ljud med en textfråga. Allt detta sker i en enda modell, utan anrop till en server.

Föregångaren EmbeddingGemma, som kom förra året, har passerat 20 miljoner nedladdningar. EmbeddingGemma 2 är byggd på Gemma 4-arkitekturen, har 740 miljoner parametrar och släpps under licensen Apache 2.0, som tillåter kommersiell användning.

Minnet går att skala ned i två steg

Modellen är uppbyggd av moduler, och bara textdelen är obligatorisk. Textdelen behöver så lite som 270 miljoner parametrar, medan bildkodaren (170 miljoner) och ljudkodaren (300 miljoner) är frivilliga påbyggnader. Den som bara indexerar text behöver inte ladda ljudkodaren.

Med kvantisering landar modellen på omkring 191 megabyte aktivt arbetsminne för textvikterna på en Google Pixel 11 Pro, och omkring 567 megabyte för hela den multimodala modellen.

Det andra steget gäller lagringen av vektorerna. Modellen använder Matryoshka Representation Learning, som ger inbyggt stöd för att kapa utdatavektorn i efterhand. Utvecklare kan korta ned vektorerna från 768 dimensioner till 512, 256 eller 128 dimensioner. De nedskalade vektorerna normeras sedan om. Kortningen ger upp till sex gånger mindre lagring och minnesanvändning i en lokal vektordatabas. Kortare vektorer kostar något i kvalitet, en effekt som modellkortet beskriver som minimal.

Kontextfönstret tar in upp till 5,5 minuter ljud

Kontextfönstret är på 8K token, fyra gånger större än i EmbeddingGemma 1. Det rymmer upp till 5,5 minuter ljud, 29 bilder eller 58 videorutor, eller en kombination av dem.

Kodsökningen är det som lyfter mest

Den flerspråkiga textprestandan ligger kvar på föregångarens nivå. I MTEB Code, delprovet för kod i Massive Text Embedding Benchmark, redovisar Google en ökning från 68,76 till 78,68, en förbättring på 9,92 poäng. Förbättringen pekar mot användningar som indexering av en lokal kodbas, semantisk kodsökning och sökning för kodagenter.

Google beskriver modellen som bäst i sin storleksklass bland multimodala embeddingmodeller under en miljard parametrar, mätt i bland annat MTEB Code och MAEB (Massive Audio Embedding Benchmark). Enligt Google matchar eller slår den också flera större modeller på text, bild och ljud. Fullständiga utvärderingsmått finns i modellkortet.

Så körs modellen lokalt

Att embeddingarna beräknas på enheten gör att materialet inte behöver lämna den. Enligt Google bidrar det till dataskyddet och sänker svarstiden, och sökningen fungerar helt utan uppkoppling. Tillsammans med en generativ modell som Gemma 4 kan EmbeddingGemma 2 driva en RAG-pipeline på enheten. I ett sådant upplägg hämtar EmbeddingGemma 2 först fram relevant material från användarens egna filer, och den generativa modellen svarar sedan utifrån det. Eftersom EmbeddingGemma 2 är byggd på Gemma 4 och delar dess texttokeniserare och ljudkodare, går de att köra tillsammans med lägre total minnesåtgång än två separata modeller skulle ha krävt.

Vikterna finns på Hugging Face och Kaggle, och modellen går att köra via bland annat transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama och LM Studio. För plattformsoberoende appar finns Google AI Edge MediaPipe och LiteRT, och i webbläsaren transformers.js och WebGPU. Google visar självt upp sökningen på enheten i två appar: AI Edge Gallery, som har både mediesökning och videosökning, och AI Edge Foresight för lokal filsökning.

Senast faktagranskad: 6 oktober 2026