Google DeepMind je upravo predstavio EmbeddingGemma 2, novi otvoreni model za multimodalno pretraživanje koji bi mogao ozbiljno da promeni način na koji aplikacije organizuju i pronalaze informacije — direktno na uređaju, bez slanja podataka u cloud.

Ako ste pratili prošlogodišnje izdanje EmbeddingGemme, znate o čemu je reč. Prva verzija je napravila pravu pometnju u developerskoj zajednici, sa više od 20 miliona preuzimanja. Ljudi su je koristili za pametniju pretragu na telefonima, ali i za RAG (Retrieval Augmented Generation) sisteme koji čuvaju privatnost jer sve rade lokalno. Sada Google ide korak dalje — umesto samo teksta, novi model objedinjuje kod, slike, video i audio u jedan zajednički embedding prostor.

Šta zapravo znači “multimodalni embedding”?
U najkraćem — model prevodi različite tipove sadržaja u isti “jezik” brojeva, takozvane embeddinge. To znači da možete da pretražujete video snimak pomoću tekstualnog upita, da pronađete određeni isečak iz audio beleške na osnovu opisa, ili da pretražujete bazu koda prirodnim jezikom. Sve to radi jedan model, bez potrebe za odvojenim sistemima za svaki format.
EmbeddingGemma 2 je izgrađen na Gemma 4 arhitekturi i ima 740 miliona parametara, što ga čini idealnim za izvršavanje na uređaju. Objavljen je pod Apache 2.0 licencom, što znači da je slobodan i za komercijalnu upotrebu.

Modularnost koja štedi resurse
Ono što ovaj model izdvaja od konkurencije jeste njegova modularna priroda. Za poslove koji uključuju samo tekst, dovoljno je 270M parametara. Ako vam treba i vizuelna podrška, dodajete enkoder od 170M, a za audio još 300M. Ne morate da nosite balast koji vam ne treba.
Tu je i Matryoshka Representation Learning (MRL) — tehnika koja omogućava dinamičko skraćivanje izlaznih vektora sa 768 dimenzija na 512, 256 ili čak 128. Rezultat? Do šest puta manje prostora za lokalne vektorske baze podataka.
Što se tiče performansi na uređaju, brojke su impresivne. Na Google Pixel 11 Pro telefonu, EmbeddingGemma 2 zahteva svega ~191MB aktivne RAM memorije za tekstualne zadatke, odnosno ~567MB za puni multimodalni model. Sa kvantizacijom, naravno.
8K kontekst i ozbiljni benchmark rezultati
Novi model donosi i 8K tokena kontekstnog prozora — četiri puta više od prve verzije. U praksi to znači da može da obradi do 5,5 minuta audio zapisa, 29 slika, 58 video frejmova ili bilo koju njihovu kombinaciju, sve lokalno.
Na MTEB Code benchmarku, EmbeddingGemma 2 je zabeležio poboljšanje od čak 9,92 poena u odnosu na prethodnika (sa 68,76 na 78,68). To ga čini odličnim kandidatom za indeksiranje lokalnih codebase-ova, semantičku pretragu koda i retrieval za coding agente. Uz to, model zadržava jaku multilingualnu tekstualnu podršku i postiže vodeće rezultate među multimodalnim embedderima ispod milijardu parametara.
Za developere koji grade aplikacije sa fokusom na privatnost, ovo je verovatno jedan od najzanimljivijih modela ove godine. Detaljnu dokumentaciju i model možete pronaći na Google DeepMind blogu.