{"id":2859,"date":"2026-10-07T06:00:44","date_gmt":"2026-10-07T06:00:44","guid":{"rendered":"https:\/\/11000.dev\/index.php\/2026\/10\/07\/google-deepmind-predstavio-embeddinggemma-2-mali-model-koji-razume-tekst-slike-audio-i-video-odjednom\/"},"modified":"2026-10-07T06:00:44","modified_gmt":"2026-10-07T06:00:44","slug":"google-deepmind-predstavio-embeddinggemma-2-mali-model-koji-razume-tekst-slike-audio-i-video-odjednom","status":"publish","type":"post","link":"https:\/\/11000.dev\/index.php\/2026\/10\/07\/google-deepmind-predstavio-embeddinggemma-2-mali-model-koji-razume-tekst-slike-audio-i-video-odjednom\/","title":{"rendered":"Google DeepMind predstavio EmbeddingGemma 2: mali model koji razume tekst, slike, audio i video odjednom"},"content":{"rendered":"<p>Google DeepMind je upravo predstavio <strong>EmbeddingGemma 2<\/strong>, novi otvoreni model za multimodalno pretra\u017eivanje koji bi mogao ozbiljno da promeni na\u010din na koji aplikacije organizuju i pronalaze informacije \u2014 direktno na ure\u0111aju, bez slanja podataka u cloud.<\/p>\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/11000.dev\/wp-content\/uploads\/2026\/10\/embeddinggemma2-banner_169.width-1300.png\" alt=\"Google DeepMind predstavio EmbeddingGemma 2: mali model koji razume tekst, slike, audio i video odjednom\" \/><\/figure>\n<p>Ako ste pratili pro\u0161logodi\u0161nje izdanje EmbeddingGemme, znate o \u010demu je re\u010d. Prva verzija je napravila pravu pometnju u developerskoj zajednici, sa vi\u0161e od <strong>20 miliona preuzimanja<\/strong>. Ljudi su je koristili za pametniju pretragu na telefonima, ali i za RAG (Retrieval Augmented Generation) sisteme koji \u010duvaju privatnost jer sve rade lokalno. Sada Google ide korak dalje \u2014 umesto samo teksta, novi model objedinjuje <strong>kod, slike, video i audio<\/strong> u jedan zajedni\u010dki embedding prostor.<\/p>\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/11000.dev\/wp-content\/uploads\/2026\/10\/embeddinggemma2-banner_169.width-200.format-webp.webp\" alt=\"Google DeepMind predstavio EmbeddingGemma 2: mali model koji razume tekst, slike, audio i video odjednom\" \/><\/figure>\n<h2>\u0160ta zapravo zna\u010di &#8220;multimodalni embedding&#8221;?<\/h2>\n<p>U najkra\u0107em \u2014 model prevodi razli\u010dite tipove sadr\u017eaja u isti &#8220;jezik&#8221; brojeva, takozvane embeddinge. To zna\u010di da mo\u017eete da pretra\u017eujete video snimak pomo\u0107u tekstualnog upita, da prona\u0111ete odre\u0111eni ise\u010dak iz audio bele\u0161ke na osnovu opisa, ili da pretra\u017eujete bazu koda prirodnim jezikom. Sve to radi jedan model, bez potrebe za odvojenim sistemima za svaki format.<\/p>\n<p>EmbeddingGemma 2 je izgra\u0111en na <strong>Gemma 4 arhitekturi<\/strong> i ima <strong>740 miliona parametara<\/strong>, \u0161to ga \u010dini idealnim za izvr\u0161avanje na ure\u0111aju. Objavljen je pod Apache 2.0 licencom, \u0161to zna\u010di da je slobodan i za komercijalnu upotrebu.<\/p>\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/11000.dev\/wp-content\/uploads\/2026\/10\/Massive_Text_Embedding_Benchmark_.width-100.format-webp.webp\" alt=\"Google DeepMind predstavio EmbeddingGemma 2: mali model koji razume tekst, slike, audio i video odjednom\" \/><\/figure>\n<h2>Modularnost koja \u0161tedi resurse<\/h2>\n<p>Ono \u0161to ovaj model izdvaja od konkurencije jeste njegova modularna priroda. Za poslove koji uklju\u010duju samo tekst, dovoljno je <strong>270M parametara<\/strong>. Ako vam treba i vizuelna podr\u0161ka, dodajete enkoder od 170M, a za audio jo\u0161 300M. Ne morate da nosite balast koji vam ne treba.<\/p>\n<p>Tu je i <strong>Matryoshka Representation Learning (MRL)<\/strong> \u2014 tehnika koja omogu\u0107ava dinami\u010dko skra\u0107ivanje izlaznih vektora sa 768 dimenzija na 512, 256 ili \u010dak 128. Rezultat? Do <strong>\u0161est puta manje prostora<\/strong> za lokalne vektorske baze podataka.<\/p>\n<p>\u0160to se ti\u010de performansi na ure\u0111aju, brojke su impresivne. Na Google Pixel 11 Pro telefonu, EmbeddingGemma 2 zahteva svega <strong>~191MB aktivne RAM memorije<\/strong> za tekstualne zadatke, odnosno <strong>~567MB<\/strong> za puni multimodalni model. Sa kvantizacijom, naravno.<\/p>\n<h2>8K kontekst i ozbiljni benchmark rezultati<\/h2>\n<p>Novi model donosi i <strong>8K tokena kontekstnog prozora<\/strong> \u2014 \u010detiri puta vi\u0161e od prve verzije. U praksi to zna\u010di da mo\u017ee da obradi do <strong>5,5 minuta audio zapisa<\/strong>, <strong>29 slika<\/strong>, <strong>58 video frejmova<\/strong> ili bilo koju njihovu kombinaciju, sve lokalno.<\/p>\n<p>Na <strong>MTEB Code benchmarku<\/strong>, EmbeddingGemma 2 je zabele\u017eio pobolj\u0161anje od \u010dak <strong>9,92 poena<\/strong> u odnosu na prethodnika (sa 68,76 na 78,68). To ga \u010dini odli\u010dnim kandidatom za indeksiranje lokalnih codebase-ova, semanti\u010dku pretragu koda i retrieval za coding agente. Uz to, model zadr\u017eava jaku multilingualnu tekstualnu podr\u0161ku i posti\u017ee vode\u0107e rezultate me\u0111u multimodalnim embedderima ispod milijardu parametara.<\/p>\n<p>Za developere koji grade aplikacije sa fokusom na privatnost, ovo je verovatno jedan od najzanimljivijih modela ove godine. Detaljnu dokumentaciju i model mo\u017eete prona\u0107i na <a href=\"https:\/\/deepmind.google\/blog\/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model\/\" target=\"_blank\" rel=\"noopener\">Google DeepMind blogu<\/a>.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Google DeepMind je upravo predstavio EmbeddingGemma 2, novi otvoreni model za multimodalno pretra\u017eivanje koji bi mogao ozbiljno da promeni na\u010din na koji aplikacije organizuju i pronalaze informacije \u2014 direktno na ure\u0111aju, bez slanja podataka u cloud. Ako ste pratili pro\u0161logodi\u0161nje izdanje EmbeddingGemme, znate o \u010demu je re\u010d. Prva verzija je napravila pravu pometnju u developerskoj [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2854,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"content-type":"","footnotes":""},"categories":[103,104],"tags":[],"class_list":["post-2859","post","type-post","status-publish","format-standard","has-post-thumbnail","category-ai","category-tehnologija"],"_links":{"self":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/posts\/2859","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/comments?post=2859"}],"version-history":[{"count":0,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/posts\/2859\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/media\/2854"}],"wp:attachment":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/media?parent=2859"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/categories?post=2859"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/tags?post=2859"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}