Google je napravio još jedan korak ka tome da razgovor sa veštačkom inteligencijom prestane da liči na kucanje u prazno. Kompanija je predstavila Gemini 3.8 Live with Live Avatar, novu funkcionalnost koja svojim modelima za živu konverzaciju dodaje vizuelno prisustvo — avatara koji istovremeno sluša, vidi i govori, sa preciznim sinhronizovanjem usana i prirodnim izrazima lica.

Ovo nije samo kozmetički dodatak. Live Avatar spaja generisanje videa u skoro realnom vremenu sa govorom, pa razgovor sa AI agentom prestaje da bude razmena tekstualnih poruka i pretvara se u iskustvo koje podseća na razgovor sa osobom — sa zastojima u govoru koji deluju ljudski, izrazima i reakcijama koje prate tok dijaloga.
Razgovor je oduvek bio multimodalni
Google tim koji stoji iza ovog projekta, predvođen istraživačem Shuo-yiin Changom i softverskim inženjerom CJ Zhengom, polazi od jednostavne premise: ljudi komuniciraju tako što istovremeno slušaju, gledaju, govore i koriste izraze lica. Live Avatar te kapacitete prenosi na poslovne agente. Sistem paralelno obrađuje vizuelne i audio ulaze, a zatim generiše odgovor i u zvuku i u slici.

Praktično, to znači da avatara možete da pozovete, pokažete mu nešto kamerom, a on će razumeti kontekst i odgovoriti — bez prekidanja toka razgovora.
Asinhrono pozivanje alata u pozadini
Ono što ovu funkcionalnost izdvaja od običnih “govornih glava” jeste to što je podržava Geminijevo rezonovanje. Zahvaljujući asinhronom pozivanju alata, Live Avatar može da pokrene pozive ka spoljnim sistemima i dohvati podatke u pozadini dok razgovor i dalje teče.
Google kao primer navodi prijavu gosta u hotelu — avatar u realnom vremenu proverava rezervaciju i obrađuje podatke, a da korisnik ne mora da čeka u tišini ili gleda u “loading” ekran. Dijalog se ne prekida, a kompleksni zadaci se obavljaju u hodu.
97 jezika bez gubitka kvaliteta slike
Za globalne kompanije možda i najvažnija stavka: Live Avatar podržava nativnu sinhronizaciju govora u oba smera i može da prelazi između 97 jezika usred razgovora. Pri tom prelasku, sinhronizacija usana i izrazi lica se dinamički prilagođavaju, bez degradacije video zapisa i bez onog neprijatnog “vizuelnog driftovanja” koje odaje da gledate mašinu.

Avatar po meri brenda
Pored biblioteke unapred pripremljenih avatara različitog izgleda, glasa i karaktera, organizacije mogu da kreiraju sopstvene. Iz kvalitetne referentne slike programeri mogu da generišu avatara koji se uklapa u vizuelni identitet brenda — što je za kompanije koje grade korisničku podršku ili interaktivne vodiče često ključno.
Funkcionalnost je od danas dostupna u okviru Gemini Enterprise, što jasno pokazuje gde Google vidi primarnu primenu: u poslovnom okruženju, za korisničku podršku, obuke i interaktivne prezentacije proizvoda. Detaljnije o tome kako sistem funkcioniše možete pročitati na zvaničnom Google DeepMind blogu.
Ono što ostaje da se vidi jeste kako će tržište reagovati na avatare koji sve manje liče na interfejs, a sve više na sagovornika — i da li je to korak ka prirodnijoj komunikaciji ili ka novom sloju iluzije.