Google predstavio Gemini 3.8 TTS: Glas koji zvuči kao čovek, a pravi se iz jednog prompta

jakovradojevic
3 Min Read

Google je upravo predstavio dva nova modela za sintezu govora koji bi mogli da promene način na koji stvaramo audio sadržaj. U pitanju su Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, a obećavaju ono što su kreatori godinama čekali — potpunu kontrolu nad glasom, od akcenta do emocije.

Google predstavio Gemini 3.8 TTS: Glas koji zvuči kao čovek, a pravi se iz jednog prompta

Za razliku od starih sistema koji su radili po principu “izaberi jedan od ponuđenih glasova i ćuti”, novi Gemini modeli funkcionišu kao pravi mali audio studio. Sve što vam treba jeste prirodan jezički prompt — opišete lik, akcenat, raspoloženje, pa čak i to kako neko diše ili se smeje u pozadini, i model to izvede.

Od trideset glasova do beskonačne biblioteke

Google se hvali da su sa prethodnih 30 unapred definisanih glasova skočili na praktično neograničenu biblioteku. Gemini 3.8 Flash TTS namenjen je onima koji žele dubinsku kreativnu kontrolu — dizajnerima igara, autorima audio-knjiga, podkasterima i svima koji grade interaktivne medije. Možete da režirate svaku liniju dijaloga ponaosob, birate tempo, menjate dijalekt u hodu, pa čak i da dodate takozvano backchanneling — ono “aha”, “da, da”, “mmm” koje ljude čini ljudima.

Google predstavio Gemini 3.8 TTS: Glas koji zvuči kao čovek, a pravi se iz jednog prompta

Sa druge strane, Gemini 3.8 Flash-Lite TTS cilja na masovnu produkciju. Brz, jeftin i optimizovan za sinhronizaciju velikih razmera, pravljenje audio sadržaja u velikom obimu i glasovne agente koji moraju da zvuče prirodno, a da pritom ne koštaju bogatstvo. Fina kontrola tona i tempa ostaje tu, samo bez holivudske režije.

Gde sve ovo može da se koristi

Novi modeli su dostupni kroz Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook i Google Vids. To znači da ih možete ubaciti i u sopstvenu aplikaciju preko API-ja, ali i koristiti unutar Google-ovih alata za pravljenje videa ili beleški.

Ovo nije izolovan potez. Gemini Audio familija ubrzano raste — pre ovih modela stigli su 3.5 Live Translate, 3.5 Transcribe, 3.8 Live i 3.8 Live Extended Thinking. Google očigledno gradi kompletan audio ekosistem, a TTS je samo jedan, ali verovatno najzvučniji deo slagalice.

Google predstavio Gemini 3.8 TTS: Glas koji zvuči kao čovek, a pravi se iz jednog prompta

Bezbednost nije zanemarena

Kako to obično biva kada se prave glasovi koji zvuče kao stvarni ljudi, postavlja se pitanje zloupotrebe. Google tvrdi da je ugradio watermarking i druge sigurnosne mehanizme kako bi generisani audio mogao da se prepozna i kako bi se sprečilo lažno predstavljanje. Koliko je to zaista delotvorno, ostaje da vidimo u praksi — ali svest o problemu je barem tu.

Detaljnije o svemu možete pročitati na zvaničnom Google DeepMind blogu.

Ono što je nekada zahtevalo studio, glumce i dane montaže, sada može da se odradi iz fotelje, uz nekoliko dobro napisanih rečenica. Pitanje više nije da li tehnologija može da zvuči ljudski — pitanje je šta ćemo s njom raditi.

Share this Article
Leave a comment