Hugging Face je pokrenuo Open TTS Leaderboard, novu platformu otvorenog koda namenjenu evaluaciji modela za pretvaranje teksta u govor (TTS) i kloniranje glasa na više jezika. Ova inicijativa dolazi u trenutku kada se broj novih AI modela za sintezu govora povećava iz nedelje u nedelju, a korisnici i developeri sve teže pronalaze način da objektivno uporede njihov kvalitet.

Do sada su slične platforme, poput TTS Arena, funkcionisale po principu „poslušaj dva glasa i glasaj za bolji”. Takav pristup, zasnovan na ljudskim preferencijama i Elo rejtingu (često kroz Bradley–Terry model), daje korisnicima jednostavan uvid u to koji sistemi zvuče prirodnije. Ipak, kako ističu autori bloga, oslanjanje isključivo na ovakvo glasanje postaje sve nepraktičnije.
Zašto je novi pristup važan?
Postoji nekoliko ključnih problema koje Open TTS Leaderboard pokušava da reši. Prvo, modeli otvorenog koda često su „nevidljivi” na javnim listama jer ih platforma mora sama hostovati i servirati, dok se komercijalni API modeli dodaju mnogo lakše. Drugo, ljudske preferencije se menjaju tokom vremena, pa glasovi prikupljeni pre nekoliko meseci ne moraju da odražavaju iste kriterijume kao današnji.

Treće, i možda najvažnije — performanse na engleskom jeziku ne znače automatski i dobar rezultat na drugim jezicima. Kako primećuje jedan od komentatora na platformi, Seed TTS Eval poseduje filmski audio samo za engleski i kineski, dok se za ostale jezike koristi CV3 Eval (zero-shot). Za kineski, japanski i korejski — jezike zasnovane na znakovima — prijavljuje se CER (character error rate), a „prosečan WER” predstavlja makro-prosek kroz sve jezike.
Šta donosi nova platforma?
Cilj Open TTS Leaderboard-a je da ponudi skalabilan i transparentan prostor za evaluaciju multijezičnih TTS i voice-cloning sistema. Umesto da se sve svodi na jedan zbirni rezultat, platforma razdvaja kvalitet multijezičnog govora od identiteta kloniranog glasa. To je ključna razlika, jer u suprotnom timovi optimizuju lakšu podskalu, a rezultat i dalje nazivaju „SOTA TTS”.
Među modelima koji se već mogu naći na listi su Fun-CosyVoice3 (0.5B parametara), Qwen3-ASR, Kokoro-82M sa impresivnih 11,5 miliona preuzimanja, kao i fishaudio/s2-pro i bosonai/higgs-tts-3-4b. Pored samog leaderboard-a, dostupni su i TTS Arena V2 i Open ASR Leaderboard, koji zaokružuju ekosistem za evaluaciju govornih AI modela.
Za developere i istraživače, ovo je korak ka reproduktivnijim i poštenijim poređenjima. Za korisnike — jasan signal koji modeli zaista drže kvalitet kada se jezik i domen fiksiraju, a ne samo kada se takmiče u jednoj, najlakšoj disciplini.
Detaljno objašnjenje metodologije i rezultate možete pogledati na zvaničnom Hugging Face blogu.