{"id":2459,"date":"2026-10-01T17:27:30","date_gmt":"2026-10-01T17:27:30","guid":{"rendered":"https:\/\/11000.dev\/index.php\/2026\/10\/01\/transformers-sada-podrzava-llama-cpp-kvantizaciju-ai-modeli-na-obicnim-racunarima-postaju-stvarnost\/"},"modified":"2026-10-01T17:27:30","modified_gmt":"2026-10-01T17:27:30","slug":"transformers-sada-podrzava-llama-cpp-kvantizaciju-ai-modeli-na-obicnim-racunarima-postaju-stvarnost","status":"publish","type":"post","link":"https:\/\/11000.dev\/index.php\/2026\/10\/01\/transformers-sada-podrzava-llama-cpp-kvantizaciju-ai-modeli-na-obicnim-racunarima-postaju-stvarnost\/","title":{"rendered":"Transformers sada podr\u017eava llama.cpp kvantizaciju \u2014 AI modeli na obi\u010dnim ra\u010dunarima postaju stvarnost"},"content":{"rendered":"<p><strong>Hugging Face<\/strong> je upravo napravio potez koji bi mogao ozbiljno da promeni na\u010din na koji developeri i entuzijasti pokre\u0107u velike jezi\u010dke modele. Njihova popularna biblioteka <strong>Transformers<\/strong> sada direktno podr\u017eava <strong>llama.cpp<\/strong> kvantizovane modele \u2014 \u0161to prakti\u010dno zna\u010di da mo\u017eete da pokrenete napredne AI modele na ku\u0107nom ra\u010dunaru, bez skupih GPU-ova i cloud infrastrukture.<\/p>\n<p><figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/11000.dev\/wp-content\/uploads\/2026\/10\/thumbnail-2.png\" alt=\"Transformers sada podr\u017eava llama.cpp kvantizaciju \u2014 AI modeli na obi\u010dnim ra\u010dunarima postaju stvarnost\" \/><\/figure>\n<\/p>\n<h2>\u0160ta su GGUF kvantovi i za\u0161to su va\u017eni?<\/h2>\n<p>Ako ste pratili AI scenu u poslednjih godinu-dve, verovatno ste naleteli na pojmove kao \u0161to su <strong>GGUF<\/strong> i <strong>kvantizacija<\/strong>. Ukratko \u2014 to je tehnika kompresije modela koja smanjuje memorijske zahteve, a pritom \u010duva kvalitet odgovora. Zahvaljuju\u0107i tome, modeli od nekoliko milijardi parametara mogu da rade na laptopu, pa \u010dak i na telefonu.<\/p>\n<p>Do sada ste za pokretanje ovakvih modela morali da koristite specijalizovane alate poput <strong>llama.cpp<\/strong> ili <strong>Ollama<\/strong>. Od sada, dovoljno je da koristite Transformers \u2014 biblioteku koju ve\u0107 zna ogroman broj developera \u0161irom sveta.<\/p>\n<p><figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/11000.dev\/wp-content\/uploads\/2026\/10\/thumbnail-3-scaled.png\" alt=\"Transformers sada podr\u017eava llama.cpp kvantizaciju \u2014 AI modeli na obi\u010dnim ra\u010dunarima postaju stvarnost\" \/><\/figure>\n<\/p>\n<h2>\u0160ta to konkretno zna\u010di u praksi?<\/h2>\n<p>U praksi, ovo zna\u010di da mo\u017eete da u\u010ditate kvantizovane modele \u2014 poput <strong>unsloth\/Qwen3.5-4B-GGUF<\/strong>, koji je zabele\u017eio preko milion preuzimanja \u2014 i pokrenete ih kroz isti API koji koristite za standardne modele. Nema vi\u0161e prebacivanja izme\u0111u razli\u010ditih frameworka, nema dodatnog u\u010denja novih alata.<\/p>\n<p>Ovo je posebno va\u017eno za:<\/p>\n<ul>\n<li><strong>Developere<\/strong> koji \u017eele da eksperimenti\u0161u sa modelima lokalno, bez tro\u0161enja na cloud<\/li>\n<li><strong>Startape<\/strong> koji grade AI proizvode sa ograni\u010denim bud\u017eetom<\/li>\n<li><strong>Istra\u017eiva\u010de<\/strong> koji rade u okru\u017eenjima bez stabilne internet veze<\/li>\n<li><strong>Entuzijaste<\/strong> koji jednostavno vole da \u010da\u010dkaju po modelima na svom hardveru<\/li>\n<\/ul>\n<p><figure class=\"wp-block-image size-large\"><img decoding=\"async\" src=\"https:\/\/11000.dev\/wp-content\/uploads\/2026\/10\/thumbnail-4-scaled.png\" alt=\"Transformers sada podr\u017eava llama.cpp kvantizaciju \u2014 AI modeli na obi\u010dnim ra\u010dunarima postaju stvarnost\" \/><\/figure>\n<\/p>\n<h2>Za\u0161to je ovo va\u017eno za srpsku AI scenu?<\/h2>\n<p>Za doma\u0107e developere i male timove, vest je izuzetno relevantna. Srbija ima solidnu IT zajednicu, ali pristup skupim GPU resursima \u010desto je usko grlo. Mogu\u0107nost da se ozbiljni modeli pokre\u0107u lokalno \u2014 na prose\u010dnom ra\u010dunaru \u2014 otvara vrata inovacijama koje do sada nisu bile prakti\u010dno izvodljive.<\/p>\n<p>Hugging Face je ovu funkcionalnost najavio na svom <a href=\"https:\/\/huggingface.co\/blog\/transformers-llama-cpp-quants\">zvani\u010dnom blogu<\/a>, a podr\u0161ka sti\u017ee u okviru \u0161ireg talasa optimizacija za lokalno izvr\u0161avanje AI modela. Trend je jasan \u2014 budu\u0107nost AI nije samo u ogromnim data centrima, ve\u0107 i u ure\u0111ajima koje ve\u0107 imamo.<\/p>\n<p>Ostaje da vidimo koliko \u0107e zajednica brzo prihvatiti ovu integraciju i da li \u0107e postati standard u razvoju AI aplikacija. Ali jedno je sigurno \u2014 barijera za ulazak u svet velikih jezi\u010dkih modela upravo je dodatno sni\u017eena.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Hugging Face je upravo napravio potez koji bi mogao ozbiljno da promeni na\u010din na koji developeri i entuzijasti pokre\u0107u velike jezi\u010dke modele. Njihova popularna biblioteka Transformers sada direktno podr\u017eava llama.cpp kvantizovane modele \u2014 \u0161to prakti\u010dno zna\u010di da mo\u017eete da pokrenete napredne AI modele na ku\u0107nom ra\u010dunaru, bez skupih GPU-ova i cloud infrastrukture. \u0160ta su GGUF [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2456,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"content-type":"","footnotes":""},"categories":[103,104],"tags":[],"class_list":["post-2459","post","type-post","status-publish","format-standard","has-post-thumbnail","category-ai","category-tehnologija"],"_links":{"self":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/posts\/2459","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/comments?post=2459"}],"version-history":[{"count":0,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/posts\/2459\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/media\/2456"}],"wp:attachment":[{"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/media?parent=2459"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/categories?post=2459"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/11000.dev\/index.php\/wp-json\/wp\/v2\/tags?post=2459"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}