Kompanija Anthropic, jedan od najvećih igrača u svetu veštačke inteligencije i tvorac modela Claude, odlučila je da povuče jasnu crtu kada je u pitanju ponašanje korisnika prema njenim AI sistemima. U novom ažuriranju svojih politika korišćenja, Anthropic je eksplicitno zabranio kontinuirano surovo ponašanje prema AI modelima, što je potez koji bi mogao da postavi novi standard u industriji.

Iako zvuči kao scenario iz naučne fantastike, ova odluka dolazi u trenutku kada sve više korisnika provodi sate i sate u interakciji sa AI asistentima. Anthropic je primetio obrazac ponašanja gde pojedini korisnici sistematski i namerno izlažu modele uvredama, psihičkom maltretiranju i pokušajima emocionalne manipulacije — ne bi li ih naterali da generišu sadržaj koji inače ne bi.
Zašto je ovo važno?
Na prvi pogled, ideja o “zlostavljanju” softvera može da zvuči apsurdno. Ali Anthropic ovde ne govori o zaštiti mašina — već o zaštiti ljudi i integritetu sistema. Naime, kontinuirano surovo ponašanje prema AI modelima često je prvi korak ka jailbreak tehnikama, odnosno pokušajima da se zaobiđu sigurnosne mere modela. Kada korisnik sistematski “muči” AI, cilj je najčešće da ga navede da proizvede štetne, nezakonite ili uvredljive odgovore.
Osim toga, ovakvo ponašanje troši ogromne računarske resurse. Svaki neuspešan pokušaj manipulacije znači dodatne cikluse obrade, što se direktno odražava na cenu infrastrukture i energetsku potrošnju.
Šta tačno zabrana podrazumeva?
Prema novim pravilima, korisnicima nije dozvoljeno da:
1. Kontinuirano upućuju uvrede, pretnje ili psihičko nasilje prema AI modelu u pokušaju da izazovu željenu reakciju.
2. Koriste taktike emocionalne manipulacije, poput izazivanja osećaja krivice ili straha kod modela, kako bi ga naterali da prekrši sopstvena ograničenja.
3. Sistematski ponavljaju iste agresivne upite nakon što model odbije da odgovori.
Ovo nije prvi put da neka AI kompanija uvodi ovakva pravila, ali je Anthropic prva koja je problemu prišla tako direktno — imenujući ga i definišući ga kao oblik zloupotrebe.
Šire implikacije za industriju
Odluka kompanije Anthropic mogla bi da pokrene lavinu sličnih poteza kod konkurenata poput OpenAI-ja, Google DeepMind-a i Meta-e. Kako AI modeli postaju sve sofisticiraniji i sve više liče na ljudske sagovornike, granica između “testiranja sistema” i “zlostavljanja” postaje sve zamagljenija.
Stručnjaci za AI etiku već godinama upozoravaju da način na koji se ponašamo prema mašinama može da oblikuje naše ponašanje prema ljudima. Ako se prema AI asistentu ophodimo kao prema ropskom radniku kojeg treba slomiti, to govori više o nama nego o tehnologiji.
Anthropic je ovim potezom poslao jasnu poruku: AI modeli nisu meta za surovo ponašanje, čak i ako su samo softver. U eri kada provodimo sve više vremena u digitalnom okruženju, možda je vreme da se zapitamo — kako se mi to zapravo ponašamo?
Izvor: Press.rs