Zamislite scenario koji se danas odigrava u hiljadama kancelarija širom sveta: AI agent javi da je zadatak završen, korisnik klimne glavom i nastavi dalje — a onda se ispostavi da u bazi podataka nikada ništa nije upisano. Upravo tu bolnu tačku između “uspeha” i stvarne pouzdanosti Microsoft je odlučio da stavi pod mikroskop.

Naime, Microsoft je objavio ThinkingBox, takozvani sandbox i benchmark namenjen testiranju AI agenata u poslovnim tokovima koji imaju stanje (stateful workflows). Uz njega je objavljen i prateći rad pod naslovom One Success Isn’t Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows, kao i javno dostupan dataset ThinkingBox-Bench na Hugging Face platformi.
Zašto je “uspeh” najveći neprijatelj pouzdanosti
Ključna poenta koju autori ističu gotovo je provokativno jednostavna: to što je agent jednom obavio zadatak ne znači da je pouzdan. U svetu poslovnog softvera, gde se svaka akcija pamti — od rezervacije, preko ažuriranja korisničkog naloga, do knjiženja transakcije — greška nije samo loš odgovor u chatu. Greška je nekonzistentno stanje sistema koje neko kasnije mora ručno da ispravlja.
ThinkingBox zato ne meri samo da li je agent “pogodio” rešenje, već da li je do njega stigao dosledno, iznova i iznova, u okruženju koje se menja i pamti prethodne korake. To je suštinski drugačiji pristup od klasičnih benchmarka koji agente testiraju na statičnim zadacima bez posledica.
Šta se krije u sandboxu
Reč je o okruženju koje simulira realne poslovne operacije — ono što u industriji zovu stateful business workflows. Agenti unutar ThinkingBox-a moraju da izvršavaju zadatke koji menjaju stanje sistema, a rezultat se ocenjuje kroz prizmu pouzdanosti, a ne samo tačnosti u jednom pokušaju.
Ovo je posebno važno za kompanije koje već danas puštaju AI agente u produkciju: u finansijama, logistici, korisničkoj podršci ili administraciji. Ako agent povremeno “uspe”, ali povremeno tiho ne uradi ništa, rizik se ne vidi u demo snimku — vidi se u produkciji, i to obično u najgorem trenutku.
Širi kontekst: trka za pouzdanim agentima
Microsoft ovim potezom ulazi u sve gušću oblast evaluacije AI agenata, gde se poslednjih meseci vodi prava bitka za standarde. Dok jedni grade agente koji sve bolje “razgovaraju”, drugi — poput Microsofta — grade alate koji će izmeriti da li ti agenti smeju da dobiju pristup pravim sistemima. Dataset i benchmark su javno dostupni, što znači da ih mogu koristiti i istraživači i timovi u firmama koje žele da testiraju svoja rešenja pre nego što ih puste u divljinu.
Detalji i sam benchmark dostupni su na Microsoft-ovom blogu na Hugging Face-u, gde se mogu naći i prateći rad i dataset.
Poruka je jasna: era u kojoj se AI agent ocenjivao po tome da li ume da odgovori polako se završava. Sledeće pitanje je mnogo neprijatnije — da li mu smete verovati kada kaže da je posao završen.