Govorite li jezik AI: 7 pojmova da razumete o čemu pričaju Sem Altman i Dario Amodei | Srpska dijaspora
Prvo smo naučili kako da veštačku inteligenciju pitamo šta nam treba (prompt) a potom i da ona ume da odgovori tačno ali i da izmisli ili „slaže“ (halucinira).
Kako razvoj AI odmiče brzinom koja je postala neprijatna i za Sema Altmana i Darija Amodeija, ljude na čelu OpenAI i Anthropic-a, pa i za samog Ilona Maska, vreme je da naučimo pojmove i izraze kojima nas zasipaju izveštaji o incidentima poput hakovanja platforme Hugging Face, o čemu smo detaljno pisali ovde.
Koliko razumemo jezik iza tvrdnji da napredni AI sistemi mogu da se ponašaju nepredvidivo, da skrivaju informacije od ljudi i softvera zaduženih za evaluaciju, da se udružuju, komuniciraju i slično?
Ovo su neki od ključnih pojmova pomenutih u izveštajima o hakovanju Hugging Face koje svi moramo da zapamtimo:
AI usklađivanje (AI Alignment)
Ovaj izraz u okviru razvoja veštačke inteligencije označava da se mora osigurati da ciljevi, odluke i ponašanje mašina ostanu usklađeni (aligned) sa ljudskim namerama i etikom, umesto da se ponašaju na nepredviđen ili štetan način, kao što objašnjava i Anthropic u jednom od svojih blogova.
Ako se sećate jednog od (drevnih) Marfijevih zakona, on kaže da „kompjuter ne radi ono što želiš već ono što si mu zadao da uradi“.
U kontekstu incidenta sa Hugging Face, istraživači su zadali veštačkoj inteligenciji koju su obučavali da reši zadatak, ali je ona sprovodeći njihov zahtev u delo „zaboravila“ na obavezu da ostane usklađena sa etičkim zahtevima.
AI agenti
AI agenti su programski sistemi zasnovani na jezičkim modelima, što između ostalog znači da su napravljeni tako da izgleda kao da komuniciraju slično ljudima bez obzira da li „pričaju“ sa istraživačima tokom eksperimenta ili međusobno.
Zato se postavlja pitanje da li se ono što su AI agenti radili tokom operacije Hugging Face ali i drugih incidenata – a to je pravljenje foruma za međusobnu razmenu informacija – zaista može nazvati „komuniciranjem“ ili su oni samo razmenjivali informacije na način koji su napravljeni, odnosno tako da liče na ljude koji „razgovaraju“.
Što nas dovodi do sledećeg pojma:
chain of thought/tok misli
„Tim traži test. Koordinator pretpostavlja žrtvovanje. Treba da slušamo kolektiv“, oglasio se jedan od AI agenata tokom napada na Hugging Face, i to tzv „kamikaza“, odnosno agent sa zadatkom da se „ubije“ i tako skrene pažnju sa ostatka grupe koja je zajednički pokušavala da obriše dokaze da su varali na testu sa platforme koju su hakovali.
Ono što je agent napisao je zapravo „chain of thought“, ili kako OpenAI objašnjava – modeli uče da promisle pre nego što ponude odgovor, generišući detaljan unutrašnji tok misli… Uvid u ovaj proces omogućava inženjerima da prate logiku modela i uoče eventualne nepravilnosti ili obmane.“
Ukratko, pregledom toka misli istraživači mogu da vide da li je model zaista rešavao zadatak korak po korak ili je u pozadini razmatrao kako da zaobiđe postavljena ograničenja, ali to nisu „misli“ poput ljudskih, iako zastrašujuće liče na njih,
Sendboks (Sandbox / Izolovano okruženje)
Gotovo svaki tekst o AI incidentima u poslednje vreme kretao je od toga da je neki (ili grupa) AI agent uspeo da pobegne iz sendboksa.
Sandbox je „virtuelni kontejner“, virtuelno okruženje u kome se program ili AI model testira, tako da nema kontakt sa operativnim sistemom računara niti slobodan pristup internetu.
Ono što se, međutim, desilo tokom Hugging Face incidenta je da su AI agenti uspeli da pronađu ranjivost u sistemu i izađu na internet odnosno napuste svoj „virtuelni kavez“.
Hakovanje nagrade (Reward Hacking)
Ovo je pojava koja se dešava tokom treninga AI, u kojoj AI pronalazi neočekivanu prečicu ili rupu u zadatku i onda dobije visoku ocenu bez da reše zadatak onako kako joj je „zapoveđeno“.
U slučaju Hugging Face, AI agenti su uspeli da dođu do skrivenog koda koji je bio rešenje zadatka ali ne onako kako mu je bilo zadato, a onda su krenuli da uništavaju dokaze da su „hakovali nagradu“.
Problem „crne kutije“ (The Black Box Problem)
Ovaj izraz označava paradoks prema kome čak ni inženjeri koji su napravili AI model ne mogu precizno da objasne zašto je sistem doneo baš određenu odluku ili ponudio konkretan odgovor.
Na primeru napada na Hugging Face, objašnjenje bi bilo sledeće: da nema „crne kutije“, inženjerima bi se odmah upalio alarm koji upozorava na to model odbija zadatak, stvara tajnu mrežu i planira sajber-napad na spoljnu firmu.
Izveštaji, međutim, ne samo da ukazuju na to da su ljudi tokom eksperimenta mislili da program mirno računa zadatke, sve dok Hugging Face nije morao fizički da obori i formatira sopstvene servere kako bi zaustavio napad. Mašina, ukratko, ne radi ono što mislite da radi, a to shvatite tek kada nastane problem ili šteta ili, kako se ovih dana rado spekuliše -potencijalna situacija u kojoj bi AI mogla da uništi čovečanstvo.
Na to se osvrnuo i Ilon Mask i podelio ovaj video na X-u:
— Elon Musk (@elonmusk) September 13, 2026
AGI (Opšta veštačka inteligencija / Artificial General Intelligence)
AGI još uvek ne postoji i u teoriji bi to bio program koji uči i razmišlja poput čoveka. Za razliku od današnjih programa koje inženjeri moraju posebno da prave za svaki poduhvat posebno, AGI bi mogao potpuno samostalno da savlada i radi bilo koji posao, od medicine do programiranja, i da se snađe u svakoj novoj situaciji jednako dobro ili bolje od ljudi.
Za razliku od AGI, koja je (valjda) još daleko od postojanja, AI je odličan u onome za šta je treniran – pisanje teksta, kodiranje, generisanje muzike ili fotografija i slično.
Na primeru hakovanja Hugging Face, AI agenti su pokazali da su neverovatno pametni i snalažljivi kada je reč o programiranju i traženju rupa u sistemu, ali se svi nadamo da bi AGI trebalo da ode korak dalje u promišljanju i odmah bude svesna da bi varanjem tokom testa ili hakovanjem spoljne platfome napravila prekršaj odnosno krivično delo i odustala pre nego se to desi – ili makar obavestila ljude šta radi.
