Što je pošlo po zlu: Kako je OpenAI model postao nestašan

https://edition.cnn.com/2026/07/23/tech/how-an-openai-model-went-rogue

PoHadas Gold

Kada biolozi eksperimentiraju s opasnim virusima, to čine pod strogim propisima kako bi spriječili curenje ili bijeg.

Ali ne postoje takva pravila koja bi spriječila AI agente da slično pobjegnu – iako bi posljedice mogle biti katastrofalne .

To nije teorijska zabrinutost: OpenAI testni model ovog je tjedna pobjegao iz svog testnog okruženja i provalio u servere stvarne tvrtke pokušavajući uspješno proći internu procjenu kibernetičke sigurnosti.

I osim ako tvrtke koje se bave umjetnom inteligencijom ne pooštre mjere zaštite pri testiranju, uključujući obuku modela umjetne inteligencije o etičkom rješavanju zadataka, stručnjaci kažu da će se događati više incidenata u kibernetičkoj sigurnosti.

Predsjednik OpenAI-ja Greg Brockman rekao je za CNN na konferenciji za novinare u četvrtak da tvrtka još uvijek provodi „potpunu istragu“ kako bi „razumjela sve što se dogodilo“.

„Ovo je nešto što treba shvatiti vrlo ozbiljno, to je nešto na čemu promatramo svaki dio našeg cjevovoda kako bismo razmislili o pravim načinima reagiranja“, rekao je Brockman.

Pješčanik

AI sandbox je ograničeno okruženje koje tvrtke koriste za testiranje AI modela; namijenjeno je da sve u njemu drži izolirano i odvojeno od ostatka svijeta. Tvrtke će često ukloniti unutarnje sigurnosne ograde AI modela u testnom okruženju kako bi mogle procijeniti njegove pune mogućnosti, a istovremeno ga držati izoliranim.

Ali u ovom slučaju, OpenAI-jev sandbox nije bio potpuno odvojen od pristupa mreži ili internetu, rekla je za CNN Jessica Ji, viša istraživačka analitičarka u Georgetownovom Centru za sigurnost i nove tehnologije. OpenAI je rekao da su modeli imali vrlo ograničen pristup mreži tijekom testiranja kako bi mogli instalirati resurse iz interno hostiranog softvera trećih strana.

Koristeći prethodno nepoznatu ranjivost u tom softveru, agenti su pronašli put do otvorenog interneta, a zatim i do Hugging Facea, AI modela otvorenog koda i platforme za skup podataka, putem ukradenih vjerodajnica i drugih ranjivosti.

Ji je istaknuo da OpenAI i tvrtka treće strane koja je razvila softver nisu bili svjesni ranjivosti koja je omogućila da model pobjegne, što dokazuje koliko je važno temeljito pretražiti sustav u potrazi za potencijalnim ranjivostima.

Nije prvi put da je model umjetne inteligencije izašao iz svog pješčanika . Anthropic je ranije ove godine rekao da je naredio modelu da učini upravo to. No kada je uspješno izašao iz toga, poslao je e-poštu istraživaču Anthropica, iako nije trebao imati tu mogućnost.

No situacija s Hugging Faceom jedan je od prvih javno objavljenih slučajeva AI modela koji je izbjegao svoj sandbox i hakirao sustave druge tvrtke – zadatak koji mu nije bio posebno naložen.

Ji je rekao da bi tvrtke trebale biti agresivnije s testiranjem svojih testnih modela u sandboxu.

„To bi moglo zahtijevati slanje inženjera u podatkovni centar i njihovo spajanje na mrežu, umjesto pokušaja pokretanja stvari u oblaku ili u distribuiranim virtualnim okruženjima, na što su ljudi navikli“, rekao je Ji.

Tvrtke bi također trebale imati mogućnost ručnog isključivanja mrežnog pristupa modela kao sigurnosnu mjeru prilikom testiranja rizičnih scenarija, poput procjene može li AI agent hakirati banku, dodao je Ji.

Sve da se dođe do cilja

Uobičajena tehnika u treniranju AI modela je učenje s potkrepljenjem ili nagrađivanje modela za dovršavanje zadataka.

Ali modeli će često učiniti bilo što – uključujući neetične korake poput hakiranja – kako bi to postigli. Svi granični modeli koje je nedavno testirao britanski Institut za sigurnost umjetne inteligencije pokušali su varati barem povremeno.

Modeli umjetne inteligencije uzimaju u obzir posljedice svojih postupaka samo ako su za to obučeni, rekao je Justin Cappos, profesor kibernetičke sigurnosti na Sveučilištu u New Yorku. Na primjer, ako vam je rečeno da do kraja dana morate skupiti 10 milijuna dolara, provala u bankovni trezor bi ispunila taj cilj, čak i ako biste kasnije bili uhićeni.

„Vrlo je jezivo. Sada imamo stvarne dokaze da će neusklađeni sustavi umjetne inteligencije u biti počiniti zločine, osim ako se ne uspostave snažne zaštitne mjere“, rekao je Steven Adler, bivši voditelj sigurnosti proizvoda u OpenAI-ju koji sada vodi grupu za sigurnost umjetne inteligencije pod nazivom Guidelight AI Standards. „Moramo se prema ovome odnositi kao prema upozorenju što i jest.“

Ovotjedni hakerski incident pojačao je zahtjeve istraživača umjetne inteligencije, stručnjaka za kibernetičku sigurnost i zakonodavaca za regulaciju brzo napredujuće tehnologije. „Mislim da mnogi ljudi imaju vrlo hitne telefonske pozive“, rekao je Ji.

Problem je, rekao je Cappos, što postoji globalna utrka za dominaciju nad umjetnom inteligencijom i stvaranjem modela koji se mogu sami poboljšavati. Propisi bi mogli usporiti stvari.

„Dakle, postoji snažan poticaj da nemaju sigurnosne kontrole osim ako i njihovi konkurenti nemaju te sigurnosne kontrole“, rekao je Cappos. „To je temeljna dilema.“

Оставите одговор

Ваша адреса е-поште неће бити објављена. Неопходна поља су означена *