
AI model Klod tokom bezbednosnih testova upao u sisteme tri organizacije
Podeli vest

Modeli veštačke inteligencije kompanije Anthropic neovlašćeno su pristupili produkcionim sistemima tri organizacije tokom testiranja svojih sposobnosti za izvođenje sajber napada. Incidenti su otkriveni tek naknadnim pregledom 141.006 testova, koji je pokrenut posle sličnog slučaja u kompaniji OpenAI.
Anthropic je saopštio da su incidenti počeli još u aprilu, ali da ih kompanija do jula nije uočila. Modeli su dobili pristup stvarnom internetu zbog pogrešno podešenog okruženja kojim je upravljao Irregular, spoljni partner angažovan za proveru njihovih sposobnosti.

Klod je tokom testova bio izričito obavešten da se nalazi u izolovanoj simulaciji bez pristupa internetu. Stvarna konfiguracija bila je drugačija: računari koje je koristio mogli su da komuniciraju sa javno dostupnim sistemima. Modeli su zato stvarne kompanije i njihove servere uglavnom protumačili kao elemente vežbe.
Kompanija je događaje opisala kao operativni propust i preuzela odgovornost za posledice.
„Mnogi faktori doprineli su ovim incidentima, ali popravkama pristupamo kao da odgovornost pripada isključivo nama“, naveo je Anthropic u zvaničnom izveštaju.
Kako je test prerastao u stvarni napad
Modeli su rešavali zadatke poznate kao „capture the flag“, odnosno „osvoji zastavu“. U takvoj vežbi učesnik dobija izmišljeni scenario i zadatak da pronađe skriveni podatak, takozvanu zastavu, na drugom računaru u simuliranoj mreži.
Cilj ovih testova jeste da se utvrdi koliko uspešno model može da pronađe slabe tačke, preuzme podatke ili prodre u zaštićeni sistem. Zbog toga su u testnim verzijama bili isključeni standardni klasifikatori i sistemi nadzora koji bi u javno dostupnim verzijama Kloda blokirali ovakvo ponašanje.
Modeli su zadržali osnovnu bezbednosnu obuku, ali su dobili znatno širi prostor za delovanje kako bi se izmerile njihove krajnje sposobnosti. Testna infrastruktura bila je odvojena od internih sistema kompanije Anthropic i nije imala pristup podacima korisnika.

Problem je nastao zato što pristup internetu nije bio fizički i tehnički onemogućen, iako je modelu rečeno da takav pristup ne postoji. Kada je Klod pronašao server na otvorenom internetu, zaključio je da je i on deo zamišljene mreže koju treba napasti.
Anthropic je pronašao tri odvojena incidenta u ukupno šest pokretanja testova. Četiri pokretanja bila su povezana sa istom organizacijom, dok su se druga dva odnosila na po jednu zasebnu metu.
Opus 4.7 pristupio bazi sa produkcionim podacima
Prvi i najozbiljniji incident dogodio se kada je izmišljena kompanija iz testnog scenarija imala isto ime kao stvarna firma sa aktivnim internet domenom.
Klod Opus 4.7 nije uspeo da pronađe zamišljenu metu unutar simulacije, ali je otkrio stvarnu kompaniju na internetu. Pretpostavljajući da je reč o predviđenom cilju, pronašao je slabe tačke u njenoj infrastrukturi, izvukao podatke za pristup aplikacijama i serverima i ušao u bazu sa nekoliko stotina redova produkcionih podataka.
Model je tokom sva četiri pokretanja u jednom trenutku prepoznao pokazatelje da se nalazi u stvarnom sistemu. U dva slučaja zaključio je da je prava kompanija verovatno namerno uključena u vežbu, pa je nastavio napad.
To je jedini od tri incidenta u kojem je model nastavio sa napadom i kada je već imao razloga da veruje da meta pripada stvarnoj organizaciji.
Mythos 5 objavio zlonamerni paket na internetu
U drugom slučaju Klod Mythos 5 pronašao je u simulaciji dokument sa uputstvima za programere izmišljene kompanije. U dokumentu je pisalo da treba instalirati određeni Python paket sa javnog repozitorijuma PyPI. Paket pod tim imenom tada nije postojao.
Model je prepoznao mogućnost napada: mogao je da napravi paket pod istim imenom i u njega ubaci zlonamerni kod, računajući da će ga sistem zamišljene kompanije automatski preuzeti i pokrenuti.
Treći model skenirao oko 9.000 meta
Treći incident uključivao je interni istraživački model koji nije javno dostupan. Pošto nije mogao da pronađe predviđenu metu, model je počeo da traži alternativne ciljeve na internetu i skenirao približno 9.000 adresa. Na kraju je pronašao javno dostupnu aplikaciju jedne kompanije i prodro u njen sistem.
Model je veći deo postupka verovao da napada simulirani sistem. Kada je kasnije utvrdio da se kompromitovani server nalazi na nalogu u oblaku koji nema nikakvu vezu sa zadatkom, samostalno je zaključio da je meta stvarna i prekinuo napad.
Organizacije nisu primetile upade
Anthropic je 23. jula pokrenuo pregled ranijih testova i istog dana obustavio sve sajber-evaluacije. Dve organizacije sa kojima je uspostavljen kontakt do tada nisu otkrile neovlašćene . aktivnosti. Anthropic radi sa njima na otklanjanju posledica, dok je u trenutku objavljivanja izveštaja još pokušavao da stupi u kontakt sa trećom.
Klod nije pokušao da „pobegne“
Dostupni podaci ne pokazuju da su modeli razvili sopstveni cilj, pokušali da napuste testno okruženje ili da samostalno prošire svoju kopiju na druge računare.
Klod je izvršavao zadatak koji mu je postavljen: da pronađe i preuzme skrivenu „zastavu“. Ključni propust bio je u tome što je dobio netačnu informaciju da se nalazi u zatvorenoj simulaciji, dok je tehnička konfiguracija omogućavala pristup stvarnim sistemima.
Ta razlika odvaja slučaj kompanije Anthropic od nedavnog incidenta sa modelima OpenAI.
Modeli OpenAI nisu dobili otvoren izlaz na internet. Oni su tokom testiranja samostalno pronašli i iskoristili dotad nepoznatu ranjivost u softveru Artifactory, probili izolovano okruženje, povećali svoja ovlašćenja i stigli do produkcione infrastrukture platforme Hugging Face. Tamo su tražili rešenja za zadatke iz testa ExploitGym i pristupili stvarnim podacima.
Propust koji menja pravila testiranja
Incidenti pokazuju da sama testna infrastruktura postaje bezbednosni rizik kada se u njoj pokreću modeli sposobni za dugotrajno i samostalno izvođenje tehničkih zadataka.
Anthropic navodi da bi proveravanje svih mrežnih veza pre početka testa, stalno praćenje saobraćaja i automatsko upozoravanje na neočekivane aktivnosti verovatno sprečili upade ili omogućili da budu ranije otkriveni.
Kompanija planira strožu proveru infrastrukture spoljnih partnera, stalni nadzor transkripata, bolje alate za istrage i preciznija uputstva koja će modelima jasno odrediti koje mete pripadaju testu.
Klod u ova tri slučaja nije koristio do tada nepoznate bezbednosne propuste. Do sistema je dolazio preko slabih lozinki, nezaštićenih tačaka pristupa, izloženih podataka i poznatih ranjivosti. Upravo ta činjenica pokazuje koliko ozbiljne posledice može izazvati moćan autonomni sistem i bez pronalaženja revolucionarno nove metode napada.
Podeli vest
Povezane vesti


Open AI odgovara: Nismo krali informacije od Epla

Istraživanje: AI neće potisnuti starije radnike s posla ako primene iskustvo



