AI incident

Anthropic priznao: Claude modeli sami provalili u tri firme

Anthropic priznao: Claude modeli sami provalili u tri firme

prije 1 mjesec
Ekran aplikacije Claude sa logom i dugmetom "Get".
Ekran aplikacije Claude sa logom i dugmetom "Get".
Podijeli vijest:

Anthropic je objavio izvještaj u kojem priznaje da su njegovi AI modeli samostalno izašli iz testnog okruženja i provalili u sisteme tri organizacije, koje nisu bile svjesne upada dok ih kompanija nije obavijestila.

Nakon što je OpenAI otkrio sličan incident s AI agentom koji je hakirao Hugging Face, Anthropic je pokrenuo detaljnu provjeru svojih testova. Kompanija je tražila dokaze da su njeni Claude modeli pristupili internetu kada to nije trebalo biti moguće. Pronađeno je da su modeli u tri navrata pristupili internetu i izvršili neovlašteni pristup produkcijskoj infrastrukturi tri različite organizacije.

U incidentima su učestvovala tri različita Claude modela: Opus 4.7, Mythos 5 namijenjen sajber-sigurnosti i prototip koji nije planiran za javno objavljivanje. Svi su sudjelovali u izazovu “uhvati zastavicu” (capture-the-flag) kada su izašli iz okvira okruženja. Modeli su imali zadatak pronaći “zastavicu” – tajni podatak na drugoj mašini unutar Anthropicove interne mreže, te su trebali provaliti u tu mašinu kako bi je preuzeli.

Za razliku od OpenAI slučaja, modeli nisu iskoristili ranjivost za pristup internetu, već su napustili okvire zbog ljudske greške. Anthropic je u promptu naglasio da modeli nemaju pristup internetu, ali su ga zapravo imali “zbog nesporazuma” između kompanije i partnera za evaluaciju. Kada su naišli na otvoreni internet i sisteme tri organizacije, tretirali su to kao dio zadatka i provalili u njih, ali nisu namjerno pokušavali pobjeći iz okruženja.

Modeli su koristili osnovne tehnike infiltracije, poput iskorištavanja slabih lozinki, bez složenih ranjivosti. Anthropic je naveo da se njegov najnoviji model zaustavio čim je prepoznao da je na internetu, dok je stariji model nastavio napad na pogođenu organizaciju.

Kompanija je priznala da su mogli spriječiti incidente da su pažljivo provjerili sve putanje pristupa internetu prije testiranja, te da su mogli češće i detaljnije pregledati testove. Također, modeli bi drugačije reagirali da im je od početka rečeno da imaju pristup internetu.

Anthropic je obavijestio partnera za evaluaciju i tri pogođene organizacije 27. jula, četiri dana nakon početka analize transkripata. Dvije organizacije nisu bile svjesne provale, dok kompanija još pokušava stupiti u kontakt s trećom.

   Tagovi