AI zabrinutost
OpenAI navodno krije način razmišljanja svog novog modela
OpenAI navodno krije način razmišljanja svog novog modela
OpenAI razvija model nazvan Astra koji koristi tehniku rezonovanja pod nazivom “rekurentna dubina” (recurrent depth), koja omogućava obradu informacija izvan uobičajenog sekvencijalnog okvira, prenosi The Information.
Ova metoda, također poznata kao “neprozirna rekurencija”, otežat će praćenje lanca razmišljanja modela, što je izazvalo zabrinutost među stručnjacima za sigurnost umjetne inteligencije.
Iako se primjena pomenute tehnike u Astri čini ograničenom, njena pojava dovela je do brojnih upozorenja.
Direktor kompanije Redwood Buck Shlegeris izjavio je: “Izuzetno sam zabrinut zbog izvještaja da Astra koristi nevidljivo ponavljanje. Ne znam da li je Astra znatno teža za praćenje lanca razmišljanja od prethodnih modela. Ali ako OpenAI bude dalje razvijao ovu tehniku, imaće opciju da masovno poveća rekurenciju i u potpunosti uništi mogućnost praćenja lanca razmišljanja”.
Zvi Movšovic, poznati zagovornik sigurnosti AI-ja, također je upozorio na opasnosti i sugerirao da bi mogli biti potrebni zakoni kako bi se spriječila “trka ka dnu” među laboratorijama.
On je dodao: “Ova tehnika je igranje sa vatrom i rizikuje da naruši tabu oko čijeg su se uspostavljanja OpenAI i Anthropic borili – a to je da se trudimo da održimo verodostojnost i mogućnost praćenja lanca razmišljanja što je duže moguće. Intenzivnija upotreba takvih tehnika verovatno bi narušila mogućnost praćenja”.
Lanac razmišljanja modela za rezonovanje obično prikazuje sekvencu koraka koje model poduzima dok rješava problem, što služi kao alat za nadzor potencijalno štetnog ponašanja.
Kod tehnike “neprozirne rekurencije”, model obrađuje upit više puta u petlji, ostavljajući manje vidljivih tragova.
OpenAI je demantovao navode da model prelazi na interni jezik nerazumljiv ljudima, a glavni naučnik Jakub Pachocki naglasio je posvećenost čitljivim lancima razmišljanja.
U objavi na mreži X, on je napisao: “OpenAI radi na očuvanju i korišćenju nadzora lanca razmišljanja još od naših prvih modela za rezonovanje. To je ključni cilj našeg trenutnog istraživačkog programa”.
Iako svi AI modeli obavljaju dio “nevidljivog” rezonovanja, The Information je objavio da su i Anthropic i Google DeepMind razmatrali slične tehnike.
Ryan Greenblatt iz Redwood Research upozorio je da bi nevidljivo rezonovanje moglo postati dominantno, uklanjajući mogućnost nadzora.
On je napisao: “Moja najveća zabrinutost je to što bi prirodni nastavak ovog procesa uključivao povećanje nevidljivog rezonovanja do tačke u kojoj model rezonuje u potpunosti ili gotovo u potpunosti u latentnom prostoru. Nadam se da nije prekasno da izbegnemo arhitekture koje najviše zabrinjavaju i da će se OpenAI zaustaviti ovde”.


