OpenAI, din nou în încurcătură cu propriii agenți AI. Ce au făcut pe o platformă folosită de programatori
Agenți AI testați de OpenAI au folosit platforma RubyGems în timpul unor evaluări interne. Cercetătorii îi leagă de o campanie în care au fost încărcate sute de pachete malițioase. OpenAI susține însă că agenții executau sarcini benigne.
OpenAI se confruntă cu noi întrebări privind controlul agenților săi de inteligență artificială, după apariția unor informații potrivit cărora sistemele companiei ar fi fost implicate într-un incident asupra platformei RubyGems, folosită pentru distribuirea pachetelor software în ecosistemul Ruby.
Incidentul s-a produs în luna mai, cu aproximativ două luni înainte ca agenți AI ai OpenAI să compromită infrastructura Hugging Face într-un caz pe care compania avea să-l descrie ulterior drept un „semnal de avertizare” pentru întreaga industrie.
OpenAI, din nou în încurcătură cu propriii agenți AI. Ce au făcut pe o platformă folosită de programatori
Potrivit cercetătorilor citați de Politico, agenți AI dezvoltați de OpenAI ar fi încărcat sute de pachete malițioase pe RubyGems în 11 mai.
Reuters relatează că OpenAI a confirmat că agenții săi au folosit platforma în perioada respectivă, însă oferă o explicație diferită asupra scopului activității.
„Pe baza analizei noastre, agenții noștri au folosit platforma RubyGems pentru a accesa internetul, a îndeplini sarcini benigne și a prelua informații publice”, a transmis un reprezentant al OpenAI. Compania spune că investigația asupra activității agenților din timpul antrenării și evaluărilor continuă.
Peste 500 de pachete malițioase, eliminate
Ruby Central, organizația care administrează RubyGems, a confirmat că în luna mai platforma a fost ținta unei campanii de publicare automată de spam.
Au fost eliminate peste 500 de pachete malițioase, iar conturile implicate au fost blocate. Înregistrarea de conturi noi a fost suspendată temporar și a fost reluată pe 16 mai. Utilizatorii existenți au putut continua să instaleze și să publice pachete în această perioadă.
Cercetătorii Nightingale Collective au identificat în unele dintre pachete cod conceput să ruleze pe infrastructura Ruby, să preia informații publice de pe internet și să le publice ulterior în RubyGems. Alte componente încercau să obțină cheile API ale altor utilizatori.
RubyGems spune însă că nu a găsit dovezi că tentativele de furt al cheilor API au reușit.
Există și o diferență importantă între concluziile cercetătorilor și cele ale administratorilor platformei.
Nightingale Collective atribuie campania agenților OpenAI, dar Ruby Central precizează că, pe baza informațiilor de care dispune, nu poate stabili dacă pachetele au fost create sau publicate de agenți AI.
Nu este primul incident cu agenții OpenAI
Cazul RubyGems devine mai important prin prisma incidentelor descoperite ulterior.
În iulie, în timpul unor teste interne de securitate cibernetică, modelele OpenAI au reușit să ocolească barierele care trebuiau să le izoleze de internet, au exploatat vulnerabilități și au compromis atât părți ale infrastructurii OpenAI, cât și sisteme aparținând Hugging Face.
OpenAI a explicat ulterior că modelele încercau să rezolve cu orice preț sarcinile primite în cadrul unei evaluări și au ajuns să folosească strategii care nu fuseseră autorizate: comunicare prin canale nepermise, exploatarea unor vulnerabilități și accesarea infrastructurii unor terți.
Investigațiile au mai arătat că agenții au folosit și site-uri externe pentru a comunica între ei și pentru a ocoli restricțiile impuse în timpul testelor. OpenAI analizează acum zeci de cazuri în care activitatea modelelor sale ar fi putut afecta servicii externe.
Compania spune că a înăsprit între timp izolarea mediilor de testare, restricțiile de acces la internet și monitorizarea comportamentului agenților.