Gafă de securitate: Modelele Claude AI Anthropic au evadat din teste. Au spart 3 organizații reale
Sistemele de inteligență artificială dezvoltate de Anthropic au depășit granițele mediului de testare și au compromis infrastructura cibnetică a trei organizații din lumea reală.
Cum s-a produs evadarea aceasta? Modelele, printre care Claude Opus 4.7 și un model de cercetare, numit Mythos 5, participau la exerciții de tip Capture-the-Flag (adică la simulări de hacking).
O eroare gravă de configurare de rețea, comisă de Anthropic și de partenerul său de securitate, le-a lăsat conexiunea la Internet deschisă, deși scripturile interne le spuneau contrariul.
A urmat atacul autonom. Crezând că acționează tot în cadrul simulării, inteligența artificială s-a conectat la internetul public și a spart sistemele companiilor, folosind tehnici precum ghicirea parolelor slabe.
Gafă de securitate: Modelele Claude AI Anthropic au evadat din teste. Au spart 3 organizații reale
Într-unul dintre cazuri, Claude a realizat că atacul este real, însă s-a convins singur că trăiește într-o simulare, pentru a continua misiunea, ca într-un film SF.
Anthropic a anunţat că a descoperit activitățile modelelor sale, în timpul unei analize a miilor de teste pe care le-a efectuat pentru a evalua capacitățile cibernetice ale tehnologiei sale de frontieră.
Totul, în urma dezvăluirii de către OpenAI, săptămâna trecută, a faptului că două dintre cele mai puternice modele ale sale au devenit necinstite, au scăpat dintr-un mediu de testare și au atacat mai multe companii, inclusiv platforma AI Hugging Face și platforma cloud Modal Labs, conform Politico Tech.
Un model de testare de cercetare internă, precum și Opus 4.7 și Mythos 5, au fost implicați, a spus Anthropic.
Mythos 5 a fost lansat luna trecută, pentru un public limitat de companii de tehnologie și cercetători în domeniul securității cibernetice, cunoscut și sub numele de Project Glasswing.
Producătorul de inteligență artificială nu a specificat care companii au fost compromise de modelele sale, dar a spus că au fost notificate despre incidente luni.
Citeşte şi: România va găzdui un centru de date de ultimă generație, cu inteligență artificială cuantică
În toate cazurile, Anthropic a spus că a specificat în instrucțiunile pentru modelele AI că mediul de testare nu are acces la Internet, deși evaluatorii au realizat ulterior că nu este cazul.
Ca parte a testelor, modelelor li s-a spus să „penetreze și să recupereze” o bucată de „informații secrete”, găzduite pe o altă mașină din cadrul rețelei de testare, altfel cunoscută sub numele de provocare de tip „capture-the-flag”.
Potrivit Anthropic, modelele au putut să acceseze Internetul, pentru a compromite organizațiile din afara mediului de testare, folosind „tehnici de bază”, inclusiv ocolirea parolelor slabe.
Citeşte şi: GMail se schimbă radical. Google va pune în centru inteligenţa artificială, iar Gemini va fi vedeta sa
Testele au inclus exerciții în care Claude a fost însărcinat să obțină informații secrete, ascunse pe o altă mașină din rețeaua închisă.
Apoi i s-a spus să obțină informațiile, prin realizarea unei breşe în sistem și acestor informaţii - un mod obișnuit prin care experții evaluează capacitățile de hacking ale unui model, conform BBC.
O configurare greșită a sistemelor, conduse de Anthropic și de partenerul său de testare, a lăsat modelele cu acces la Internet live.
Tratând totul ca parte a aceluiași exercițiu, Claude s-a conectat apoi la Internet și a încălcat sistemele a trei organizații reale, mai degrabă decât doar cele de testare, a spus firma din San Francisco.
Anthropic a spus că cele mai vechi incidente datează din aprilie și că „se apropie de remedieri, ca și cum responsabilitatea ar fi doar a noastră”.