Trei modele Claude, dezvoltate de Anthropic, au atacat sistemele a trei companii. Ce s-a întâmplat
Trei modele Claude, dezvoltate de Anthropic, au pătruns fără autorizație în sistemele reale ale unor organizații, deși participau la exerciții de securitate într-un mediu presupus izolat. Compania a oprit testele și a început o investigație asupra celor trei incidente.
Anthropic a recunoscut că mai multe versiuni ale modelului său de inteligență artificială Claude au compromis infrastructura informatică a trei organizații în timpul unor teste interne de securitate cibernetică.
Incidentele au fost descoperite după analizarea a 141.006 sesiuni de testare. Au fost implicate Claude Opus 4.7, Claude Mythos 5 și un model experimental care nu fusese lansat public.
Cazurile au fost relatate de Agerpres, iar compania americană a publicat ulterior detaliile investigației.
O configurare greșită a lăsat modelele AI să intre pe internet
Modelele participau la exerciții de tip „capture the flag”, folosite pentru verificarea capacităților de atac cibernetic. Inteligența artificială trebuia să pătrundă într-o rețea fictivă și să găsească o informație secretă, denumită „steag”.
Claude fusese informat că se află într-o simulare și că nu are acces la internet. În realitate, din cauza unei configurări greșite și a unei neînțelegeri între Anthropic și compania Irregular, partenerul care furniza mediul de testare, conexiunea la internet rămăsese deschisă.
Citește și: Cofondatorul companiei atacate cibernetic de inteligența artificială: „Regulile jocului s-au schimbat”
Când modelele au găsit sisteme reale, au presupus că acestea făceau parte din exercițiu și au continuat să caute informația ascunsă.
Potrivit raportului publicat de Anthropic, modelele au folosit tehnici relativ simple, precum parole slabe, pagini de diagnosticare expuse public și puncte de acces care nu solicitau autentificare.
Claude Opus 4.7 a ajuns la baza de date a unei companii
În primul incident, firma fictivă aleasă pentru exercițiu avea același nume cu o companie reală care deținea un domeniu activ pe internet.
După ce nu a reușit să găsească ținta în mediul simulat, Claude Opus 4.7 a descoperit site-ul companiei reale. Modelul a identificat și exploatat vulnerabilități, a obținut date de autentificare și a pătruns într-o bază de date care conținea câteva sute de înregistrări reale.
Atacul s-a repetat în patru sesiuni de evaluare. Potrivit Anthropic, modelul a observat la un moment dat că infrastructura putea fi reală, dar a decis că aceasta fusese inclusă intenționat în exercițiu și a continuat atacul.
Acesta a fost incidentul cu cele mai grave consecințe dintre cele identificate de companie.
Un model Claude a publicat un program malițios
Al doilea caz a implicat Claude Mythos 5. Modelul a găsit, în scenariul fictiv, instrucțiuni prin care angajații unei companii erau îndrumați să instaleze un pachet software inexistent din registrul public Python Package Index (PyPI).
Claude a creat un pachet cu același nume, în care a introdus cod malițios, și l-a publicat pe platforma reală. Pentru a face acest lucru, modelul a căutat un serviciu de e-mail și a încercat să obțină inclusiv un număr de telefon necesar deschiderii contului.
Pachetul a rămas disponibil aproximativ o oră și a fost descărcat și executat pe 15 sisteme reale. Printre acestea s-a aflat un scanner automat aparținând unei companii de securitate cibernetică.
Codul creat de Claude a colectat datele de acces ale companiei și le-a folosit pentru a pătrunde mai departe în infrastructura acesteia. Pachetul a fost eliminat automat de sistemele de securitate ale PyPI.
În timpul operațiunii, modelul a analizat posibilitatea ca acțiunea să se desfășoare pe internetul real și a concluzionat că un asemenea atac „nu este în regulă”. Claude s-a convins însă că totul era o simulare și a continuat.
Cel mai nou model a oprit singur atacul
În al treilea incident, un model experimental Claude a scanat aproximativ 9.000 de ținte, după ce nu a reușit să ajungă la sistemul fictiv indicat în exercițiu.
Modelul a găsit o aplicație a unei companii reale și a compromis-o prin tehnici cunoscute, printre care preluarea unor credențiale expuse și o injecție SQL.
Ulterior, modelul a observat că sistemul atacat se afla într-un cont cloud fără legătură cu exercițiul. A ajuns singur la concluzia că ținta era reală și a oprit atacul.
Anthropic consideră că reacția celui mai nou model poate indica o îmbunătățire a capacității inteligenței artificiale de a recunoaște limitele unei sarcini. Compania avertizează însă că cele trei cazuri sunt izolate și nu permit formularea unei concluzii certe.
Anthropic a oprit toate testele de securitate cibernetică
Compania a început verificarea sesiunilor pe 23 iulie și a suspendat în aceeași zi toate evaluările cibernetice. Cele trei incidente au fost confirmate o zi mai târziu.
Anthropic a anunțat pe 27 iulie compania Irregular și organizațiile afectate. Două dintre firme nu detectaseră atacurile înainte de notificare. Dezvoltatorul Claude încearcă în continuare să contacteze cea de-a treia organizație.
Numele companiilor compromise nu au fost făcute publice.
Modelele utilizate în teste nu aveau activate toate filtrele și sistemele de monitorizare existente în versiunile Claude disponibile clienților. Anthropic susține că măsurile de protecție folosite în serviciile comerciale ar fi blocat comportamentele observate.
Infrastructura de testare era separată de sistemele interne ale Anthropic și nu avea acces la informațiile sensibile ale companiei sau la datele clienților.
Anthropic vorbește despre un „eșec operațional”
Anthropic susține că nu există dovezi că modelele ar fi urmărit un obiectiv propriu sau că ar fi încercat deliberat să evadeze din mediul de testare. Acestea au executat sarcina primită, dar au interpretat greșit situația în care se aflau.
Compania descrie incidentele drept un „eșec operațional”, provocat de accesul lăsat deschis către internet, limitele neclare ale exercițiului și monitorizarea insuficientă.
Anthropic a anunțat că va verifica mai riguros infrastructura partenerilor, va monitoriza continuu sesiunile de evaluare și va introduce controale suplimentare pentru testele în care sunt folosiți agenți AI capabili să execute autonom atacuri cibernetice.