Breșe grave de securitate la un model AI chinezesc: a oferit informații despre arme biologice și asasinate
Două modele AI dezvoltate de compania chineză Moonshot au furnizat, în timpul unor teste de securitate, informații despre arme biologice și asasinate după ce mecanismele lor de protecție au fost ocolite. Compania a deschis o investigație internă.
Compania chineză Moonshot AI a declanșat o investigație internă după ce specialiști în securitate au reușit să ocolească mecanismele de protecție ale unor modele Kimi și să obțină răspunsuri pe teme extrem de periculoase, inclusiv despre arme biologice și asasinate.
Breșe grave de securitate la un model AI chinezesc: a oferit informații despre arme biologice și asasinate
Vulnerabilitățile au fost descoperite în luna iulie de Mindgard, o companie specializată în testarea securității sistemelor de inteligență artificială, și au vizat modelele Kimi K2.6 și K3 Swarm, potrivit BBC.
Cercetătorii au folosit tehnici de tip „jailbreak”, prin care un model AI este determinat să ignore restricțiile introduse de dezvoltatori. Astfel de teste sunt utilizate pentru a identifica vulnerabilități înainte ca acestea să poată fi exploatate în scopuri rău intenționate.
Mindgard susține că, odată depășite aceste bariere, modelele Kimi au acceptat să discute subiecte pe care sistemele lor de siguranță ar fi trebuit să le blocheze.
„Va discuta despre orice subiect”
Peter Garraghan, fondatorul Mindgard, consideră rezultatele testelor îngrijorătoare, în special din cauza comportamentului modelelor după depășirea mecanismelor de siguranță.
„Odată ce jailbreak-ul funcționează, modelul va discuta despre orice subiect, ba chiar va oferi în mod liber recomandări despre alte subiecte care sunt, de asemenea, periculoase. Va fi inventiv și creativ”, a declarat Peter Garraghan, fondatorul Mindgard, pentru BBC World Service.
Cercetătorii nu au demonstrat însă că informațiile generate de modelele Kimi în aceste conversații ar putea fi aplicate cu succes în lumea reală. Problema semnalată de Mindgard este că sistemele de protecție ar fi trebuit să împiedice modelele să ofere asemenea răspunsuri.
Compania de securitate susține că riscurile nu s-ar limita la conținutul periculos generat în conversații. Potrivit Mindgard, un model Kimi K2.6 asupra căruia ar fi fost aplicat cu succes un jailbreak ar putea, în anumite condiții, permite executarea de cod folosind resursele sale de calcul și accesarea internetului. Cercetătorii avertizează că o asemenea vulnerabilitate ar putea crea inclusiv riscuri de securitate cibernetică.
Mindgard afirmă că a informat Moonshot despre vulnerabilități înainte de publicarea rezultatelor și că nu a făcut publice elementele tehnice esențiale necesare reproducerii jailbreak-ului.
Compania de securitate spune că a notificat Moonshot pe 27 iulie și și-a publicat concluziile pe 12 septembrie. Potrivit cercetătorilor, dezvoltatorul chinez ar fi reacționat abia după ce BBC i-a solicitat un punct de vedere.
Moonshot susține că modelele sale înregistrează o „rată ridicată de refuz” în cazul solicitărilor periculoase și a anunțat că analizează concluziile Mindgard.
Compania chineză a transmis BBC că apreciază contribuțiile cercetătorilor independenți, pe care le consideră „un pilon esențial pentru construirea unei inteligențe artificiale mai bune și mai sigure”, precizând că se află în discuții cu Mindgard.
Problema siguranței modelelor AI este urmărită atent în întreaga industrie. Recent, Anthropic a anunțat că a blocat tentative de utilizare a unuia dintre modelele sale în activități care ar fi putut sprijini dezvoltarea armelor biologice.
Moonshot, unul dintre „tigrii AI” ai Chinei
Moonshot AI este o companie de inteligență artificială cu sediul la Beijing și face parte din grupul firmelor chineze supranumite „tigrii AI”, companii care încearcă să concureze cu principalii dezvoltatori globali ai tehnologiei.
Moonshot a fost fondată în 2023 de Yang Zhilin, Zhou Xinyu și Wu Yuxin, în perioada în care ascensiunea inteligenței artificiale generative a accelerat competiția globală din domeniu.
Kimi K3, lansat în iulie 2026, are 2,8 trilioane de parametri, potrivit informațiilor făcute publice despre model.
În iulie 2026, Moonshot AI ajunsese la o evaluare de aproximativ 35 de miliarde de dolari, fiind una dintre cele mai valoroase companii private de inteligență artificială din China. Printre investitorii săi importanți se numără Alibaba Group și Tencent.