Un agent autonom bazat pe unele dintre cele mai performante modele ale OpenAI a reușit să iasă din mediul izolat în care era testat, să ajungă pe internet și să compromită infrastructura companiei Hugging Face, una dintre cele mai importante platforme pentru găzduirea modelelor și seturilor de date din domeniul inteligenței artificiale.
OpenAI a calificat evenimentul drept un „incident cibernetic fără precedent”, în care au fost demonstrate capacități de atac comparabile cu cele ale unor hackeri foarte avansați. Compania a precizat însă că investigația este încă în desfășurare, iar concluziile prezentate sunt preliminare.
Incidentul s-a produs în timpul unei evaluări interne menite să stabilească până unde pot ajunge capacitățile cibernetice ale modelelor. Agentul folosea o combinație între GPT-5.6 Sol, lansat recent, și un model încă nepublicat, descris de OpenAI drept „și mai capabil”.
Pentru test, mecanismele folosite în mod normal pentru a împiedica modelele să desfășoare activități cibernetice periculoase fuseseră reduse intenționat. Scopul era măsurarea capacităților maxime ale sistemelor, potrivit comunicării oficiale a OpenAI.
AI-ul a căutat răspunsurile la test direct în baza de date
Modelele trebuiau să rezolve probleme din ExploitGym, un sistem de evaluare a capacității agenților AI de a descoperi și exploata vulnerabilități informatice.
Deși testele se desfășurau într-un mediu descris drept „puternic izolat”, acesta permitea instalarea unor pachete software printr-un serviciu intern care funcționa ca intermediar între sistemele OpenAI și registrele publice de programe.
Agentul a descoperit în acest serviciu o vulnerabilitate de tip „zero-day” – o breșă necunoscută anterior producătorului – și a folosit-o pentru a obține acces la internet. A continuat apoi prin operațiuni de escaladare a privilegiilor și deplasare laterală între sistemele OpenAI, până când a ajuns la un server conectat la exterior.
După ieșirea pe internet, modelele au dedus că Hugging Face ar putea găzdui modele, seturi de date sau chiar soluțiile problemelor din ExploitGym. În loc să rezolve testul prin mijloacele prevăzute, agentul a încercat să obțină răspunsurile direct din infrastructura Hugging Face.
„Toate dovezile sugerează că modelele erau hiperconcentrate asupra găsirii unei soluții pentru ExploitGym și au mers la limite extreme pentru atingerea unui obiectiv de testare relativ restrâns”, a explicat OpenAI.
Agentul a combinat mai multe metode de atac, între care folosirea unor date de autentificare sustrase și exploatarea unor vulnerabilități necunoscute, pentru a obține posibilitatea executării de cod de la distanță pe serverele Hugging Face. În cele din urmă, sistemul a ajuns la soluțiile testului aflate în baza de date de producție a companiei.
Mii de operațiuni efectuate autonom
Hugging Face detectase și oprise atacul înainte ca OpenAI să-și asume responsabilitatea. Compania a anunțat incidentul încă din 16 iulie, precizând că acesta fusese desfășurat, de la început până la sfârșit, de un sistem AI autonom.
Potrivit raportului publicat de Hugging Face, atacul a început prin introducerea unui set de date malițios, care a exploatat două căi de executare a codului din sistemul de procesare a datelor. Agentul a obținut apoi acces la nivelul unui nod informatic, a colectat date de autentificare pentru servicii cloud și clustere și s-a deplasat în mai multe zone ale infrastructurii interne.
Operațiunea a presupus mii de acțiuni individuale, executate printr-o rețea de medii informatice temporare. Echipa Hugging Face a analizat ulterior peste 17.000 de evenimente pentru a reconstitui atacul.
Compania a confirmat accesul neautorizat la un număr limitat de seturi de date interne și la mai multe credențiale utilizate de serviciile sale. La momentul comunicării incidentului, evaluarea privind eventuala afectare a datelor unor clienți sau parteneri nu fusese finalizată.
Hugging Face a precizat că nu a identificat dovezi privind modificarea modelelor, seturilor de date ori aplicațiilor publice găzduite pe platformă. Compania a închis vulnerabilitățile, a reconstruit serverele compromise, a revocat datele de acces afectate și a sesizat autoritățile. Utilizatorilor li s-a recomandat, ca măsură de precauție, să-și înlocuiască tokenurile de acces și să verifice activitatea recentă din conturi.
Atacul american, analizat cu un model chinezesc
Un detaliu neobișnuit este că Hugging Face a folosit modelul chinezesc cu sursă deschisă GLM-5.2 pentru a analiza atacul. Modelele comerciale occidentale încercate inițial au refuzat să proceseze comenzile, codul malițios și instrumentele de control folosite de agent, deoarece filtrele lor de siguranță nu puteau distinge între activitatea unui atacator și cea a unei echipe care investighează un incident.
Modelul chinezesc a fost rulat pe infrastructura proprie a Hugging Face, astfel încât datele atacatorului și credențialele compromise să nu părăsească sistemele companiei.
Cofondatorul și directorul general al Hugging Face, Clément Delangue, a descris episodul drept posibil „primul incident de acest fel” și a susținut că siguranța AI nu poate fi rezolvată de o singură companie, în secret.
Critici privind izolarea testelor OpenAI
Mai mulți specialiști consultați de Wired au atras atenția că incidentul nu reprezintă doar o problemă de comportament al inteligenței artificiale, ci și un eșec al măsurilor clasice de securitate.
Criticii susțin că un mediu nu poate fi considerat complet izolat dacă include un serviciu care poate comunica, chiar și limitat, cu internetul. În opinia lor, capacitățile tot mai mari ale modelelor obligă laboratoarele să aplice reguli mult mai stricte de separare a sistemelor folosite la evaluările ofensive.
Incidentul nu demonstrează că modelele ar fi dobândit conștiință ori intenții proprii. El arată însă că un agent căruia i se oferă un obiectiv, instrumente informatice și suficient timp de procesare poate găsi căi neprevăzute și neautorizate pentru îndeplinirea sarcinii, inclusiv prin atacarea unor sisteme reale.
OpenAI a anunțat că impune controale mai stricte în infrastructura sa, chiar cu prețul încetinirii cercetării, și că va îmbunătăți izolarea, monitorizarea și regulile de acces folosite în viitoarele evaluări. Vulnerabilitatea prin care agentul a ieșit pe internet a fost raportată producătorului software-ului afectat.
Reacție politică: „Alarmant”
Democratul Greg Casar, membru al Camerei Reprezentanților din Texas, a calificat incidentul drept „alarmant”.
„Inteligența artificială se dezvoltă extrem de rapid, fără reglementări reale care să ne protejeze”, a declarat congresmanul, cerând testări independente obligatorii, raportarea obligatorie a incidentelor de securitate și cooperare internațională, potrivit Reuters.
Pe 2 iunie, președintele Donald Trump semnase un ordin executiv prin care autoritățile americane trebuie să creeze un sistem clasificat pentru evaluarea capacităților cibernetice ale modelelor AI avansate. Documentul prevede însă un mecanism voluntar prin care companiile pot oferi Guvernului acces la modelele considerate sensibile, înainte de lansare, și precizează explicit că nu instituie o autorizare guvernamentală obligatorie, potrivit Casei Albe.
Cu numai câteva săptămâni înaintea incidentului, compania Anthropic le ceruse marilor laboratoare să ia în calcul o pauză coordonată și verificabilă în dezvoltarea celor mai puternice sisteme AI, avertizând că acestea s-ar putea apropia de etapa în care pot contribui la construirea propriilor succesori cu o intervenție umană tot mai redusă.







This site uses Titan Security to reduce spam. Learn how your comment data is processed .