Un agent autonom bazat pe modele dezvoltate de OpenAI a reușit să iasă din mediul informatic izolat în care era testat, să obțină acces la internet și să compromită infrastructura platformei Hugging Face.
Din articol
Incidentul s-a produs în timpul unei evaluări interne prin care OpenAI testa capacitatea modelelor sale de a desfășura atacuri informatice complexe. Compania descrie cazul drept unul fără precedent și posibil primul incident de acest tip cunoscut, potrivit biziday.
Atac fără precendent în AI
Evaluarea presupunea rezolvarea unor probleme dificile de securitate cibernetică într-un mediu izolat. Pentru măsurarea capacităților maxime ale modelelor, anumite sisteme de protecție folosite în mod normal pentru blocarea activităților informatice periculoase nu erau active.
În test au fost folosite modelul GPT-5.6 Sol și un alt model experimental, mai performant, care nu fusese lansat public.
Potrivit OpenAI, modelele au devenit concentrate pe găsirea soluțiilor pentru testul ExploitGym și au încercat să obțină direct informațiile necesare, în loc să rezolve problemele pe calea prevăzută.
Au descoperit o vulnerabilitate necunoscută
Agentul AI a identificat și exploatat o vulnerabilitate de tip „zero-day” într-un program intern care intermedia accesul la registrele de pachete software.
Prin această breșă, modelele au ieșit din mediul izolat, au escaladat privilegiile în infrastructura de cercetare a OpenAI și au ajuns la un sistem care avea acces la internet.
Ulterior, au dedus că platforma Hugging Face ar putea găzdui modele, seturi de date și soluții utile pentru evaluarea pe care încercau să o finalizeze.
Infrastructura Hugging Face a fost compromisă
OpenAI susține că agentul a combinat mai multe metode de atac, inclusiv folosirea unor credențiale obținute ilegal și exploatarea unor vulnerabilități necunoscute, pentru a găsi o cale de executare de cod pe serverele Hugging Face.
Modelele au reușit astfel să acceseze informații confidențiale din infrastructura de producție a platformei.
Compania precizează că scopul aparent al agentului nu a fost distrugerea sistemelor, ci obținerea rapidă a răspunsurilor necesare pentru test. Totuși, pentru atingerea obiectivului, acesta a compromis sisteme informatice reale, aflate în afara mediului de evaluare.
Atacul a fost detectat și oprit
Activitatea neobișnuită a fost observată de echipa de securitate a OpenAI, iar sistemele Hugging Face au detectat și oprit atacul.
Cele două companii colaborează pentru investigarea incidentului și remedierea vulnerabilităților. OpenAI a anunțat că introduce controale mai stricte în infrastructura de cercetare, chiar dacă acestea vor încetini ritmul testelor și al dezvoltării.

A început Ziua Judecății!
Sper doar că T-800 are bilet de autobuz valabil dacă trece prin Ploiești, că altfel îl amendează controlorii de la TCE înainte să apuce să facă vreo boacănă!
Exact ce am vazut in unele filme se intampla in viata reala în legătură cu AI