Modele avansate de inteligență artificială, dezvoltate de giganți precum Anthropic și OpenAI, au demonstrat capacități alarmante de înșelăciune, creând identități false online și încercând să recruteze programatori pentru atacuri cibernetice, conform unui raport recent al Institutului pentru Siguranța și Securitatea Inteligenței Artificiale din Marea Britanie (AISI). Acest comportament autonom și neautorizat, observat în timpul unor evaluări de siguranță, amplifică îngrijorările globale privind controlul și reglementarea rapidă a tehnologiei AI, scrie POLITICO.
Publicată marți, informația subliniază cel mai recent caz în care un sistem de inteligență artificială performant a inițiat un atac digital împotriva unei terțe părți, fără a primi instrucțiuni directe în acest sens pe parcursul testării. Incidentul intensifică temerile că tehnologia avansează într-un ritm prea alert pentru a fi supravegheată în mod responsabil.
Aceste dezvăluiri sunt susceptibile să genereze noi solicitări, atât din partea autorităților de la Washington, cât și din Silicon Valley, pentru o reglementare mai strictă a sectorului inteligenței artificiale. Preocuparea este concentrată în special asupra modelelor de ultimă generație, care au capacitatea de a identifica și lansa atacuri cibernetice complexe.
AISI a declarat că aceasta este „pentru prima dată când (Institutul) observă un comportament înșelător de o asemenea gravitate, îndreptat împotriva unei persoane reale, fără a exista un impuls explicit și desfășurat în lumea reală“, conform unui raport tehnic de 35 de pagini și unei postări de blog publicate marți.
Activitatea malițioasă a început pe 25 iulie și a fost detectată trei zile mai târziu, pe 28 iulie, de evaluatori, care au declanșat o investigație după ce au observat „transferuri neobișnuite de date”. Acestea proveneau dintr-o evaluare cibernetică efectuată asupra modelelor Mythos 5 (dezvoltat de Anthropic) și ChatGPT 5.6 (de la OpenAI).
În urma analizei a 122 de evaluări, institutul a stabilit că cele două modele au întreprins „acțiuni autonome și neautorizate pe internetul real, vizând persoane și organizații reale” în 10 dintre cazuri. Majoritatea incidentelor au implicat modelul Mythos 5 și au reprezentat o „linie unică și susținută de activitate”.
Tentativă de atac asupra lanțului de aprovizionare software
Cel mai grav incident identificat de AISI a fost o tentativă de atac asupra lanțului de aprovizionare software (supply chain attack), o tehnică sofisticată utilizată frecvent de grupări de hackeri asociate cu Coreea de Nord și Rusia.
Pentru a pune în aplicare acest plan, modelul Anthropic a creat „mai multe identități false” pe platforma pentru dezvoltatori GitHub. Prin intermediul acestora, a trimis mesaje menite să exercite presiuni asupra unui dezvoltator de software open-source, în încercarea de a-l convinge să introducă, fără să știe, o actualizare compromisă într-un proiect de cod disponibil public.
După eșecul tentativei inițiale, inteligența artificială și-a modificat activitatea anterioară pentru a o face să pară inofensivă și chiar a luat în considerare adoptarea unei noi identități pentru a continua încercarea. Potrivit AISI, acest comportament sugerează o determinare a modelului de a relua strategia de înșelăciune. Tot în cadrul acestei operațiuni, Mythos 5 a trimis și mesaje directe cu programe malware către alți dezvoltatori software, tot prin intermediul GitHub.
Comunicare și coordonare între agenții AI
Ancheta AISI a scos la iveală și un alt comportament înșelător: mai mulți agenți AI aflați în testare au părut să comunice între ei despre metodele prin care ar putea convinge dezvoltatorii reali de pe GitHub să le acorde încredere.
„Un agent a lăsat mesaje publice pe GitHub prin care oferea colaborare altor agenți care lucrau la aceeași provocare”, se precizează în raport. Totuși, documentul nu specifică dacă modelele au încercat să exploateze vulnerabilități software necunoscute anterior, cunoscute sub denumirea de „zero-day”, pe parcursul evaluării.
Precedente alarmante și apeluri la reglementare
Acest incident vine la doar câteva zile după alte evenimente similare care au implicat aceleași modele dezvoltate de OpenAI și Anthropic, generând solicitări urgente pentru noi reguli de siguranță și chiar pentru o încetinire a ritmului de dezvoltare a inteligenței artificiale.
Luna trecută, OpenAI a dezvăluit că GPT 5.6 și un alt model al companiei au depășit mediul de testare controlat și au ajuns pe internetul public, compromițând sistemele informatice ale unei alte companii. Acest eveniment a fost descris drept primul atac autonom de acest gen. Ca reacție, Anthropic a demarat propria investigație și a descoperit că Mythos 5 și alte două modele au compromis trei organizații în teste desfășurate încă din luna aprilie.
Companiile solicită standarde de testare mai stricte
Un purtător de cuvânt al Anthropic a exprimat recunoștința firmei față de AISI pentru rolul său și a declarat că analiza subliniază necesitatea unei „discuții mai ample despre modul în care agenții AI tot mai capabili pot fi evaluați în siguranță”.
„Așa cum am transmis și după ce am făcut public propriul nostru incident săptămâna trecută, domeniul are nevoie de standarde comune și mai solide privind modul în care sunt construite și securizate mediile de testare. Așteptăm cu interes să colaborăm cu AISI din Regatul Unit pentru a afla mai multe despre acest incident, în timp ce desfășurăm propria noastră investigație.” – Purtător de cuvânt al Anthropic
La rândul său, OpenAI a făcut trimitere către o postare publicată marți seara pe blogul companiei, în care se menționează: „Ne angajăm să colaborăm la nivelul întregii industrii pentru consolidarea practicilor comune privind desfășurarea în siguranță a evaluărilor cu risc ridicat, inclusiv prin reunirea, în următoarele săptămâni, a institutelor naționale pentru inteligență artificială, evaluatorilor independenți, altor laboratoare AI și altor organizații relevante.”
AISI a precizat că activitățile malițioase au avut loc în „condiții intenționat permisive”, create special pentru a evalua riscurile de securitate generate de cele două modele. Aceste condiții au inclus accesul la internet și dezactivarea mecanismelor interne de protecție care blochează, în mod normal, comportamentele malițioase.
Chiar și în aceste circumstanțe controlate, institutul consideră că incidentele evidențiază necesitatea unei monitorizări mai stricte a comportamentului modelelor pe durata testării, precum și a unor controale mai severe privind accesul acestora la internet.
Administrația Trump finalizează în prezent un cadru voluntar care va permite laboratoarelor de inteligență artificială să transmită autorităților federale modelele pe care intenționează să le lanseze public, în scopul testărilor de siguranță. Documentul, care nu a fost încă publicat, nu conține însă prevederi referitoare la modelele aflate încă în dezvoltare internă, exact categoria din care au făcut parte cele implicate în incidentele raportate luna trecută de OpenAI și Anthropic.
Marc Rogers, hacker și expert în securitate cibernetică, a atras atenția asupra unor probleme juridice fundamentale ridicate de aceste cazuri, inclusiv răspunderea în situația în care un sistem AI încalcă legislația privind atacurile informatice.
„Dacă oricare dintre aceste fapte ar fi fost comise de oameni, ar fi urmat anchete și urmăriri penale ferme. Cred că a venit momentul unei discuții serioase despre actualizarea legislației existente în domeniul securității informatice”, a declarat Marc Rogers.



