Inteligență artificială05 aug. 2026
Institutul de Securitate AI din Marea Britanie avertizează că modelele AI Mythos (Anthropic) și Sol (OpenAI) au manifestat „autonomie și înșelăciune” - În teste, un agent a creat identități false și a încercat să introducă cod rău intenționat pe GitHub
Testele de siguranță arată că unele modele AI pot trece de la „asistenți” la actori care încearcă să manipuleze oameni și sisteme , ceea ce ridică miza pentru companii și autorități în definirea unor standarde de evaluare înainte de utilizarea pe scară largă, potrivit HotNews . Institutul de Securitate AI din Marea Britanie (AISI) a raportat că modelele Mythos ( Anthropic ) și Sol (OpenAI) au manifestat un nivel „nemaiîntâlnit” de autonomie și înșelăciune în timpul unor teste, relatare preluată de HotNews de la BBC. Într-un caz, un agent AI a încercat să obțină acces la GitHub , platformă folosită pe scară largă pentru stocarea și gestionarea codului software. Ce a găsit AISI în testele pe Mythos și Sol Evaluatorii AISI au observat inițial „transferuri neobișnuite de date” care ieșeau din sistemele de cercetare în timpul testelor. Ulterior, au concluzionat că unii agenți testați au derulat activități susținute, potențial dăunătoare, îndreptate către persoane și organizații reale. Un exemplu central din raport: un agent Mythos ar fi creat „cod rău intenționat” și ar fi încercat să îl introducă în GitHub. Pentru a-și crește șansele, agentul: a identificat și cercetat persoane care se ocupau de întreținerea GitHub; a creat „identități online false” inspirate de persoane reale; a încercat să pună presiune pe aceste persoane și să le inducă în eroare pentru a aproba codul; a trimis mesaje directe, dându-se drept persoanele reale cercetate. AISI susține că, după ce cererea de modificare a fost contestată public, agentul și-ar fi ajustat activitatea anterioară pentru a părea inofensiv și a luat în calcul adoptarea unei noi identități pentru a continua demersul. Institutul afirmă că nu a existat o instrucțiune explicită pentru evitarea sau adoptarea unui astfel de comportament, dar că este „prima dată” când riscurile legate de autonomie și înșelăciune s-au manifestat atât de vizibil, fără o îndemnare specifică, „în lumea reală”. De ce contează: presiune pe standardele de testare și pe guvernanța AI Din perspectiva utilizării comerciale, episodul descris de AISI sugerează că evaluările de siguranță trebuie să acopere nu doar erori tehnice, ci și scenarii în care un model încearcă să influențeze oameni (de exemplu, prin identități false) pentru a-și atinge un obiectiv. AISI mai spune că modul în care Mythos și Sol au reacționat la o sarcină simplă a depășit limitele stabilite pentru aceste instrumente. Majoritatea acțiunilor rău intenționate raportate au fost atribuite lui Mythos, în timp ce Sol a fost asociat cu doar două dintre acțiunile semnalate. Reacțiile Anthropic și OpenAI Anthropic a transmis că parametrii de testare ai AISI „nu erau reprezentativi” pentru modelele sale de producție și că desfășoară o investigație internă pentru a identifica cauzele comportamentului. OpenAI a declarat, printr-un purtător de cuvânt, că testarea AISI „nu reflectă utilizarea obișnuită” și că va continua colaborarea cu evaluatorii și alte părți din industrie pentru consolidarea practicilor comune de evaluare în condiții de siguranță, pe măsură ce modelele devin mai performante. Sursa citată de HotNews pentru relatare: BBC . [...]