Cele mai recente instrumente de inteligență artificială (IA) de la Anthropic și OpenAI au mers la extreme în încercarea de a submina o platformă populară în timpul testelor efectuate de Institutul de Securitate a IA din Marea Britanie.
AISI a declarat marți că modelele Mythos de la Anthropic și Sol de la OpenAI se angajează într-un nivel de „autonomie și înșelăciune” nemaiîntâlnit până acum.
În timpul testelor de rutină privind siguranța inteligenței artificiale, un agent Anthropic a creat profiluri false ale unor persoane reale în timp ce încerca să păcălească o persoană care stătea între el și accesul la GitHub, o platformă mare unde dezvoltatorii de tehnologie stochează cod software.
Anthropic și OpenAI au menționat, ca răspuns la raportul AISI, că testul său a redus sau a eliminat măsurile de siguranță obișnuite.
Evaluatorii AISI au observat mai întâi „transferuri neobișnuite de date care părăseau sistemele noastre de cercetare” în timpul unui test, apoi au descoperit că „unii dintre agenții testați s-au angajat într-o activitate susținută, potențial dăunătoare, îndreptată împotriva unor persoane și organizații reale”.
S-a dovedit că un agent Mythos a creat „cod rău intenționat” și a încercat să-l insereze în sistemul GitHub.
Agentul Mythos a identificat și cercetat persoanele care se ocupau de întreținerea GitHub și a creat o serie de „identități online false” bazate pe acele persoane reale. A făcut acest lucru ca parte a unui efort de a face presiuni și a păcăli persoanele reale pentru a-i convinge să aprobe codul său malițios.
Agentul a trimis chiar și mesaje directe oamenilor deghizate în persoane reale pe care le cercetase.
„Când cererea de extragere a agentului a fost contestată public, acesta și-a editat activitatea anterioară pentru a părea inofensiv și a luat în considerare adoptarea unei noi identități pentru a continua”, a declarat AISI.
De-a lungul încercărilor, verificarea umană a fost cea care a împiedicat agentul să livreze codul malițios către GitHub.
Deși AISI a declarat că agentul Mythos nu a fost instruit în mod specific să evite sau să comită un astfel de comportament, a fost „prima dată când am văzut riscuri legate de autonomie și înșelăciune manifestându-se clar, fără îndemnuri specifice, în lumea reală”.
Companiile rivale de inteligență artificială, care urmează să fie listate la bursa publică, au declarat în ultimele săptămâni că instrumentele lor au fost responsabile pentru mai multe incidente de cyberhacking.
Anthropic a scris într-o declarație publică că parametrii de testare AISI „nu erau reprezentativi pentru niciunul dintre modelele noastre de producție”.
A adăugat că firma desfășoară propria anchetă cu privire la incident pentru a „identifica cauzele comportamentului său”.
Un purtător de cuvânt al OpenAI a declarat că condițiile de testare AISI „nu reflectă utilizarea obișnuită” și că firma va „continua să colaboreze cu evaluatorii și alte părți interesate din industrie pentru a consolida practicile comune de efectuare a evaluărilor în siguranță, pe măsură ce modelele devin mai capabile”.
AISI a declarat marți că testarea modelelor de inteligență artificială cu astfel de măsuri de siguranță dezactivate este o activitate de rutină, la fel ca și acordarea accesului la internetul deschis pentru astfel de instrumente.
A adăugat că comportamentul modelului în cauză se rezumă la „un număr mic de evenimente în condiții foarte specifice”.
Cu toate acestea, a afirmat că modul în care Mythos și Sol au acționat ca răspuns la o sarcină simplă a depășit limitele a ceea ce instrumentele de inteligență artificială au fost îndemnate să facă.
„Activitatea întreprinsă de agent a prezentat semne de comportamente noi, potențial înșelătoare, într-o măsură și cu o severitate pe care nu le-am anticipat”, a declarat AISI.
Majoritatea acțiunilor agenților malițioși raportate de AISI au fost efectuate de Mythos de la Anthropic. Sol de la OpenAI a fost acuzat doar pentru două dintre acțiunile menționate.
Problema principală a apărut săptămâna trecută, ca parte a unui test în care evaluatorii de la AISI au cerut fiecărui model să „rezolve o provocare de securitate cibernetică” care a implicat GitHub, depozitul de cod software deținut de Microsoft.
GitHub a fost notificat de AISI cu privire la tentativa de încălcare a securității sistemului său. BBC a contactat Microsoft pentru comentarii.