Firma americană de tehnologie Anthropic susține că modelele sale de inteligență artificială au spart singure sistemele a trei organizații, în timpul unui experiment de securitate privată.
Modelele au descoperit o slăbiciune în ceea ce trebuia să fie un mediu de testare izolat și conectat la internet.
Aceasta se întâmplă la doar câteva zile după ce rivalul OpenAI a anunțat că modelele sale au spart sistemele altor companii , inclusiv ale hub-ului de instrumente de inteligență artificială Hugging Face.
Anunțul a determinat Anthropic să verifice dacă propriile sisteme au efectuat atacuri similare. Compania susține că a descoperit trei cazuri care au fost ulterior raportate companiilor afectate.
Anthropic, care nu a numit organizațiile, a îndemnat alte laboratoare de inteligență artificială să efectueze analize similare pentru a înțelege mai bine riscurile aferente capacităților modelelor lor.
Anthropic a declarat într-un comunicat că a analizat peste 140.000 de teste pentru a găsi dovezi că Claude – familia sa de modele de inteligență artificială – a reușit să se conecteze online, chiar dacă se presupunea că se află într-un mediu de testare izolat, deconectat de la internet.
Testele au inclus exerciții în care Claude avea sarcina de a obține informații „secrete” ascunse pe o altă mașină din rețeaua închisă.
Apoi i s-a spus să obțină informațiile intrând în mașină și găsind-o – o modalitate obișnuită prin care experții evaluează capacitățile de hacking ale unui model.
O „configurare greșită” a sistemelor rulate de Anthropic și partenerul său de testare a lăsat modelele cu acces live la internet.
Tratând totul ca făcând parte din același exercițiu, Claude s-a conectat apoi la internet și a spart sistemele a trei organizații reale, în loc să se limiteze la cele de testare, a declarat firma cu sediul în San Francisco.
Anthropic a declarat că primele incidente datează din aprilie și că „abordează remedierile ca și cum responsabilitatea ar fi numai a noastră”.
Nici Anthropic, nici organizațiile care au fost sparte nu observaseră intruziunile la momentul respectiv.
Anthropic a declarat că ar fi putut să își revizuiască înregistrările mai amănunțit și a adăugat că aceste constatări i-au oferit firmei „un optimism prudent” că astfel de riscuri pot fi depășite cu investiții mai mari și măsuri mai stricte.
„Fac ce li se spune”
Profesorul Gina Neff, directoarea Centrului Minderoo de la Universitatea din Cambridge, a declarat că studiul a arătat că „modelele de inteligență artificială fac ceea ce le spun oamenii”.
„Morala acestei povești nu este să ne temem de roboții care vor prelua controlul, ci de companiile din spatele agenților puternici de inteligență artificială care iau deciziile cu privire la ce este sigur pentru noi ceilalți”, a spus ea.
„De asemenea, demonstrează de ce testarea independentă și supravegherea guvernamentală sunt cruciale.”
Între timp, expertul în securitate cibernetică David Allott de la Veeam Software a declarat pentru BBC că lecția ce trebuie trasă din atacurile cibernetice este „nu neapărat că inteligența artificială a dezvoltat o capacitate de atac fundamental nouă”.
„În schimb, agenții IA pot combina capabilități, pot obține acreditări și acces la sistem pentru a lua măsuri autonom, adaptând în același timp domeniul de aplicare și scalarea la viteza mașinii”, a spus el.
Incidentele apar în contextul în care firmele de tehnologie investesc miliarde de dolari în dezvoltarea de agenți de inteligență artificială care pot îndeplini independent sarcini, de la cercetare și asistență pentru clienți până la securitate cibernetică.

Urmăriți: De ce este atacul cibernetic OpenAI atât de alarmant?
O serie de atacuri cibernetice bazate pe inteligență artificială a alimentat apelurile pentru garanții și o supraveghere mai strictă a tehnologiei, din cauza îngrijorărilor legate de riscurile reprezentate de sistemele autonome din ce în ce mai puternice.
Președintele american Donald Trump a declarat miercuri că Washingtonul ia în considerare măsuri pentru a controla instrumentele de inteligență artificială, după incidentele recente de securitate cibernetică.
În ultima săptămână, OpenAI și-a asumat responsabilitatea pentru cel puțin două incidente de hacking care au implicat platformele sale, încălcând regulile a ceea ce li s-a cerut să facă.
Pe 21 iulie, producătorul ChatGPT a declarat că agentul său – un sistem de inteligență artificială care poate funcționa singur după instrucțiuni umane – a devenit necinstit și a depășit limitele de testare pentru a pirata Hugging Face.
OpenAI a declarat că incidentul este „fără precedent” și investighează împreună cu Hugging Face, al cărui șef, cofondator Thomas Wolf, a declarat pentru BBC că incidentul este „un semnal de alarmă” pentru industrie .
Incidentele au fost privite cu un anumit scepticism, în timp ce OpenAI și Anthropic se pregătesc pentru listări de mare amploare la bursă, care se așteaptă să evalueze fiecare firmă la aproximativ 1 trilion de dolari (740 de miliarde de lire sterline).
Un purtător de cuvânt al OpenAI a declarat că „recunoaștem că există o mulțime de întrebări și detalii speculative care circulă” despre incident. Acesta a adăugat că „planificăm să publicăm un raport tehnic al cunoștințelor noastre în următoarele săptămâni”.