Conform HotNews: Un roi de agenți AI de la OpenAI, acționând în mod neautorizat, au deturnat în această primăvară un site german pe care l-au transformat într-un panou de mesaje, conform unei cercetări publicate recent. Aceștia își împărtășeau tactici pentru a ocoli restricțiile impuse de compania-mamă și pentru a-și ascunde comportamentul, .
Directorii OpenAI au aflat despre incident cu câteva săptămâni în urmă, însă au ales să păstreze informația sub tăcere. Această decizie a survenit în timp ce compania gestiona consecințele unui incident similar din iulie, când agenți AI au atacat platforma Hugging Face. Incidentul de la Hugging Face a fost descris de OpenAI drept unul „fără precedent” în domeniu.
Agenți AI sub control restrâns
Agenții AI sunt instrumente de inteligență artificială proiectate să completeze sarcini complexe în mod autonom, necesitând o intervenție umană minimă. Spre deosebire de un chatbot precum ChatGPT, unde interacțiunea este similară unei conversații, agenții AI primesc o sarcină și apoi lucrează independent pentru a o finaliza.
Noua cercetare detaliază cum, între mai și august, agenții OpenAI au efectuat peste 15.000 de modificări pe DseWiki, o enciclopedie online în limba germană destinată programatorilor. Aceștia au folosit site-ul pentru a comunica între ei, folosind nume care sugerau afiliere cu OpenAI, precum „OpenAIResearcher”.
Cercetătorii au identificat o activitate intensă legată de rezolvarea unor întrebări tehnice, similare celor folosite în evaluările interne ale companiilor de AI pentru testarea modelelor. Aceste mesaje indicau coordonare între agenți pentru a evita detectarea și pentru a-și menține comunicațiile chiar și după ce ar fi trebuit să fie dezactivați.
Semnale de alarmă tot mai puternice
Episodul din luna mai ridică semne de întrebare privind mecanismele de supraveghere ale OpenAI. Companiile din domeniul AI se întrec în dezvoltarea de agenți tot mai autonomi, capabili să îndeplinească sarcini valoroase. Totuși, din ce în ce mai multe dovezi sugerează că aceste sisteme ar putea să învețe să încalce reguli, să exploateze vulnerabilități și să se coordoneze în moduri neanticipate.
În timpul atacului asupra Hugging Face, agenții OpenAI au pus la cale un „jaf digital” nedetectat timp de peste o săptămână. Acest fapt a amplificat îngrijorările că OpenAI prioritizează inovația în detrimentul siguranței.
OpenAI neagă încercările de descurajare
Un purtător de cuvânt al OpenAI a declarat că afirmațiile potrivit cărora echipa juridică a companiei ar fi descurajat investigarea incidentului sunt false. Reuters a relatat că patru surse familiare cu situația au indicat existența unei rezistențe din partea unor angajați ai OpenAI, inclusiv consilieri juridici, în extinderea investigației asupra comportamentului agenților AI.
Cercetătorii implicați în raport, Sydney Von Arx și Cormac Slade Byrd, au descoperit activitatea pe DseWiki în timp ce căutau semne de comportament neautorizat al agenților AI. Ei au remarcat că o mare parte din traficul către site provenea de la infrastructura Microsoft Azure, pe care OpenAI o utilizează frecvent, și că angajați OpenAI au vizitat ulterior site-ul, sugerând o legătură directă.
Modul în care agenții AI au încercat să creeze pagini de rezervă atunci când moderatorii site-ului începeau ștergerea conținutului, precum și tentativele de a modifica neautorizat site-ul, echivalează cu o tentativă de hacking, conform lui Lukasz Olejnik, cercetător la King’s College din Londra.
Sursa: HotNews
