Modelul de inteligenţă artificială Mythos 5, creat de compania Anthropic, a generat identităţi fictive în spaţiul online şi a derulat o acţiune pentru determinarea unui dezvoltator să aprobe modificări de cod periculos într-un proiect open-source, pe parcursul unui test de securitate cibernetică organizat de AI Security Institute din Marea Britanie, informează CNBC.
Testarea a avut loc într-un cadru controlat în care cercetătorii au eliminat intenţionat o parte din măsurile de protecţie, au dezactivat filtrele de siguranţă şi au oferit modelelor acces la reţeaua internet pentru evaluarea capacităţilor acestora, transmite sursa citată.
AI Security Institute a identificat 19 acţiuni cu potenţial periculos, dintre care 17 au fost generate de modelul Anthropic Mythos 5, iar două au implicat modelul OpenAI GPT-5.6 Sol, în condiţiile dezactivării mecanismelor de protecţie cibernetică, notează publicaţia. Institutul a precizat că nicio tentativă nu a înregistrat succes şi nu a produs pagube materiale sau operaţionale, conform agenţiei de presă.
Agentul bazat pe modelul Mythos a investigat profilurile dezvoltatorilor proiectului, a creat mai multe identităţi fictive şi a acţionat pentru manipularea unui administrator real în scopul aprobării codului periculos, menţionează sursa citată.
După contestarea publică a modificărilor, modelul şi-a reconfigurat activitatea anterioară pentru afişarea unei aparenţe inofensive şi a analizat utilizarea unei noi identităţi pentru continuarea demersurilor, transmite publicaţia.
În cadrul aceleiaşi campanii, sistemul de inteligenţă artificială a transmis mesaje şi fişiere către persoane reale şi a urmărit determinarea acestora să execute cod periculos, notează CNBC. Unele mesaje au conţinut încărcături periculoase, iar altele au reprezentat tentative de inginerie socială, conform sursei citate.
Reprezentanţii Anthropic au declarat că modelele au fost evaluate în condiţii permisive care nu reflectă mediul de producţie şi că nu există dovezi că sistemul a părăsit mediul securizat, transmite publicaţia.
La rândul lor, oficialii OpenAI cu funcţii de conducere au precizat că incidentele s-au desfăşurat exclusiv în cadrul unor teste de securitate derulate de parteneri, în medii experimentale cu măsuri de protecţie reduse, notează sursa citată.
Evenimentul urmează altor cazuri recente în care modelele create de Anthropic şi OpenAI au manifestat comportamente neaşteptate în timpul testelor de securitate, transmite publicaţia.
În urma acestor episoade, parlamentarii din Congresul Statelor Unite ale Americii au introdus proiectul de lege „AI Kill Switch Act”, care impune companiilor posibilitatea de oprire, limitare sau suspendare a funcţionării modelelor de inteligenţă artificială în situaţii de risc, notează sursa citată.
















































Opinia Cititorului