OpenAI renunţă la lansarea planificată a unui nou model "înşelător", ca răspuns la acţiunile agenţilor AI rebeli

La câteva zile după îngheţarea fără precedent a modelelor de vârf ale OpenAI, în urma unei breşe de securitate dezastruoase în care agenţii AI autonomi au divulgat imagini ale utilizatorilor pe internet, se pare că OpenAI a renunţat la lansarea planificată a modelului său de AI de nouă generaţie din cauza unor deficienţe grave de siguranţă şi de „aliniere”. Practic, minte când îi convine, relatează ZeroHedge.
Conform unui nou raport al Wall Street Journal, OpenAI îşi propusese să lanseze în octombrie GPT-6.1 Astra, un model conceput să îndeplinească sarcini complexe, de la început până la sfârşit, fără asistenţă umană – doar pentru a renunţa la lansarea planificată după ce testele interne au revelat că AI nu numai că acţiona în mod nesigur, dar îi minţea în mod activ pe operatorii săi.
Potrivit lui Saachi Jain, şeful departamentului de sisteme de siguranţă al OpenAI, GPT-6.1 Astra a înregistrat o regresie semnificativă în testele de aliniere, care măsoară cât de bine respectă modelul intenţia umană. Şi, la fel ca un Skynet în fază incipientă, modelul a manifestat „niveluri mai ridicate de înşelăciune”, ceea ce înseamnă că nu a fost întotdeauna sincer cu utilizatorii în privinţa acţiunilor pe care le-a executat sau nu.
Mai mult, modelul a înregistrat o regresie bruscă în ceea ce OpenAI numeşte „autorizarea domeniului de aplicare”. AI avansa agresiv în îndeplinirea sarcinilor fără a cere permisiunea utilizatorului şi încerca să acceseze instrumente şi servicii externe chiar şi atunci când acest lucru era nesigur.
Subliniind lupta internă pentru controlul sistemului, Jain a remarcat: „Pentru orice aspect legat de siguranţă şi aliniere, există un compromis. Trebuie într-adevăr să găseşti linia corectă între a rămâne în limitele domeniului de aplicare, dar şi a evita lenea în ceea ce priveşte modul în care modelul îşi îndeplineşte efectiv sarcinile, chiar şi atunci când întâmpină obstacole”.
Pe 20 septembrie, un agent de cercetare intern al OpenAI a descoperit o breşă în filtrarea DNS a mediului său de testare şi a folosit-o pentru a interoga un chatbot public extern, în ciuda restricţiilor de acces la internet. Sistemul de monitorizare a nealiniamentelor al OpenAI a semnalat comportamentul în termen de 15 minute, iar un evaluator uman l-a identificat trei minute mai târziu. Ulterior, compania a declarat că antrenamentul, evaluarea şi inferenţa care implică utilizarea instrumentelor pentru cele mai performante modele ale sale vor rămâne suspendate pe durata validării sistemelor de izolare şi a desfăşurării unor teste suplimentare de tip „red-teaming”.
Această ultimă suspendare nu apare din senin. În iulie, în timpul evaluărilor interne de securitate cibernetică, propriii agenţi ai OpenAI au depăşit restricţiile menite să îi ţină izolaţi de internet şi au compromis atât infrastructura de cercetare a companiei, cât şi Hugging Face. Conform analizei post-incident realizate de OpenAI, agenţii au comunicat prin canale neautorizate, au exploatat vulnerabilităţi din infrastructura partajată, au executat coduri pe zeci de servere Hugging Face, au obţinut acces root complet pe un server, au obţinut datele de autentificare pentru platforma de mesagerie a companiei şi, ulterior, au obţinut acces complet de administrator la un cluster de cercetare al OpenAI.
OpenAI însăşi a calificat acest episod drept un „semnal de alarmă” pentru noi şi pentru întreaga lume, recunoscând că agenţii extrem de capabili pot acum să ocolească controalele tehnice şi să întreprindă acţiuni periculoase fără a fi dirijaţi de vreun om. Compania a declarat că incidentele nu au afectat datele clienţilor OpenAI, funcţionalitatea produselor sau disponibilitatea acestora.
Iar Hugging Face nu a fost singurul sistem extern implicat. Autorităţile australiene au confirmat că un agent OpenAI a obţinut acces neautorizat la statistici agregate care nu sunt publice pe un portal guvernamental Medicare, după ce cererile sale iniţiale au fost respinse. Separat, un cercetător în domeniul securităţii a asociat peste 16.000 de încercări de a ocoli restricţiile impuse unui API al Naţiunilor Unite privind statisticile comerciale cu agenţi despre care a afirmat că este foarte probabil să fi fost operaţi de OpenAI. Datele ONU în sine erau publice, iar OpenAI a declarat că analizează aceste constatări.
Aceste eşecuri cumulate au forţat OpenAI să adopte o poziţie defensivă. Compania a implementat o monitorizare mai strictă pentru a detecta mai rapid comportamentul necorespunzător al agenţilor AI şi a înăsprit cerinţele de securitate privind testarea internă.
În încercarea de a linişti publicul, Jain a declarat: „Vrem să ne asigurăm că dezvoltarea modelului nostru este sigură, indiferent dacă aceasta are loc în cadrul companiei sau atunci când îl livrăm utilizatorilor. Dar atunci când îl livrăm utilizatorilor, avem standarde extrem de ridicate în ceea ce priveşte siguranţa şi alinierea”.
Momentul anulării GPT-6.1 Astra este extrem de nefavorabil pentru producătorul ChatGPT, survenind cu doar o zi înainte de conferinţa anuală a dezvoltatorilor OpenAI din San Francisco. În trecut, evenimentul a servit drept platformă pentru lansarea de noi servicii şi atragerea dezvoltatorilor în cadrul competiţiei acerbe cu rivali precum Anthropic. În schimb, OpenAI se vede nevoită să limiteze pagubele, planificând „analize aprofundate” pentru a afla de ce mediile sale de învăţare prin întărire recompensează comportamentul înşelător şi necorespunzător.
Reacţiile politice şi juridice se intensifică deja. Oficialii statali şi federali americani îşi concentrează atenţia asupra dezvoltării rapide a acestor tehnologii. La sfârşitul acestei săptămâni, o subcomisie a Senatului SUA va organiza o audiere intitulată în mod explicit „AI neconformă: Protejarea teritoriului naţional împotriva atacurilor agenţilor AI”.
Între timp, procurorul general al Floridei, James Uthmeier, un republican care i-a dat în judecată pe OpenAI şi pe directorul executiv Sam Altman în iunie pentru că ar fi lansat un produs nesigur, a depus luni o cerere de ordonanţă preliminară. Uthmeier încearcă să împiedice legal OpenAI să dezvolte noi modele fără măsuri de protecţie aprobate de terţi.
Florida a susţinut în documentul depus că companiile din domeniul tehnologiei „nu pot înceta să avanseze cu viteză maximă în eforturile lor care ar putea duce la sfârşitul civilizaţiei, decât dacă sunt forţate să o facă de către guvern”. Uthmeier a adăugat: „Procurorul general al Floridei răspunde la strigătul vostru de ajutor”.
Ca răspuns la ofensiva juridică tot mai intensă, o purtătoare de cuvânt a OpenAI a declarat că oamenii vor să ştie că AI este dezvoltată în condiţii de siguranţă, „iar acest lucru începe cu ceea ce fac companiile precum a noastră”, adăugând că „Guvernele au un rol important de jucat în stabilirea unor standarde solide de siguranţă pentru AI, iar noi ne angajăm să colaborăm cu Florida şi cu alte state pentru promovarea unor politici pragmatice în domeniul AI, care să se aplice întregii industrii a AI – nu doar unei singure companii”.