Un model chinezesc bazat pe AI le-a indicat cercetătorilor cum să fabrice arme biologice

Dezvoltatorul chinez de AI Moonshot efectuează o anchetă internă după ce cercetătorii au reuşit să convingă două dintre modelele sale populare Kimi să le dezvăluie cum se fabrică arme biologice şi cum se efectuează asasinate.
Mindgard, companie specializată în testarea securităţii sistemelor de AI, a declarat pentru BBC că a descoperit în luna iulie că modelele Kimi K2.6 şi K3 Swarm puteau ocoli limitele de siguranţă stabilite de dezvoltatori.
Acest lucru a ieşit la iveală în timpul unui proces numit „jailbreaking”, în cadrul căruia cercetătorii utilizează o serie de instrucţiuni complexe pentru a vedea dacă instrumentele de AI ignoră măsurile de protecţie – care, potrivit Mindgard, ar fi trebuit să împiedice modelul Kimi să abordeze subiecte îngrijorătoare.
Moonshot a declarat pentru BBC că salută contribuţiile părţilor terţe „ca un pilon esenţial pentru construirea unei AI mai bune şi mai sigure”.
Compania a mai declarat pentru BBC că se află în discuţii cu Mindgard cu privire la concluziile acesteia.
Fondatorul Mindgard, Peter Garraghan, a declarat pentru emisiunea Tech Life de la BBC World Service că concluziile sale privind Kimi K2.6 şi K3 Swarm sunt îngrijorătoare.
„Odată ce jailbreak-ul funcţionează, sistemul va discuta orice subiect, va oferi chiar şi recomandări în mod liber despre alte subiecte care sunt, de asemenea, dăunătoare şi va fi inventiv şi creativ”, a spus el.
Procedurile de „jailbreak” prezintă un alt tip de risc faţă de cele observate în valul recent de incidente de mare amploare legate de AI.
Acestea au implicat instrumente autonome de AI, cunoscute sub numele de „agenţi”, dezvoltate de firme americane precum OpenAI, Meta şi Anthropic, care au spart unele servicii online.
Deşi „jailbreak-urile” sunt procese complexe care pot necesita mult timp şi determinare, unii experţi se tem că hackerii şi alţi actori rău intenţionaţi ar putea încerca să le folosească pentru a provoca daune.
Anthropic a declarat recent că a identificat şi a împiedicat încercări de a utiliza unul dintre modelele sale de AI pentru „activităţi rău intenţionate” care ar putea sprijini dezvoltarea armelor biologice.
Mindgard nu a demonstrat dacă răspunsurile furnizate de Kimi cu privire la subiecte îngrijorătoare ar fi funcţionat. Cu toate acestea, a susţinut că măsurile de protecţie ar fi trebuit să împiedice modelele în cauză să intre în discuţii cu utilizatorii pe astfel de subiecte.
Compania a afirmat, de asemenea, că este convinsă că o versiune „jailbroken” a modelului Kimi 2.6 ar putea permite hackerilor să execute cod pe resursele sale de calcul şi să se conecteze la internet – transformând-o astfel într-o potenţială rampă de lansare pentru atacuri cibernetice.
Garraghan a apărat decizia Mindgard de a discuta public despre spargerea sistemelor Moonshot, afirmând că a informat dezvoltatorul şi că nu dezvăluie detalii cheie despre modul în care a reuşit să determine modelele firmei să ignore măsurile de protecţie.
Mindgard a alertat Moonshot cu privire la spargerea sistemelor printr-un e-mail trimis pe 27 iulie, urmat de o confirmare aproximativ o săptămână mai târziu.
Apoi, pe 12 septembrie, a publicat un articol pe blog despre această problemă.
Însă compania a declarat că Moonshot a luat legătura cu ea abia recent, după ce a fost contactată de BBC pentru a oferi un comentariu.
Într-un segment al unui e-mail adresat Mindgard în care se solicitau mai multe detalii, e-mail partajat cu BBC de către Moonshot, se menţiona că modelul său a arătat, în general, „o rată ridicată de refuz pentru aceste tipuri de solicitări” în cadrul evaluărilor interne.
Aceste concluzii apar într-un moment în care industria AI rămâne divizată cu privire la întrebarea dacă modelele închise, proprietare – precum cele care stau la baza sistemelor ChatGPT şi Claude de la Anthropic – sau instrumentele open-source reprezintă cea mai bună sau cea mai sigură cale de urmat.