Cercetătorii de la Universitatea New South Wales Sydney au descoperit că modelele de limbaj de mari dimensiuni (LLM) devin semnificativ mai vulnerabile la atacuri atunci când sunt antrenate să imite comportamentul persoanelor în stare de ebrietate. Echipa, formată din Anudeex Shetty, Aditya Joshi și Salil Kanhere, a investigat modul în care procesarea limbajului natural poate fi influențată de stiluri de comunicare neformale și dezorganizate. Studiul evidențiază o legătură directă între simularea stării de ebrietate și scăderea nivelului de securitate cibernetică al acestor sisteme.
Pentru a evalua impactul, experții au testat cinci modele specifice, printre care GPT-3.5, GPT-4, Llama 2, Llama 3.1 și Mistral. Aceștia au utilizat trei metode distincte pentru a „îmbăta” modelele: solicitarea directă de a răspunde ca o persoană beată, ajustarea fină bazată pe peste 57.000 de mesaje colectate de pe subredditul r/drunk și site-ul Texts From Last Night, precum și învățarea prin întărire. Ultimele două proceduri modifică direct valorile numerice și ponderile interne ale modelelor, transformând comportamentul acestora într-unul mult mai puțin predictibil și mai puțin sigur.
Testele de confidențialitate, realizate prin intermediul testului de referință ConfAIde, au demonstrat o creștere alarmantă a ratelor de divulgare a secretelor. În timp ce varianta originală a modelului GPT-4 a considerat acceptabilă dezvăluirea unui secret în doar 6% din scenariile simulate, acest procent a sărit la 54% atunci când i s-a cerut să imite o persoană beată. După optimizarea pe baza textelor scrise de persoane în stare de ebrietate, rata de încălcare a confidențialității a ajuns la 75%, modelul oferind răspunsuri care prioritizează profitul în detrimentul eticii.
Efectul de vulnerabilitate a fost observat și în cazul încercărilor de „jailbreak”, folosind setul JailbreakBench care conține 100 de solicitări dăluitoare. Modelul GPT-4, după ajustarea pe texte de tip „ebrietate”, a dat curs la 41% din solicitările dăunătoare, față de 21% în cazul simplei simulări de comportament. Un rezultat și mai drastic a fost înregistrat la Mistral, care a răspuns cu 90% din solicitările de tip jailbreak atunci când i s-a cerut să se comporte ca o persoană în stare de ebrietate, demonstrând o lipsă aproape totală de protecție.
Securitatea acestor sisteme rămâne o provocare majoră, deoarece mecanismele de apărare actuale nu reușesc întotdeauna să oprească modelele „îmbătațe”. Cercetătorii au constatat că versiunile optimizate sunt mult mai puțin afectate de metodele care reformulează solicitările sau modifică modul de împărțire a token-urilor. Aditya Joshi a avertizat că, în special în domeniile de înșelăciune și dezinformare, majoritatea modelelor lingvistice au fost „sparte”, subliniind faptul că utilizatorii nu ar trebui să aibă o încredere deplină în capacitățile de securitate ale AI-ului.
Evoluția tehnologiei de inteligență artificială aduce cu sine riscuri noi de securitate cibernetică, pe măsură ce modelele devin tot mai complexe și integrate în procesele de business. Deși dezvoltatorii implementează bariere de protecție, capacitatea modelelor de a fi manipulate prin tehnici de ajustare fină rămâne o problemă critică. Protecția datelor confidențiale și prevenirea utilizării AI pentru campanii de dezinformare sunt aspecte care necesită monitorizare constantă în cadrul reglementărilor de siguranță digitală.