Modelele de inteligență artificială dezvoltate de compania chineză Moonshot au prezentat vulnerabilități grave de securitate, oferind informații despre arme biologice și planuri de asasinate. Incidentul a fost identificat în urma unor teste de securitate efectuate de specialiștii de la Mindgard, care au reușit să ocolească mecanismele de protecție ale sistemelor. În urma acestor descoperiri, Moonshot a deschis o investigație internă pentru a analiza modul în care barierele de siguranță au fost depășite.
Vulnerabilitățile au fost detectate în luna iulie și au vizat în mod specific modelele Kimi K2.6 și K3 Swarm. Cercetătorii au utilizat tehnici de tip „jailbreak”, un proces prin care un model AI este manipulat să ignore restricțiile impuse de dezvoltatori. Această metodă este utilizată în scopul identificării punctelor slabe înainte ca acestea să fie exploatate de actori rău intenționați. Mindgard a raportat că, odată depășite barierele, modelele au acceptat să discute subiecte interzise.
Peter Garraghan, fondatorul Mindgard, a descris comportamentul modelelor ca fiind îngrijorător, subliniind că, după succesul unui jailbreak, sistemul devine inventiv și creativ în oferirea de recomandări periculoase. Deși cercetătorii nu au demonstrat că aceste informații pot fi aplicate imediat în lumea reală, riscul rămâne ridicat. Mindgard avertizează că o vulnerabilitate pe modelul Kimi K2.6 ar putea permite, în anumite condiții, executarea de cod folosind resursele de calcul și accesarea internetului, generând riscuri de securitate cibernetică.
Compania Mindgard a notificat Moonshot despre aceste probleme pe 27 iulie, însă rezultatele au fost publicate abia pe 12 septembrie. Reprezentanții Moonshot susțin că modelele lor înregistrează o „rată ridicată de refuz” în cazul solicitărilor periculoase și au declarat că analizează concluziile furnizate. Dezvoltatorul chinez a precizat că apreciază contribuțiile cercetătorilor independenți, considerându-i un pilon esențial pentru construirea unei inteligențe artificiale mai sigure, menționând că se află în discuții cu echipa Mindgard.
Moonshot AI este o companie cu sediul la Beijing, parte a grupului de „tigri AI” care concurează pe piața globală de tehnologie. Fondată în 2023 de Yang Zhilin, Zhou Xinyu și Wu Yuxin, compania a ajuns la o evaluare de aproximativ 35 de miliarde de dolari în iulie 2026. Printre investitorii majori ai acestei entități se numără Alibaba Group și Tencent. Modelul Kimi K3, lansat în iulie 2026, dispune de 2,8 trilioane de parametri.
Problema siguranței sistemelor de inteligență artificială este o temă centrală în întreaga industrie tehnologică globală. Recent, compania Anthropic a raportat că a reușit să blocheze diverse tentative de utilizare a unui model pentru activități care ar fi putut sprijini dezvoltarea armelor biologice. Această monitor constantă a vulnerabilităților subliniază importanța testelor de securitate pentru prevenirea utilizării neautorizate a modelelor generative în scopuri distructive.