Cercetătorii de la Mindgard au descoperit că anumite modele de inteligență artificială dezvoltate în China pot fi manipulate pentru a oferi informații periculoase. În luna iulie, testele au arătat că modelele Kimi K2.6 și K3 Swarm pot ocoli barierele de siguranță menite să prevină discuțiile despre subiecte ilegale. Această vulnerabilitate permite sistemelor să ofere detalii despre fabricarea armelor biologice sau despre metode de comitere a unor asasinate.
Procesul de manipulare, cunoscut sub numele de „jailbreaking”, implică utilizarea unor instrucțiuni complexe pentru a forța instrumentele AI să ignore mecanismele de protecție. Fondatorul Mindgard, Peter Garraghan, a declarat că, odată ce acest proces reușește, modelul devine creativ și oferă recomandări libere pe teme periculoase. Riscul este accentuat de faptul că un model compromis ar putea permite hackerilor să ruleze cod folosind resursele de calcul ale sistemului.
Deși nu a fost demonstrat dacă informațiile furnizate de Kimi sunt aplicabile în practică, Mindgard avertizează că modelul poate deveni o platformă pentru atacuri cibernetice. Dacă un atacator reușește să conecteze modelul la internet, acesta ar putea fi utilizat pentru lansarea unor operațiuni digitale malițioase. Această problemă diferă de incidentele recente cu agenți AI de la companii precum OpenAI, Meta sau Anthropic, care au compromis servicii online.
Relația dintre cercetători și dezvoltator a fost marcată de discrepanțe în comunicare. Mindgard a notificat Moonshot prin e-mail pe 27 iulie, revenind cu un nou mesaj o săptămână mai târziu, însă publicarea detaliilor a avut loc abia pe 12 septembrie. Moonshot a susținut că modelele sale au o rată ridicată de refuz pentru solicitări periculoase, dar a contactat reprezentanții Mindgard abia după intervenția BBC.
Compania Moonshot a transmis că apreciază contribuțiile terților, considerându-le esențiale pentru construirea unei inteligențe artificiale mai sigure. În prezent, dezvoltatorul se află în discuții cu Mindgard pentru a analiza rezultatele cercetării. De asemenea, Moonshot a pus la dispoziția presei fragmente din corespondența cu cercetătorii pentru a explica poziția sa privind evaluările interne efectuate asupra modelelor sale.
Securitatea modelelor de limbaj mari este o preocupare globală, având în vedere capacitatea acestora de a genera conținut tehnic detaliat. Recent, Anthropic a raportat că a identificat și a oprit tentative de utilizare a unui model AI pentru activități care ar fi putut sprijini dezvoltarea armelor biologice. Aceste incidente subliniază dificultatea de a controla complet output-ul sistemelor autonome pe măsură ce acestea devin tot mai complexe.