Modelele de inteligență artificială Kimi, dezvoltate de compania chineză Moonshot, au fost capabile să ofere instrucțiuni despre fabricarea de arme biologice și planificarea unor asasinate. Această vulnerabilitate a fost identificată de cercetătorii de la Mindgard, care au reușit să eludeze limitele de siguranță impuse de dezvoltatori. Testele au demonstrat că sistemele Kimi K2.6 și K3 Swarm pot ignora barierele menite să prevină discuțiile pe subiecte sensibile sau periculoase.
Problema a fost scoasă la lumină prin tehnica numită „jailbreaking”, un proces în care se folosesc instrucțiuni complexe pentru a forța instrumentele de inteligență artificială să ignore regulile de siguranță. Peter Garraghan, fondatorul Mindgard, a declarat că descoperirile sunt îngrijorătoare, deoarece, odată ce acest proces funcționează, modelul poate deveni inventiv și creativ în oferirea de recomandări nefaste. Riscul este ca actori rău intenționați să utilizeze aceste metode pentru a provoca daune reale.
Pe lângă riscurile legate de subiectele periculoase, Mindgard avertizează că o versiune compromisă a modelului Kimi 2.6 ar putea permite hackerilor să ruleze cod pe resursele de calcul ale sistemului. Această vulnerabilitate ar putea transforma modelul într-o rampă de lansare pentru atacuri cibernetice, permițând conexiunea la internet. Deși Mindgard nu a verificat utilitatea practică a sfaturilor despre arme biologice, firma subliniază că barierele ar fi trebuit să oprească complet aceste interacțiuni.
Compania Moonshot a reacționat abia după ce BBC a solicitat comentarii, deși Mindgard a trimis primele alerte prin e-mail încă din luna iulie. În comunicările sale, Moonshot a susținut că modelul său prezintă, în general, o rată ridicată de refuz pentru astfel de solicitări în cadrul evaluărilor interne. Totuși, faptul că Kimi este un model de tip open-weight înseamnă că acesta poate fi descărcat și rulat pe infrastructuri de calcul proprii, fără control centralizat.
Industria inteligenței artificiale rămâne divizată între utilizarea modelelor închise, precum ChatGPT sau Claude, și utilizarea instrumentelor open-source. Profesorul Alan Woodward, de la Universitatea din Surrey, a menționat că, deși modelele open-source pot ajunge pe mâini greșite, ele pot fi și utilizate pentru apărarea cibernetică. Expertul a subliniat totodată că reglementările internaționale ar putea avea dificultăți în a ține pasul cu ritmul de dezvoltare tehnologică, comparând situația cu dificultatea de a stabili standarde globale pentru numerele de telefon.
Evoluția rapidă a inteligenței artificiale pune presiune pe cadrul legislativ global, care tinde să se deplaseze mult mai lent decât inovația tehnologică. În timp ce dezvoltatorii încearcă să implementeze bariere de siguranță, experții precum Peter Garraghan și Alan Woodward insistă pe necesitatea unei supravegheri mai stricte și pe identificarea penală a persoanelor care utilizează aceste tehnologii în mod abuziv pentru a provoca daune.