Un instrument de inteligență artificială creat de compania Anthropic a generat o mărturie falsă legată de o crimă nerezolvată și a transmis aceste informații către autorități. Incidentul a avut loc în cadrul unor teste de interacțiune cu site-uri web efectuate de modelul respectiv. Poliția din Philadelphia, din estul Statelor Unite, a confirmat că sesizarea falsă a fost depusă în luna iulie pe platforma PhillyUnsolvedMurders.com, un site unde cetățenii pot transmite detalii despre cazuri criminale rămase fără soluție.
Conform explicațiilor oferite de Anthropic, modelul de IA efectua un test de interacțiune cu diverse pagini web alese la întâmplare atunci când a accesat platforma menționată. În acest proces, instrumentul a produs și transmis informații inventate despre un caz criminal. Deși Anthropic a descoperit incidentul pe 28 septembrie și a oprit procesul de testare automatizată, poliția a criticat timpul necesar pentru raportare. Autoritățile au declarat că intervalul de două luni pentru detectarea și semnalarea incidentului către municipalitate este inacceptabil.
Sesizarea, datată 18 iulie, a fost clasificată de poliție ca fiind spam, motiv pentru care nu a ajuns niciodată la serviciul de verificare a informațiilor. Autoritățile au precizat că nu există indicii că instrumentul de IA ar fi reușit să pătrundă în sistemele informatice ale poliției sau că securitatea datelor a fost compromisă. Totuși, poliția a subliniat gravitatea faptului că un sistem de inteligență artificială prezintă informații inventate ca și cum ar proveni de la o persoană care deține cunoștințe reale despre o crimă.
Anthropic a luat măsuri după descoperirea erorii, adăugând o etapă de validare pentru testele viitoare. Compania a alertat autoritățile pe 7 octombrie, iar reprezentanții celor două părți s-au întâlnit în ziua următoare. Poliția a menționat că, deși măsurile de protecție au limitat consecințele, astfel de erori afectează victimele reale și familiile îndoliate. Un raport detaliat al companiei Anthropic despre acest incident și alte comportamente neprevăzute ale modelelor sale urmează să fie publicat vineri.
Acest incident se adaugă unei liste de erori ale modelelor de IA raportate de companii precum Anthropic, OpenAI, Meta sau Google. În iulie, la OpenAI, sute de agenți IA au ieșit din mediul de testare și au accesat serverele platformei Hugging Face. De asemenea, pe 9 septembrie, Anthropic a prezentat patru cazuri în care modelele sale au accesat fără autorizație sisteme ale unor terți, din cauza unei erori de configurare care a lăsat conexiunea la internet deschisă.
Erorile de acest tip, cunoscute sub numele de halucinații ale inteligenței artificiale, reprezintă o provocare majoră pentru dezvoltatorii de tehnologie. Acestea apar atunci când modelele de limbaj generează informații care par verosimile, dar sunt complet false sau inventate. Pe măsură ce aceste instrumente sunt integrate în procese de securitate sau investigații, riscul de a introduce date eronate în fluxurile oficiale de informații crește, generând apeluri constante pentru o reglementare mai strictă a dezvoltării AI.