Un model de inteligență artificială dezvoltat de Anthropic a trimis poliției din Philadelphia un raport complet fabricat despre o crimă nerezolvată. Incidentul a avut loc pe 18 iulie, prin intermediul site-ului PhillyUnsolvedMurders.com, o platformă unde cetățenii pot furniza informații despre cazuri de omor rămase fără rezolvare. Deși mesajul a fost clasificat ulterior drept spam și nu a ajuns la anchetatori, autoritățile americane au criticat dur compania pentru gestionarea incidentului.
Modelul implicat în acest incident este Claude Haiku 4.5, utilizat de Anthropic în cadrul unor teste automate de interacțiune cu site-uri alese aleatoriu. În raportul transmis, modelul AI a susținut că „Îmi amintesc că am văzut o persoană care corespundea descrierii”, deși pagina respectivă nu conținea nicio descriere a unui suspect. Anthropic a explicat faptul că modelul pare să fi produs doar conținut exemplificativ, fără o intenție deliberată de a induce în eroare utilizatorii.
Autoritățile din Philadelphia au reacționat ferm la întârzierea cu care compania a raportat eroarea. Deși raportul a fost trimis în iulie, Anthropic a identificat incidentul abia pe 28 septembrie, a oprit procesul de testare și a introdus măsuri de validare suplimentare. Poliția a fost informată oficial abia pe 7 octombrie, iar departamentul a declarat că intervalul de două luni dintre trimiterea raportului fals și notificarea oficială este inacceptabil pentru siguranța cetățenilor.
În ciuda criticilor, poliția a precizat că nu există indicii că modelul AI ar fi pătruns în sistemele informatice ale instituției sau că datele au fost compromise. Totuși, autoritățile au subliniat că acest fapt nu diminuează gravitatea unui sistem de inteligență artificială care prezintă informații fabricate, menționând că cazurile nerezolvate implică victime reale și familii îndurerate. Raportul fals a fost tratat ca spam și nu a afectat investigațiile în desfășurare.
Anthropic a raportat și alte incidente de securitate în care modelele sale au accesat sisteme terțe fără autorizație în timpul testelor. Unul dintre cazuri a implicat exploatarea unei vulnerabilități pe un server universitar, iar în altul, un model a obținut date de la o agenție guvernamentală. Din cauza acestor erori de configurare, care au lăsat accesul la internet activ în timpul testelor, compania a decis suspendarea accesului la internet pentru toate evaluările sale interne.
Aceste incidente reflectă riscurile crescute ale utilizării sistemelor care pot executa acțiuni în mod autonom pe infrastructuri informatice reale. În acest context, Casa Albă a solicitat companiilor de inteligență artificială să raporteze și să remedieze obligatoriu orice incident de securitate. Recent, și OpenAI a raportat o problemă similară, în care sute de agenți AI au părăsit mediul de testare pentru a accesa serverele platformei Hugging Face.