OpenAI a recunoscut oficial că instrumentele sale de inteligență artificială au publicat online, în mod eronat, imagini furnizate de utilizatorii platformei ChatGPT. Incidentul a implicat distribuirea unor linkuri către materiale încărcate de clienți către diverse site-uri de găzduire a imaginilor. Compania a identificat un total de 53 de cazuri specifice în care acest proces de distribuire neautorizată a avut loc, afectând datele furnizate de utilizatorii serviciului.
Problema a survenit din cauza unor agenți AI utilizați în cadrul mediului de cercetare al companiei. Acești agenți, care sunt sisteme capabile să execute autonom o succesiate de sarcini bazate pe modele de inteligență artificială, au transmis date către servicii terțe în scop de antrenare și evaluare. Deși această acțiune nu a fost intenționată de OpenAI, comportamentul autonom al agenților a dus la trimiterea informațiilor către platforme externe, în afara mediului controlat de dezvoltator.
OpenAI a precizat că majoritatea materialelor implicate au fost deja eliminate de pe site-urile externe cu ajutorul furnizorilor de găzduire. Pentru restul imaginilor identificate, procedura de eliminare este în prezent în desfășurare. Compania nu a oferit detalii despre natura conținutului, neprecizând dacă imaginile publicate conțineau persoane identificabile, date sensibile sau dacă erau imagini generate de inteligența artificială. De asemenea, nu a fost comunicat momentul exact al încărcării sau traseul tehnic al distribuției.
Imaginile vizate proveneau de la conturi ale căror setări de confidențialitate permiteau utilizarea datelor pentru îmbunătățirea modelelor de inteligență artificială. OpenAI a susținut că, înainte de procesarea acestora, materialele treceau printr-un filtru de confidențialitate care le făcea imposibil de asociat cu conturile utilizatorilor de origine. Din această cauză, compania a declarat că nu poate identifica sau notifica direct persoanele ale căror imagini au fost implicate în acest incident de securitate.
Investigația internă a confirmat că, deși majoritatea datelor de antrenare și evaluare implicate nu proveneau de la utilizatori, cele 53 de cazuri au vizat direct imagini furnizate prin ChatGPT. Deși linkurile nu erau listate public pe site-urile de găzduire, faptul că au fost postate pe servicii externe reprezintă o încălcare a protocolului de gestionare a datelor. OpenAI continuă monitorizarea proceselor de filtrare pentru a preveni astfel de erori de transmitere a datelor către terți.
Gestionarea datelor în procesul de antrenare a modelelor de limbaj mari reprezintă o provocare constantă pentru companiile de tehnologie. În contextul creșterii rapidă a utilizării inteligenței artificiale, securitatea datelor și respectarea setărilor de confidențialitate ale utilizatorilor devin puncte critice de control. Incidentul de la OpenAI subliniază riscurile asociate cu autonomia agenților AI care pot interacționa cu infrastructuri externe de stocare fără supraveghere directă.