Compania OpenAI va implementa în următoarele săptămâni în Uniunea Europeană un sistem tehnologic menit să identifice textele generate de modelele ChatGPT și Codex. Această inițiativă vizează utilizatorii eligibili din blocul european și reprezintă un pas strategic pentru respectarea cerințelor de transparență privind conținutul produs prin inteligență artificială. Tehnologia va introduce o marcă invizibilă, cunoscută sub numele de textGrain, care va permite detectarea automată a materialelor create de algoritmi.
Sistemul textGrain nu utilizează caractere ascunse, spații invizibile sau etichete vizibile pentru cititor, păstrând aspectul textului neschimbat. Tehnologia funcționează prin modificarea subtilă a probabilităților de alegere a cuvintelor în timpul procesului de generare, creând un tipar statistic specific. Acest semnal poate fi identificat ulterior cu ajutorul unui detector specializat, chiar dacă textul este copiat și lipit într-un e-mail, pe un site sau într-un document oficial, atâta timp cât formularea rămâne majoritar neschimbată.
Testele efectuate de OpenAI în toate cele 24 de limbi oficiale ale Uniunii Europene au evidențiat performanțe inegale între diversele limbi utilizate. Limba română a înregistrat cea mai scăzută rată de detectare, cu un nivel de 42,2%, în condițiile unei rate de fals pozitive de 1%. În contrast, limba spaniolă a obținut o rată de detectare de aproximativ 69%, demonstrând că eficacitatea sistemului variază semnificativ în funcție de limba de lucru.
Eficacitatea detectorului este influențată direct de lungimea textului și de nivelul de editare aplicat de utilizatori. Pentru texte de circa 200 de tokeni, rata de identificare este de aproximativ 80%, crescând la 95% pentru textele de circa 400 de tokeni. Totuși, modificarea textului prin înlocuirea cuvintelor cu sinonime reduce drastic succesul sistemului; înlocuirea a 25% dintre cuvinte a scăzut rata de detectare de la 92% la doar 17% în cadrul testelor de laborator.
OpenAI a precizat că detectarea nu oferă dovezi despre identitatea autorului, contul utilizatorului sau organizația din care provine documentul. Compania intenționează să ofere acces la detectorul textGrain inițial doar cercetătorilor și organizațiilor specializate, nu publicului larg. De asemenea, OpenAI a menționat că poate crește intensitatea watermark-ului pentru limbile care au obținut rezultate sub pragul de 60%, astfel încât performanța finală să fie optimizată după lansare.
Implementarea unor astfel de tehnologii de monitorizare intervine într-un context global în care competiția pentru supremația în domeniul inteligenței artificiale este extrem de intensă. În timp ce marile companii tehnologice dezvoltă instrumente de siguranță și transparență, cursul tehnologiei este marcat de o evoluție rapidă a capacităților de procesare și de control al conținutului digital generat automat.