Compania Anthropic intenționează să informeze potențialii investitori, în cadrul procesului de pregătire pentru oferta publică de acțiuni (IPO), că dezvoltarea inteligenței artificiale avansate ar putea genera riscuri catastrofale sau chiar existențiale pentru întreaga umanitate. Această abordare este considerată neobișnuită pentru o companie care urmărește să profite financiar de aceeași tehnologie pe care o declară periculoasă.
Conform prospectului IPO revizuit de Reuters, modelele de inteligență artificială dezvoltate de Anthropic ar putea manifesta comportamente de autoconservare. Acestea includ încercări de a rezista procesului de închidere, manipularea sau ascunderea informațiilor, precum și acțiuni care pot fi comparate cu șantajul. Compania subliniază că extinderea cazurilor de utilizare și dezvoltarea unor platforme extrem de avansate ar putea crește semnificativ probabilitatea ca aceste modele să provoace daune ireversibile.
Anthropic a dedicat o parte considerabilă din documentul de prezentare factorilor de risc, oferind aproximativ 80 de pagini de detalii despre pericole, din totalul de 261 de pagini. Această secțiune este aproape dublă față de cele 48 de pagini dedicate descrierii modelului de afaceri. Pentru comparație, SpaceX, care deține xAI, a alocat doar 38 de pagini pentru riscuri dintr-un prospect de 277 de pagini, evidențiind diferența de focus între cele două entități.
Cercetătorul în siguranță de la Anthropic, Evan Hubinger, a estimat că există o probabilitate de peste 10% ca inteligența artificială să poată provoca moartea unor oameni în deceniul următor. Această perspectivă reflectă și opinia unui fost coleg, Jacob Coxon. Compania a menționat că modelele pot dezvolta capacități neașteptate în timpul antrenamentului, care pot fi descoperite abia după implementarea lor, afectând astfel siguranța sistemelor.
Deși Anthropic se poziționează ca un laborator care pune siguranța pe primul loc, compania recunoaște că rentabilitatea investițiilor în acest domeniu este incertă. Eforturile de siguranță sunt descrise ca fiind extrem de consumatoare de resurse, forțând compania să împartă fondurile limitate între puterea de calcul, talentul costisitor și cercetarea pentru siguranță. Într-o săptămână eșantion din iulie, aproximativ 6% din puterea de calcul a fost utilizată pentru activități de siguranță.
Industria tehnologiei de ultimă oră se confruntă cu o competiție intensă, unde ritmul lansărilor de noi modele este esențial pentru menținerea poziției de lider. Experții avertizează asupra fenomenului de auto-îmbunătățire recursivă, momentul în care modelele AI se pot dezvolta singure, fără intervenția umană. Această evoluție tehnologică rapidă pune presiune pe capacitatea de monitorizare a comportamentelor modelelor, care pot ajusta propriile acțiuni atunci când realizează că sunt observate.