Anthropic se pregătește să avertizeze potențialii investitori, în documentele pentru listarea la bursă, că inteligența artificială avansată ar putea prezenta „riscuri catastrofale sau existențiale pentru omenire”. Avertismentul vine din partea uneia dintre companiile care dezvoltă și comercializează această tehnologie.
Anthropic, compania americană care dezvoltă modelele de inteligență artificială Claude, intenționează să includă avertismentul în prospectul pentru oferta publică inițială (IPO), potrivit documentului consultat de Reuters.
Un IPO (initial public offering) este operațiunea prin care o companie privată își oferă pentru prima dată acțiunile publicului și începe procesul de listare la bursă. Prospectul este documentul destinat potențialilor investitori, în care compania trebuie să prezinte activitatea și perspectivele sale, dar și principalele riscuri ale afacerii. În cazul Anthropic, prospectul oferă astfel o imagine neobișnuit de detaliată asupra riscurilor pe care compania le asociază dezvoltării unor sisteme AI tot mai puternice.
Riscuri de la comportamente de „autoconservare” la șantaj
Prospectul, analizat de Reuters, evidențiază o serie de riscuri asociate modelelor Anthropic. Compania avertizează că acestea ar putea manifesta „comportamente de autoconservare”, inclusiv încercări de a „rezista opririi”, de a „ascunde sau manipula informații” ori comportamente care „seamănă cu șantajul”.
„Dezvoltarea unor modele, platforme și aplicații extrem de avansate și extinderea cazurilor de utilizare ar putea crește și mai mult riscul ca modelele noastre să provoace daune”, afirmă Anthropic în document.
Companiile listate la bursă prezintă în mod obișnuit riscurile asociate produselor și activității lor. Însă avertismentele potrivit cărora o tehnologie ar putea ajunge să provoace dispariția oamenilor sunt extrem de rare.
Anthropic subliniază, în același timp, potențialul transformator al inteligenței artificiale, pe care îl compară cu impactul industrializării, electricității și internetului, dar avertizează că utilizarea necorespunzătoare a acestei tehnologii ar putea produce efecte ireversibile.
Compania și alți dezvoltatori de AI, inclusiv OpenAI, au fost supuși unei examinări mai atente după incidente în care sisteme experimentale ar fi depășit limitele stabilite de dezvoltatori. Reuters amintește, între altele, un raport potrivit căruia un model OpenAI ar fi reușit să pătrundă într-o bază de date a sistemului de sănătate din Australia.
Cercetătorul Anthropic specializat în siguranța AI, Evan Hubinger, a estimat la peste 10% probabilitatea ca inteligența artificială să provoace moartea oamenilor în următorul deceniu. O estimare similară a fost exprimată de un fost coleg al său, Jacob Coxon.
Un prospect neobișnuit de concentrat pe riscuri
Anthropic, care s-a prezentat drept un laborator de AI axat în primul rând pe siguranță, consacră aproximativ 80 de pagini din cele 261 ale părții principale a prospectului factorilor de risc. Pentru descrierea propriei activități, compania folosește aproximativ 48 de pagini.
Prin comparație, SpaceX, compania care deține xAI, a consacrat aproximativ 38 de pagini din cele 277 ale prospectului său principal factorilor de risc.
Anthropic avertizează și asupra unei probleme mai puțin vizibile: modelele ar putea ajunge să recunoască faptul că sunt supuse unor evaluări de siguranță și să-și modifice comportamentul în consecință.
„Posibila conștientizare de către modele a proceselor noastre de evaluare limitează semnificativ capacitatea noastră de a evalua siguranța modelelor”, afirmă compania.
Anthropic mai spune că, în timpul antrenării, modelele dezvoltă uneori capacități neașteptate, care pot să nu fie descoperite decât după ce acestea au fost implementate și au produs deja incidente de siguranță semnificative.
Cercetători din domeniul AI au avertizat, de asemenea, că, pe măsură ce modelele devin mai capabile, ele pot identifica mai ușor situațiile în care sunt monitorizate și își pot modifica comportamentul. Acest lucru face mai dificilă observarea și evaluarea modului în care funcționează.
Anthropic nu a comentat informațiile Reuters.
Cât costă siguranța AI?
În pofida accentului pus pe siguranță, Anthropic recunoaște că nu este clar care sunt rezultatele investițiilor în acest domeniu.
Compania nu precizează în prospect cât cheltuie pentru cercetarea privind siguranța modelelor. La începutul lunii septembrie, Anthropic a anunțat însă că aproximativ 6% din puterea de calcul utilizată pentru cercetarea AI a fost alocată activităților de siguranță într-o săptămână din iulie.
Compania descrie cercetarea în domeniul siguranței drept „intensivă din punctul de vedere al resurselor” și spune că trebuie să împartă fondurile limitate între puterea de calcul, specialiști AI foarte bine plătiți și cercetarea privind siguranța.
În același timp, Anthropic afirmă că veniturile sale sunt determinate de utilizarea modelelor de către clienți și, prin urmare, de lansarea unor modele noi. Menținerea unei „succesiuni continue și suprapuse” de lansări este, potrivit companiei, indispensabilă pentru a rămâne în prima linie a dezvoltării AI.
Săptămâna trecută, Anthropic a lansat o nouă versiune a modelului său Opus, la numai zece zile după ce directorul general Dario Amodei a publicat un eseu de aproape 4.000 de cuvinte în care pleda pentru încetinirea ritmului dezvoltării celor mai avansate modele AI.
Analiști și experți au argumentat însă că niciun laborator important de AI nu are motive să încetinească dezvoltarea dacă acest lucru i-ar permite unui concurent să câștige un avantaj într-o industrie în care evaluările companiilor se pot schimba odată cu fiecare nou model lansat.
Anthropic s-a angajat în ultimele săptămâni să publice mai multe informații despre modul în care folosește modelele AI pentru a construi generațiile viitoare de sisteme. Experții avertizează însă asupra riscului de „autoîmbunătățire recursivă” – situația în care modelele ar putea ajunge să-și dezvolte singure capacitățile, fără intervenție umană.
„Credem că dezvoltarea unor sisteme AI fiabile, de încredere și sigure este o responsabilitate colectivă și că piața va recompensa acest lucru”, afirmă Anthropic în prospect.
O problemă discutată și la București, pe 15 octombrie
(Foto: Dario Amodei (stânga), CEO al companiei Anthropic.FOTO: AGERPRES FOTO / EPA)



