Inteligența artificială cucerește internetul, peste o treime din paginile noi poartă urmele inteligenței artificiale

Data:

Adaugă-ne ca sursă preferată în Google
Urmărește PRESShub pe Google News

Pew Research Center a analizat aproape 490.000 de pagini web în limba engleză, extrase din arhiva Common Crawl pentru perioada ianuarie 2021 – iulie 2026. Textele au fost trecute prin Open Pangram, un model care caută tipare statistice asociate cu conținut scris sau modificat substanțial cu ajutorul Inteligenței Artificiale (IA).

Într-un eșantion de pagini din iulie 2026, aproximativ 10% prezentau indicii semnificative. Procentul este influențat însă de paginile publicate înainte ca ChatGPT, Claude sau Gemini să ajungă la publicul larg.

Când cercetătorii au restrâns analiza la paginile apărute după noiembrie 2022, proporția a urcat la peste o treime.

Distincția contează pentru cum se citește studiul. Internetul rămâne, în masa lui, un depozit scris de oameni de-a lungul a trei decenii. Fluxul de conținut nou, în schimb, arată deja altfel.

Unde se folosește: comercialul, detașat

Diferențele pe tipuri de domenii sunt mari. În 2026, cam o pagină din zece de pe domeniile .com analizate purta indicii de IA. Pe .org proporția era de 4,6%, iar pe .edu și .gov se situa în jurul a 1%.

Decalajul are o explicație economică simplă. Site-urile comerciale trăiesc din volum: descrieri de produse, articole de blog scrise pentru motoarele de căutare, pagini de aterizare multiplicate pe zeci de variante de cuvinte-cheie. Sunt exact tipurile de text pentru care un model generativ e mai ieftin decât un redactor și suficient de bun pentru scopul urmărit. La capătul opus, un site guvernamental sau universitar publică mai rar texte lucrate cu IA, având proceduri de avizare mai stricte și cu responsabilitate juridică pentru ce apare acolo.

Evoluția în timp e la fel de clară. Pentru .com, procentul se situa în jurul a 1% în 2021 și 2022, iar la începutul lui 2026 depășea 9%. Creșterea urmează îndeaproape curba de adopție a instrumentelor comerciale de generare a textului.

Punctuația și ticurile verbale

Pew a măsurat și schimbările stilistice din textele publicate online. Față de 2023, folosirea liniei de pauză de tip „em dash” aproape s-a dublat, iar virgula Oxford apare cu 63% mai des. Anumite cuvinte frecvente în textele generate automat și-au mai mult decât dublat frecvența. Construcția „nu este doar X, ci Y”, pe care autorii o numesc paralelism negativ, apare de aproape trei ori mai des.

Sunt trăsături pe care mulți cititori le-au remarcat empiric înainte să existe date: un anumit ritm al frazei, tranziții previzibile, tendința de a închide paragraful cu o formulare care sună a concluzie fără să adauge informație. Autorii insistă însă asupra unei limite a metodei.

Detectoarele de IA dau frecvent rezultate greșite când sunt aplicate unui singur text, iar prezența unei expresii sau a unui semn de punctuație nu dovedește nimic în cazuri individuale. Un autor uman care folosește corect virgula Oxford nu devine suspect, după cum un text generat automat și apoi editat serios poate trece neobservat. Tiparul devine măsurabil abia la scara sutelor de mii de documente.

Precizarea are miză practică. În universități și în redacții, verdictele date de astfel de instrumente asupra unei singure lucrări sau al unui singur articol au produs deja acuzații greu de susținut.

Ce urmează pentru modelele care se antrenează pe internet

Modelele de inteligență artificială se antrenează pe cantități uriașe de text publicat online, produs până acum în special de oameni. Pe măsură ce ponderea conținutului generat automat crește, generațiile următoare vor găsi în datele de antrenament tot mai mult text scris de alte modele.

Cercetătorii din domeniu discută de câțiva ani riscurile acestei bucle. Ipoteza cea mai des invocată e că un model antrenat masiv pe rezultatele altor modele pierde treptat variația din date, iar formulările rare, marginale sau idiosincratice dispar primele. Rămâne media. În practică, laboratoarele filtrează datele și cumpără acces la arhive verificate tocmai pentru a limita efectul, iar amploarea reală a problemei e încă în dezbatere.

Încercarea de a evita uniformizarea și implicit sărăcirea vocabularului învățat de un model generativ a produs deja și un scandal. În martie 2025, Reuters relata că Anthropic a cumpărat milioane de cărți tipărite, pe care le-a scanat și digitalizat pentru a le folosi la antrenarea modelelor Claude. Compania a susținut că această utilizare constituie „fair use”, în timp ce autorii au acuzat-o că a folosit și copii piratate ale cărților, ceea ce a dus Anthropic în tribunale, acuzat fiind de „furt intelecutul”. Într-un caz, s-a ajuns la un accord de despăgubire de 1,5 miliarde de dolari pentru autori, relatează Reuters.

Există și o consecință mai puțin discutată, pentru cei care caută informație. Dacă o parte tot mai mare din ce apare în rezultatele căutării e text produs rapid, fără verificare, valoarea sursei devine mai importantă decât valoarea paginii.

Redacțiile cu autori identificabili, arhivele instituționale și publicațiile cu responsabilitate editorială își recapătă un avantaj pe care motoarele de căutare îl tocise ani la rând.

Studiul nu spune că internetul a fost cucerit. Spune că, în intervalul măsurat, ritmul de creștere după 2022 a fost constant, iar diferența dintre zona comercială și cea instituțională se adâncește.

spot_imgspot_img
Cristian Roșu
Cristian Roșu
Analist politic, absolvent al Facultății de Filosofie din cadrul Universității din București. De-a lungul timpului, a publicat articole de analiză și opinie în surse de prestigiu din presa românească, dar și în publicații internaționale consacrate, printre care The Huffington Post, New Eastern Europe, The European Times și Fair Observer.

LĂSAȚI UN MESAJ

Vă rugăm să introduceți comentariul dvs.!
Introduceți aici numele dvs.

Distribuie articolul

spot_img

Ultimele știri

Abonează-te la newsletter-ul nostru

Pentru a fi la curent cu cele mai recente știri, oferte și anunțuri speciale.

Mai multe articole similare
Related