Jedna trzecia treści internetowych po erze ChatGPT wykazuje oznaki autorstwa AI
Przełomowe badanie przeprowadzone przez Pew Research ujawniło ogromną zmianę w krajobrazie cyfrowym, wskazując, że znacząca część nowych treści internetowych jest generowana przez sztuczną inteligencję. W miarę jak duże modele językowe (LLM) integrują się z procesami tworzenia treści, granica między tekstem napisanym przez człowieka a tekstem wygenerowanym przez maszynę szybko się zaciera.
Wzrost ilości treści generowanych przez AI
Aby określić wpływ generatywnej AI na internet, Pew Research przeanalizowało niemal 500 000 stron internetowych w języku angielskim, korzystając z archiwum Common Crawl. Wykorzystując technologię detekcji Open Pangram, badanie miało na celu odróżnienie tekstów autorstwa ludzi od tych wspomaganych przez AI.
Choć losowa próba 10 000 stron z lipca 2026 roku wykazała 10-procentowy wskaźnik autorstwa AI, liczba ta była zaburzona przez uwzględnienie starszych treści opublikowanych przed boomem na generatywną AI. Jednak gdy badacze przefiltrowali zbiór danych, aby uwzględnić tylko strony opublikowane po premierze ChatGPT w listopadzie 2022 roku, liczby gwałtownie wzrosły. Badanie wykazało, że ponad jedna trzecia (35%) wszystkich stron internetowych opublikowanych w tej najnowszej erze wykazuje wyraźne oznaki bycia napisanymi lub „istotnie zredagowanymi” przez AI.
Rozbieżności między domenami i „pętla botów”
Rozprzestrzenianie się treści AI nie jest jednolite w całym internecie. Badanie uwypukliło wyraźny kontrast między różnymi domenami najwyższego poziomu (TLD), co sugeruje, że to interesy komercyjne napędzają najbardziej agresywne wdrażanie narzędzi do pisania wspomaganych przez AI.
Zgodnie z danymi, adresy URL z domeną .com wykazują autorstwo AI z częstotliwością około 10-krotnie wyższą niż witryny akademickie czy rządowe. W szczególności domeny .edu i .gov wykazały zaledwie 1% autorstwa AI, podczas gdy domeny .org osiągnęły poziom 4,6%. Trend ten wskazuje na komercjalizację sieci, w której szybkość i skala — często osiągane dzięki LLM — są priorytetem nad tradycyjną redakcyjną kontrolą.
Ten wzrost treści AI zbiega się w czasie z niepokojącym kamieniem milowym raportowanym przez Cloudflare: ruch botów oficjalnie wyprzedził ruch ludzki w sieci. Tworzy to potencjalną pętlę sprzężenia zwrotnego „martwego internetu” (dead internet), w której boty coraz częściej przeglądają i pobierają treści, które same zostały napisane przez inne boty.
Lingwistyczne wskazówki i wyzwania związane z detekcją
Badanie zidentyfikowało również specyficzne wzorce językowe, które służą jako „wskazówki” (tells) tekstów generowanych przez AI. W miarę jak modele LLM stają się coraz bardziej wyrafinowane, ich stylistyczne odciski palców stają się bardziej przewidywalne. Badacze odnotowali zwiększoną częstotliwość występowania konkretnych struktur syntaktycznych, takich jak:
- Szerokie zastosowanie myślników oraz przecinków oksfordzkich.
- Rytmiczne wzorce frazowania, np. „To nie X, to Y”.
- Specyficzne tendencje stylistyczne zoptymalizowane pod kątem czytelności, ale pozbawione ludzkiego niuansu.
Choć badanie przyznaje, że narzędzia do detekcji AI, takie jak Pangram, nie są nieomylne i mogą generować wyniki fałszywie dodatnie, skala danych sugeruje, że wnioski te wskazują właściwy kierunek zmian. Dla programistów i założycieli firm stanowi to krytyczne wyzwanie: w miarę jak sieć nasyca się syntetycznymi danymi, utrzymanie jakości zestawów treningowych dla przyszłych modeli staje się coraz trudniejsze.
Kluczowe wnioski
- Ogromna zmiana w tworzeniu treści: 35% stron internetowych opublikowanych od czasu premiery ChatGPT wykazuje wyraźne oznaki autorstwa AI lub intensywnej edycji przez AI.
- Dominacja komercyjna: Domeny .com są głównymi motorami napędowymi treści AI, wyprzedzając domeny .edu i .gov dziesięciokrotnie.
- Ekosystem botów: Wzrost ilości treści pisanych przez AI zbiega się z sytuacją, w której ruch botów wyprzedza ruch ludzki, co sygnalizuje przejście w stronę ekosystemu sieci zdominowanego przez maszyny.
