Треть веб-контента после появления ChatGPT имеет признаки авторства ИИ

Революционное исследование Pew Research выявило масштабный сдвиг в цифровом ландшафте, обнаружив, что значительная часть нового веб-контента создается искусственным интеллектом. По мере того как большие языковые модели (LLM) интегрируются в процессы создания контента, граница между текстами, написанными человеком и машиной, стремительно стирается.

Всплеск контента, созданного ИИ

Чтобы количественно оценить влияние генеративного ИИ на интернет, Pew Research проанализировала почти 500 000 англоязычных веб-страниц, используя веб-архив Common Crawl. Применяя технологию обнаружения Open Pangram, исследование стремилось разграничить тексты, написанные человеком, и тексты, созданные с помощью ИИ.

Хотя случайная выборка из 10 000 страниц за июль 2026 года показала 10% авторства ИИ, этот показатель был искажен включением устаревшего контента, опубликованного до бума генеративного ИИ. Однако, когда исследователи отфильтровали набор данных, оставив только страницы, опубликованные после запуска ChatGPT в ноябре 2022 года, цифры резко возросли. Исследование показало, что более трети (35%) всех веб-страниц, опубликованных в эту недавнюю эпоху, имеют явные признаки того, что они были написаны или «существенно отредактированы» ИИ.

Различия в доменах и «петля ботов»

Распространение ИИ-контента в сети происходит неравномерно. Исследование выявило резкий контраст между различными доменами верхнего уровня (TLD), что позволяет предположить, что именно коммерческие интересы стимулируют наиболее агрессивное внедрение инструментов написания текстов на базе ИИ.

Согласно данным, в URL-адресах с доменом .com уровень авторства ИИ примерно в 10 раз выше, чем на академических или государственных сайтах. В частности, в доменах .edu и .gov уровень авторства ИИ составил всего 1%, в то время как в доменах .org он составил 4,6%. Эта тенденция указывает на коммерциализацию веба, где скорость и масштаб — часто достигаемые с помощью LLM — ставятся выше традиционного редакционного контроля.

Этот всплеск ИИ-контента происходит одновременно с тревожным событием, о котором сообщила компания Cloudflare: трафик ботов официально превысил трафик пользователей-людей. Это создает потенциальную петлю обратной связи «мертвого интернета», в которой боты все чаще просматривают и собирают данные (скрейпинг) с контента, который сам был написан другими ботами.

Лингвистические признаки и сложности обнаружения

Исследование также выявило специфические лингвистические паттерны, которые служат «признаками» текста, созданного ИИ. По мере того как LLM становятся все более совершенными, их стилистические отпечатки становятся более предсказуемыми. Исследователи отметили повышенную распространенность определенных синтаксических структур, таких как:

  • Широкое использование длинных тире (em dashes) и оксфордских запятых.
  • Ритмичные речевые паттерны типа «Это не X, а Y».
  • Специфические стилистические тенденции, оптимизированные для удобочитаемости, но лишенные человеческих нюансов.

Хотя в исследовании признается, что инструменты обнаружения ИИ, такие как Pangram, не являются безошибочными и могут давать ложноположительные результаты, масштаб данных позволяет предположить, что эти выводы отражают общую тенденцию. Для разработчиков и основателей это подчеркивает критическую проблему: по мере того как интернет насыщается синтетическими данными, поддерживать качество обучающих наборов для будущих моделей становится все труднее.

Основные выводы

  • Масштабный сдвиг в создании контента: 35% веб-страниц, опубликованных с момента запуска ChatGPT, имеют явные признаки авторства ИИ или глубокой ИИ-редактировки.
  • Коммерческое доминирование: Домены .com являются основными драйверами ИИ-контента, опережая домены .edu и .gov в 10 раз.
  • Экосистема ботов: Рост объема контента, написанного ИИ, совпадает с моментом, когда трафик ботов превысил трафик людей, что сигнализирует о переходе к веб-экосистеме, в которой доминируют машины.