ChatGPT登場後のウェブコンテンツの3分の1にAI執筆の兆候
Pew Researchによる画期的な調査により、デジタル環境における大規模な変化が明らかになった。新しいウェブコンテンツの大部分が人工知能(AI)によって生成されていることが判明したのである。大規模言語モデル(LLM)がコンテンツ制作のワークフローに組み込まれるにつれ、人間が書いたテキストとマシンが生成したテキストの境界は急速に曖昧になっている。
AI生成コンテンツの急増
生成AIがインターネットに与える影響を定量化するため、Pew ResearchはCommon Crawlのウェブアーカイブを使用して、約50万件の英語のウェブページを分析した。Open Pangramの検出技術を用いることで、この調査は人間が執筆したテキストとAIが支援したテキストを区別しようと試みた。
2026年7月の1万ページのランダムサンプルではAI執筆率は10%であったが、この数値は生成AIブーム以前に公開された既存のコンテンツが含まれていたために偏っていた。しかし、研究者がデータセットをフィルタリングし、2022年11月のChatGPTリリース後に公開されたページのみに絞り込んだところ、数値は急増した。この調査によると、近年の時代に公開されたすべてのウェブページのうち、3分の1以上(35%)がAIによって書かれた、あるいは「大幅に編集された」という顕著な兆候を示していることがわかった。
ドメイン間の格差と「ボット・ループ」
AIコンテンツの拡散は、ウェブ全体で一様ではない。調査では、異なるトップレベルドメイン(TLD)間で顕著な対照が見られることが強調されており、商業的利益がAIライティングツールの最も積極的な導入を後押ししていることが示唆されている。
データによると、.comドメインのURLにおけるAI執筆率は、学術機関や政府機関のサイトよりも約10倍高い。具体的には、.eduおよび.govドメインのAI執筆率はわずか1%であったのに対し、.orgドメインは4.6%であった。この傾向は、従来の編集による監督よりも、LLMを通じて達成されることが多い「スピード」と「規模」が優先される、商業化されたウェブの姿を指し示している。
このAIコンテンツの急増は、Cloudflareが報告した懸念すべき節目、すなわち「ボットのトラフィックが公式に人間のウェブトラフィックを追い抜いた」という事象と同時に起きている。これにより、ボットが他のボットによって書かれたコンテンツを閲覧し、スクレイピングするという、潜在的な「デッド・インターネット(死んだインターネット)」のフィードバック・ループが生じている。
言語的な特徴と検出の課題
また、調査ではAI生成テキストの「特徴(tells)」となる特定の言語パターンも特定された。LLMが高度化するにつれ、その文体的な指紋はより予測可能なものとなっている。研究者は、以下のような特定の構文構造の普及が進んでいることを指摘した。
- エムダッシュ(—)やオックスフォード・コンマの多用。
- 「それはXではなく、Yである」といったリズム感のある言い回し。
- 可読性は最適化されているが、人間らしいニュアンスに欠ける特定の文体的傾向。
調査では、PangramのようなAI検出ツールは万能ではなく、誤検知(false positives)が発生する可能性があることも認めているが、データの規模から、これらの知見は方向性として正確であることを示唆している。開発者や創業者にとって、これは重大な課題を浮き彫りにしている。ウェブが合成データで飽和するにつれ、将来のモデルに向けた学習セットの品質を維持することがますます困難になるからだ。
主な要点
- コンテンツ制作における大規模な変化: ChatGPTのリリース以降に公開されたウェブページの35%に、AIによる執筆または大規模なAI編集の明確な兆候が見られる。
- 商業的優位性: .comドメインがAIコンテンツの主な推進力となっており、.eduおよび.govドメインを10倍の差で上回っている。
- ボットのエコシステム: AIが書いたコンテンツの増加は、ボットのトラフィックが人間のトラフィックを追い抜いたことと時期が重なっており、機械が支配するウェブ・エコシステムへの移行を示唆している。
