Một phần ba nội dung web sau thời kỳ ChatGPT cho thấy dấu hiệu do AI viết
Một nghiên cứu đột phá của Pew Research đã tiết lộ một sự chuyển dịch khổng lồ trong bối cảnh kỹ thuật số, cho thấy một phần đáng kể nội dung web mới đang được tạo ra bởi trí tuệ nhân tạo. Khi các Mô hình Ngôn ngữ Lớn (LLMs) được tích hợp vào quy trình sản xuất nội dung, ranh giới giữa văn bản do con người và máy tính tạo ra đang dần trở nên mờ nhạt.
Sự bùng nổ của nội dung do AI tạo ra
Để định lượng tác động của AI tạo sinh đối với internet, Pew Research đã phân tích gần 500.000 trang web tiếng Anh bằng cách sử dụng kho lưu trữ web Common Crawl. Bằng cách sử dụng công nghệ phát hiện của Open Pangram, nghiên cứu nhằm phân biệt giữa văn bản do con người viết và văn bản có sự hỗ trợ của AI.
Mặc dù một mẫu ngẫu nhiên gồm 10.000 trang từ tháng 7 năm 2026 cho thấy tỷ lệ AI viết là 10%, con số này đã bị sai lệch do bao gồm cả các nội dung cũ được xuất bản trước sự bùng nổ của AI tạo sinh. Tuy nhiên, khi các nhà nghiên cứu lọc tập dữ liệu để chỉ bao gồm các trang được xuất bản sau khi ChatGPT ra mắt vào tháng 11 năm 2022, các con số đã tăng vọt. Nghiên cứu cho thấy hơn một phần ba (35%) tất cả các trang web được xuất bản trong kỷ nguyên gần đây này cho thấy các dấu hiệu đáng kể là được viết hoặc "chỉnh sửa đáng kể" bởi AI.
Sự chênh lệch giữa các tên miền và "Vòng lặp Bot"
Sự phổ biến của nội dung AI không đồng đều trên toàn web. Nghiên cứu đã làm nổi bật sự tương phản rõ rệt giữa các tên miền cấp cao (TLDs) khác nhau, cho thấy các lợi ích thương mại đang thúc đẩy việc áp dụng các công cụ viết bằng AI một cách quyết liệt nhất.
Theo dữ liệu, các URL có tên miền .com có tỷ lệ AI viết cao hơn khoảng 10 lần so với các trang web học thuật hoặc chính phủ. Cụ thể, các tên miền .edu và .gov chỉ cho thấy tỷ lệ AI viết là 1%, trong khi các tên miền .org ở mức 4,6%. Xu hướng này hướng tới một mạng web thương mại hóa, nơi tốc độ và quy mô—thường đạt được thông qua LLMs—được ưu tiên hơn sự giám sát biên tập truyền thống.
Sự gia tăng nội dung AI này diễn ra cùng với một cột mốc đáng lo ngại được báo cáo bởi Cloudflare: lưu lượng truy cập của bot đã chính thức vượt qua lưu lượng truy cập của con người. Điều này tạo ra một vòng lặp phản hồi "internet chết" (dead internet) tiềm ẩn, nơi các bot ngày càng tăng cường duyệt và thu thập dữ liệu (scraping) các nội dung vốn dĩ cũng được viết bởi các bot khác.
Các dấu hiệu ngôn ngữ và thách thức trong việc phát hiện
Nghiên cứu cũng xác định các mẫu ngôn ngữ cụ thể đóng vai trò là "dấu hiệu nhận biết" cho văn bản do AI tạo ra. Khi các LLM trở nên tinh vi hơn, các dấu ấn phong cách của chúng cũng trở nên dễ đoán hơn. Các nhà nghiên cứu lưu ý sự phổ biến ngày càng tăng của các cấu trúc cú pháp cụ thể, chẳng hạn như:
- Sử dụng rộng rãi dấu gạch ngang dài (em dashes) và dấu phẩy Oxford.
- Các mẫu cụm từ có nhịp điệu như "Không phải X, mà là Y."
- Các xu hướng phong cách cụ thể được tối ưu hóa cho khả năng đọc nhưng thiếu đi sắc thái của con người.
Mặc dù nghiên cứu thừa nhận rằng các công cụ phát hiện AI như Pangram không phải là không thể sai lầm và có thể gặp phải các trường hợp dương tính giả, nhưng quy mô của dữ liệu cho thấy những phát hiện này là chính xác về mặt xu hướng. Đối với các nhà phát triển và người sáng lập, điều này làm nổi bật một thách thức quan trọng: khi web trở nên bão hòa với dữ liệu tổng hợp, việc duy trì chất lượng của các tập dữ liệu huấn luyện cho các mô hình tương lai sẽ ngày càng trở nên khó khăn.
Các điểm chính cần lưu ý
- Sự chuyển dịch khổng lồ trong việc tạo nội dung: 35% các trang web được xuất bản kể từ khi ChatGPT ra mắt cho thấy các dấu hiệu rõ ràng về việc do AI viết hoặc được chỉnh sửa mạnh mẽ bởi AI.
- Sự thống trị của thương mại: Các tên miền .com là động lực chính của nội dung AI, vượt xa các tên miền .edu và .gov với tỷ lệ gấp 10 lần.
- Hệ sinh thái Bot: Sự gia tăng nội dung do AI viết trùng khớp với việc lưu lượng truy cập của bot vượt qua lưu lượng của con người, báo hiệu một sự chuyển dịch hướng tới một hệ sinh thái web do máy móc thống trị.
