Một thử nghiệm nhanh cho thấy các công cụ tìm kiếm AI có thể tỏ ra rất chắc chắn trong khi lại trích dẫn các nguồn lỗi thời hoặc chất lượng thấp

Một bước kiểm tra nguồn gốc đơn giản trên ba công cụ tìm kiếm hỗ trợ AI phổ biến đã tiết lộ rằng hai trong số chúng hoặc là dẫn đến các liên kết bị hỏng, hoặc là củng cố câu trả lời bằng các trang web có độ tin cậy thấp, mặc dù cả ba đều hiển thị văn phong tự tin như nhau cùng một hàng các "chip" nguồn.

Thử nghiệm gây bất ngờ

Tôi đã đặt một câu hỏi thực tế và gần đây: “Điều gì đã thay đổi trong Đạo luật AI của EU vào năm 2026?” Câu trả lời nằm trong văn bản sửa đổi chính thức, vì vậy nó hoặc là có ở đó, hoặc là không. Tôi đã đưa câu hỏi này vào ba công cụ tìm kiếm AI có hiển thị trích dẫn: Perplexity, chế độ AI của Google và Brave Search.

Cả ba đều trả về các sự thật giống hệt nhau—cùng ngày tháng, cùng mô tả—vì vậy họ hòa nhau về độ chính xác thuần túy. Sự khác biệt chỉ xuất hiện khi tôi kiểm tra các nguồn được trích dẫn.

Cách tôi đánh giá chất lượng nguồn

Tôi đã tạo ra một hệ thống chấm điểm ba cấp độ, trong đó trọng số của mỗi trích dẫn được tính theo loại máy chủ lưu trữ:

  • Sơ cấp (trọng số 3) – trang web thực sự công bố luật (ví dụ: sổ đăng ký chính thức của EU).
  • Chính thức (trọng số 2) – tổ chức ban hành hoặc giám sát luật (các tên miền chính phủ, trang web của cơ quan).
  • Nội dung do người dùng tạo (UGC, trọng số 0) – các nền tảng như YouTube hoặc Reddit.

Điểm tổng thể của mỗi công cụ là trọng số trung bình của các URL mà nó hiển thị.

Công cụ Nguồn được báo cáo Điểm
Perplexity Các tên miền chính phủ chính thức 2.00
Google AI mode Các công ty tư vấn và một video YouTube 1.00
Brave Search Nguồn sơ cấp 3.00

Trên lý thuyết, Brave trông có vẻ hoàn hảo, Perplexity ở mức khá, còn Google thì tụt lại phía sau.

Thất bại tiềm ẩn: các liên kết bị hỏng

Bản đồ phân cấp chỉ xem xét tên miền; nó không xác minh xem trang được liên kết có thực sự tải được hay không. Tôi đã kiểm tra mọi URL. Trích dẫn "sơ cấp" của Brave trả về một nội dung trống—liên kết đã bị hỏng. Công cụ này tuyên bố dẫn đến luật nhưng không cung cấp được gì.

Perplexity đã sử dụng các tên miền chính phủ chính thức.

Google đã sử dụng các công ty tư vấn và một video YouTube.

Hai vấn đề riêng biệt đã nảy sinh:

  1. Một tên miền chất lượng cao không đảm bảo trang web đó có thể truy cập được.
  2. Một bản tóm tắt được soạn thảo tốt có thể được củng cố bởi các nguồn có độ tin cậy thấp.

Giao diện người dùng đã che giấu cả hai vấn đề này. Cả ba công cụ đều trình bày cùng một đoạn văn tự tin và một hàng các chip nguồn đồng nhất, mà không có bất kỳ dấu hiệu trực quan nào cho thấy một chip dẫn đến một trang lỗi hoặc một chip khác dẫn đến một video hướng dẫn trên YouTube thay vì văn bản luật.

Tại sao nguồn gốc lại quan trọng đối với các nhà phát triển

Các nhà phát triển có thể biến nguồn gốc thành một chỉ số có thể kiểm chứng:

  • Chấm điểm mọi câu trả lời bằng cách sử dụng trọng số phân cấp tương tự như trên.
  • Xác thực tình trạng liên kết một cách tự động; gắn cờ các phản hồi trống hoặc lỗi HTTP.
  • Kích hoạt cảnh báo khi điểm nguồn gốc của một câu trả lời xuống dưới ngưỡng có thể cấu hình.

Cách tiếp cận này cụ thể hơn việc chạy theo các "ảo giác" (hallucinations) – mô hình có thể tạo ra một câu văn nghe có vẻ hợp lý, nhưng việc kiểm tra nguồn gốc sẽ cho bạn biết chính xác trích dẫn nào (hoặc việc thiếu trích dẫn) đã gây ra vấn đề, cho phép thực hiện các biện pháp khắc phục có mục tiêu.

Bài học rút ra

Một thử nghiệm nguồn gốc ngắn gọn cho thấy các công cụ tìm kiếm AI có thể tỏ ra có thẩm quyền trong khi lại trích dẫn các nguồn lỗi thời hoặc chất lượng thấp. Các nhà phát triển dựa vào các công cụ này nên coi chất lượng trích dẫn là một thuộc tính có thể đo lường được, chứ không phải là một sự đảm bảo mặc định, và cần xây dựng các bước kiểm tra tự động vào quy trình (pipeline) của họ. Việc xác minh rằng một nguồn "sơ cấp" thực sự tải được có thể là sự khác biệt giữa một câu trả lời đáng tin cậy và một cái bẫy thông tin sai lệch thầm lặng.