Một lỗ hổng quyền riêng tư đã xuất hiện với Claude của Anthropic: các cuộc hội thoại riêng tư và "Artifacts" đã trở nên có thể tìm kiếm được trên Google. Sự cố này đặt việc chia sẻ do người dùng thực hiện đối đầu với việc lập chỉ mục web trong kỷ nguyên AI.
Cơ chế của sự rò rỉ
Người dùng Reddit đã phát hiện ra vụ vi phạm bằng cách sử dụng các toán tử Google như site:claude.ai/share, điều này đã lách qua tính bảo mật dự kiến của tính năng "share chat". Claude cảnh báo rằng "bất kỳ ai có liên kết đều có thể xem", nhưng tính năng này được thiết kế để chia sẻ có mục tiêu, chứ không phải để hiển thị công khai toàn cầu.
Không giống như Google Docs, vốn mặc định chặn các trình thu thập dữ liệu (crawlers), các URL được chia sẻ của Claude đã bị Google lập chỉ mục, cho phép bất kỳ ai cũng có thể tình cờ tìm thấy thông tin nhạy cảm thông qua các tìm kiếm thông thường.
Dữ liệu nhạy cảm và nội dung gặp rủi ro
Các hãng tin như Futurism và TechCrunch đã báo cáo rằng các kết quả được lập chỉ mục bao gồm:
- Thông tin nhận dạng cá nhân (PII): tên và số điện thoại của trẻ em ở độ tuổi tiểu học.
- Hồ sơ y tế: kết quả thử nghiệm lâm sàng chi tiết và báo cáo thực tế của bệnh nhân.
- Thông tin tình báo doanh nghiệp: các tài liệu được đánh dấu "chỉ sử dụng nội bộ" và các đánh giá hiệu suất của nhân viên.
- Tài sản kỹ thuật: các đoạn mã (code snippets) và ghi chú công việc từ tính năng "Artifacts" của Claude.
Một số cuộc trò chuyện bị lộ cũng lọt qua các bộ lọc an toàn của Anthropic, hiển thị nội dung khiêu dâm và làm dấy lên thêm những lo ngại về kiểm duyệt.
Phản hồi từ Anthropic và Google
Anthropic đã bảo vệ kiến trúc của mình, nói rằng họ không chia sẻ danh mục trò chuyện hoặc sơ đồ trang web (sitemaps) với các công cụ tìm kiếm. Người phát ngôn Amie Rotherham giải thích rằng các liên kết chia sẻ chỉ xuất hiện trong kết quả tìm kiếm sau khi người dùng đăng chúng trên các nền tảng bên ngoài có thể thu thập dữ liệu, và các URL này "không thể đoán trước được". Một khi liên kết đã "lọt ra ngoài", nó có thể bị lưu trữ bởi bên thứ ba.
Người phát ngôn của Google, Ned Adriance, cũng đồng tình rằng các công cụ tìm kiếm sẽ lập chỉ mục bất cứ thứ gì chúng có thể tìm thấy trừ khi chủ sở hữu trang web chặn việc thu thập dữ liệu một cách rõ ràng. Các thử nghiệm cho thấy sự cố rò rỉ đã được loại bỏ khỏi chỉ mục của Google, nhưng một sự cố tương tự vào năm ngoái cũng đã lập chỉ mục hàng trăm cuộc trò chuyện của Claude.
Tại sao điều này lại quan trọng đối với người dùng AI
Các nhà phát triển và người sáng lập đang tích hợp các LLM phải coi "các liên kết được chia sẻ" là công khai, không phải là bảo mật. Khi các công cụ AI chuyển dịch từ trợ lý cá nhân sang cộng tác viên doanh nghiệp, ranh giới giữa nội dung web công khai và dữ liệu riêng tư cần được thực thi bằng kỹ thuật, chứ không chỉ là một cảnh báo bằng tooltip.
Những điểm chính cần lưu ý
- Kiểm tra cài đặt của bạn: Truy cập vào Settings → Privacy → Shared Chats trong Claude và thu hồi bất kỳ liên kết công khai nào đang hoạt động.
- Coi các liên kết chia sẻ là công khai: Giả định rằng bất kỳ liên kết nào do AI tạo ra đều có thể bị các công cụ tìm kiếm lập chỉ mục.
- Thận trọng trong doanh nghiệp: Thực thi các chính sách nghiêm ngặt xung quanh các tính năng "chia sẻ" để ngăn chặn việc rò rỉ vô ý các mã nguồn độc quyền hoặc PII nhạy cảm.
Nền tảng Claude AI của Anthropic đã vô tình làm lộ các cuộc trò chuyện riêng tư và “Artifacts” sau khi Google lập chỉ mục các URL liên kết chia sẻ, khiến các cuộc hội thoại nhạy cảm có thể tìm kiếm được. Người dùng Reddit đã phát hiện ra vụ rò rỉ bằng một truy vấn Google dành riêng cho trang web, làm lộ dữ liệu cá nhân, y tế và doanh nghiệp.
Sự cố rò rỉ đã xảy ra như thế nào
Tính năng "share chat" của Claude tạo ra một URL mà giao diện cảnh báo rằng bất kỳ ai có nó đều có thể xem được. Mục đích là để gửi liên kết cho một đồng nghiệp, chứ không phải để phát sóng rộng rãi. Vì các URL nằm dưới tên miền claude.ai/share, việc đăng liên kết lên bất kỳ trang web công khai nào có thể thu thập dữ liệu—như diễn đàn, mạng xã hội hoặc một bình luận trên Reddit—sẽ cho phép trình thu thập dữ liệu của Google theo dấu nó.
Người dùng Reddit đã phát hiện ra vấn đề bằng cách tìm kiếm site:claude.ai/share trên Google, kết quả trả về các cuộc hội thoại vốn dĩ phải được giữ riêng tư. Không giống như Google Docs, nơi các liên kết được chia sẻ được bảo vệ khỏi việc lập chỉ mục theo mặc định, các liên kết của Claude thiếu cơ chế bảo vệ đó, cho phép công cụ tìm kiếm lập danh mục chúng.
Những gì đã bị lộ
Nhiều hãng tin đã báo cáo rằng các kết quả được lập chỉ mục bao gồm:
- Thông tin nhận dạng cá nhân (PII): tên và số điện thoại của trẻ em ở độ tuổi tiểu học.
- Hồ sơ y tế: dữ liệu thử nghiệm lâm sàng chi tiết và báo cáo thực tế của bệnh nhân.
- Thông tin tình báo doanh nghiệp: các tài liệu được đánh dấu "chỉ sử dụng nội bộ", các đánh giá hiệu suất của nhân viên và các thông tin độc quyền khác.
- Tài sản kỹ thuật: các đoạn mã, ghi chú công việc và các artifact khác được tạo ra trong tính năng "Artifacts" của Claude.
Trong một vài trường hợp, các cuộc trò chuyện hiển thị công khai cũng bao gồm nội dung lọt qua các bộ lọc an toàn của Anthropic, tạo ra các tài liệu khiêu dâm.
Phản hồi của Anthropic
Anthropic khẳng định rằng họ không công bố danh mục trò chuyện hay sơ đồ trang web (sitemaps) cho các công cụ tìm kiếm. Một người phát ngôn của công ty giải thích rằng các liên kết được chia sẻ chỉ xuất hiện trong kết quả tìm kiếm sau khi người dùng đăng URL đó lên một nền tảng bên ngoài có thể thu thập dữ liệu (crawlable), đồng thời nhấn mạnh rằng các URL này "không thể đoán trước được". Một khi liên kết đã được chủ động chia sẻ trực tuyến, công ty không thể kiểm soát việc lưu trữ của bên thứ ba.
Quan điểm của Google
Google nhắc lại rằng họ không quyết định nội dung nào là công khai; họ lập chỉ mục (index) những gì họ có thể tìm thấy trừ khi một trang web chặn việc thu thập dữ liệu một cách rõ ràng. Công ty cho biết họ tôn trọng các chỉ thị như robots.txt hoặc các thẻ meta yêu cầu loại trừ. Các thử nghiệm sơ bộ sau sự cố cho thấy các URL bị lộ đã được xóa khỏi chỉ mục của Google, mặc dù Google không xác nhận một giải pháp khắc phục vĩnh viễn.
Tại sao điều này lại quan trọng đối với người dùng AI
Sự cố này làm nổi bật một rủi ro rộng lớn hơn khi các mô hình ngôn ngữ lớn chuyển dịch từ vai trò trợ lý cá nhân sang các quy trình làm việc của doanh nghiệp. Một "liên kết có thể chia sẻ" là một cơ chế tiện lợi mà bất kỳ trình thu thập dữ liệu (crawler) nào cũng có thể thu hoạch được. Đối với các tổ chức xử lý dữ liệu được quản lý—như hồ sơ sức khỏe, đánh giá nhân viên, mã nguồn độc quyền—giả định rằng một liên kết là an toàn vì nó "chỉ được chia sẻ" có thể dẫn đến những vụ rò rỉ tốn kém.
Đối luận: Giới hạn của nền tảng
Anthropic lập luận rằng trách nhiệm thuộc về những người dùng đăng tải liên kết. Nền tảng này cảnh báo rằng bất kỳ ai có URL đều có thể xem nội dung và họ không công khai các URL trong một danh mục công cộng. Google phản bác rằng họ không thể kiểm soát mọi liên kết riêng tư xuất hiện; vai trò của họ là tôn trọng yêu cầu của chủ sở hữu trang web về việc không xuất hiện trong kết quả tìm kiếm.
Cả hai quan điểm đều chính xác về mặt kỹ thuật, nhưng chúng để lại một lỗ hổng: trải nghiệm người dùng không làm cho rủi ro lập chỉ mục trở nên rõ ràng, và nền tảng cũng không tự động áp dụng các chỉ thị "no-index" cho các trang được chia sẻ. Do đó, gánh nặng ngăn chặn việc vô tình bị lộ công khai đè nặng lên người dùng, những người có thể không nhận ra một liên kết có thể bị phát hiện dễ dàng như thế nào thông qua một truy vấn tìm kiếm đơn giản.
Những điều cần theo dõi tiếp theo
Các bước thực hành cho người dùng
- Kiểm tra các liên kết đang hoạt động: Mở cài đặt của Claude, đi tới phần quyền riêng tư cho các cuộc trò chuyện được chia sẻ, và thu hồi bất kỳ URL nào bạn không còn cần nữa.
- Coi mọi liên kết chia sẻ là công khai: Hãy giả định rằng một khi liên kết đã được đăng ở bất kỳ đâu trên mạng, nó có thể bị lập chỉ mục trừ khi được chặn một cách rõ ràng.
- Kiểm soát doanh nghiệp: Triển khai các công cụ giám sát để gắn cờ việc tạo các liên kết chia sẻ có chứa các từ khóa như "PII," "confidential," hoặc "internal," và thực thi các quy trình phê duyệt trước khi các liên kết đó rời khỏi mạng lưới công ty.
Sự cố Claude nhắc nhở chúng ta rằng sự tiện lợi của việc chia sẻ tức thì có thể trở thành một rủi ro khi web coi các liên kết đó là những trang web thông thường. Cho đến khi các nền tảng tự động bảo vệ các URL được chia sẻ, người dùng phải luôn cảnh giác.
