Google đã thay đổi luật chơi. Nếu tuần trước bạn chụp một bức ảnh qua Google Lens, luyện tập một cụm từ tiếng Tây Ban Nha thành tiếng qua Google Translate, hoặc yêu cầu Maps tìm một địa điểm ăn trưa, thì nội dung đó hiện có thể đang nằm trong hàng đợi để huấn luyện các mô hình AI tạo sinh của công ty. Google gần đây đã tái cấu trúc kiến trúc quyền riêng tư của mình để các hình ảnh, đoạn âm thanh và video mà người dùng tải lên trong hệ sinh thái của họ có thể được lưu giữ và sử dụng để xây dựng các hệ thống học máy. Đây là một bước chuyển hướng có chủ đích, từ việc thu thập (scraping) các trang web công khai sang việc khai thác các tương tác trực tiếp và có mục đích cao mà mọi người thực hiện với các sản phẩm của Google mỗi ngày.

Sự thay đổi chính sách âm thầm

Đây không phải là một bản cập nhật điều khoản dịch vụ thông thường. Trong nhiều năm, kịch bản tiêu chuẩn để huấn luyện các mô hình AI lớn là thu thập dữ liệu hàng tỷ trang web công khai, tập hợp văn bản, hình ảnh và các liên kết vốn đã hiển thị công khai với thế giới. Cách tiếp cận đó có những giới hạn nhất định. Web mở là hữu hạn, và trong nhiều lĩnh vực, dữ liệu công khai giá trị nhất đã được trích xuất và đưa vào các hệ thống hiện có. Các đối thủ như Meta gần đây đã đẩy mạnh việc khai thác nội dung do người dùng tạo ra, và Google hiện cũng đang chuyển dịch theo hướng tương tự.

Bản cập nhật đã đến với người dùng thông qua một email gửi khách hàng, giới thiệu hai quyền kiểm soát quyền riêng tư mới: Search Services History (Lịch sử Dịch vụ Tìm kiếm) và Personalized Recommendations (Gợi ý Cá nhân hóa). Thoạt nhìn, chúng có vẻ giống như các công cụ cá nhân hóa tiêu chuẩn nhằm tăng tốc truy vấn tiếp theo hoặc tinh chỉnh các gợi ý của bạn. Tuy nhiên, nếu đọc kỹ các dòng chữ nhỏ, phạm vi của chúng sẽ trở nên rõ ràng. Google tuyên bố rằng các phương tiện đã lưu có thể được sử dụng để "phát triển và cải thiện các dịch vụ và công nghệ của Google, bao gồm các mô hình AI và các biện pháp an toàn." Cách dùng từ này rất rộng, cài đặt mặc định là bật, và việc từ chối (opting out) đòi hỏi bạn phải biết tìm ở đâu.

Những gì Google thực sự muốn từ bạn

Phạm vi thu thập dữ liệu bao trùm gần như mọi dịch vụ lớn của Google mà bạn chạm tới. Khi một khách du lịch hướng Google Lens vào một biển báo đường phố nước ngoài hoặc một thực đơn bữa tối, đầu vào hình ảnh không chỉ đơn giản là biến mất sau khi kết quả xuất hiện. Khi một học sinh sử dụng Google Translate để luyện nói thành tiếng, các bản ghi âm được thu lại trong các phiên đó đủ điều kiện để được lưu trữ. Các truy vấn bằng giọng nói gửi qua Search Live hoặc tìm kiếm bằng giọng nói tiêu chuẩn cũng nằm trong cùng một chính sách. Ngay cả các tương tác thông thường với Maps, Shopping, Flights, Hotels và News cũng có thể tạo ra các phương tiện mà Google hiện phân loại là tài liệu huấn luyện.

Trước đây, những người dùng coi trọng quyền riêng tư có thể dựa vào nút chuyển Web & App Activity để giới hạn lượng dữ liệu tương tác mà Google nắm giữ. Chiến lược đó không còn hiệu quả nữa. Google đã tách biệt rõ ràng các cài đặt mới này khỏi Web & App Activity. Search Services History là một trình điều khiển độc lập. Nó được bật theo mặc định, và bất kể những lựa chọn bạn đã thực hiện trong bảng điều khiển quyền riêng tư của mình hai hoặc ba năm trước, chúng cũng sẽ không ngăn được các phương tiện liên quan đến tìm kiếm của bạn bị lưu trữ để huấn luyện AI. Công tắc tắt cũ không còn kiểm soát mạch cụ thể này nữa.

Cách thực sự để từ chối

Google có cung cấp một tùy chọn ghi đè thủ công, nhưng gánh nặng hoàn toàn nằm ở bạn. Không có nút gạt áp dụng cho toàn bộ tài khoản để tắt việc thu thập dữ liệu huấn luyện AI chỉ bằng một cú nhấp chuột. Bạn cần truy cập vào hai trang cụ thể trong bảng điều khiển tài khoản Google của mình: trang Search Services History và trang Search Services Personalization.

Khi đã vào trong Search Services History, hãy cuộn cho đến khi bạn tìm thấy hộp kiểm "Save Media". Hãy bỏ chọn nó. Hành động duy nhất này sẽ ngăn chặn các hình ảnh, âm thanh và video trong tương lai bị lưu trữ và có khả năng được đưa vào huấn luyện mô hình. Đừng cho rằng việc tắt Web & App Activity sẽ xử lý việc này cho bạn. Nó sẽ không có tác dụng. Việc tách biệt này rất rõ ràng nhưng lại dễ bị bỏ qua, điều đó có nghĩa là nhiều người dùng sẽ tin rằng họ đã từ chối khi thực tế là chưa.

Sau khi bạn tắt tính năng lưu phương tiện, hãy cấu hình các tùy chọn tự động xóa khi bạn vẫn còn ở trong cùng một bảng điều khiển đó. Google cung cấp ba lựa chọn: xóa dữ liệu sau 3 tháng, 18 tháng hoặc 36 tháng. Nếu bạn muốn kiểm soát chặt chẽ nhất, hãy chọn khoảng thời gian ba tháng. Đó là chu kỳ dọn dẹp ngắn nhất mà Google cho phép thông qua trình điều khiển này, và nó giúp hạn chế lượng lớn các tương tác trong lịch sử của bạn. Hãy lưu ý rằng việc tắt Save Media chỉ ngăn chặn việc thu thập trong tương lai. Bất cứ thứ gì Google đã ghi lại theo các cài đặt trước đó có thể vẫn còn trong bộ lưu trữ trừ khi bạn xóa thủ công lịch sử hiện có của mình thông qua các công cụ tài khoản tương tự.

Nếu bạn quản lý một tài khoản gia đình dùng chung hoặc một không gian làm việc nơi nhiều người cùng tương tác với các dịch vụ của Google, mọi người có quyền truy cập nên kiểm tra các cài đặt này một cách riêng biệt. Các quyền kiểm soát cá nhân hóa được gắn liền với tài khoản chứ không phải thiết bị, và chế độ mặc định là đồng ý tham gia (opt-in) sẽ được áp dụng cho tất cả.

Điều này cho chúng ta biết gì về giai đoạn tiếp theo của AI

Sự thay đổi chính sách này là một tín hiệu rõ ràng về hướng đi của ngành công nghiệp. Web công cộng đã được khai thác triệt để để làm tài liệu đào tạo. Ranh giới tiếp theo để cải thiện các mô hình ngôn ngữ lớn và hệ thống đa phương thức (multimodal systems) chính là dữ liệu độc quyền được tạo ra bởi người dùng thật bên trong các nền tảng đóng. Các tìm kiếm hình ảnh của bạn chứa đựng bối cảnh không gian. Các buổi luyện tập dịch thuật của bạn chứa đựng các mẫu phát âm và ý định hội thoại. Các truy vấn bằng giọng nói của bạn chứa đựng tông giọng, cách diễn đạt và mức độ khẩn cấp mà văn bản web tĩnh không thể sao chép được.

Đối với các nhà phát triển, những người sáng lập và bất kỳ ai đang theo dõi bối cảnh cạnh tranh, hàm ý ở đây rất rõ ràng. "Hào ngăn cách dữ liệu" (data moat) giúp phân biệt mô hình ngôn ngữ lớn này với mô hình khác đang ngày càng được đào sâu từ các tương tác riêng tư và các tệp tải lên của chính người dùng trên nền tảng đó. Các dữ liệu thu thập từ web nguồn mở vẫn hữu ích, nhưng loại dữ liệu có giá trị cao nhất hiện nay là loại bạn tạo ra khi đang đăng nhập vào một dịch vụ và đang tích cực thực hiện một công việc nào đó.

Điểm mấu chốt

Các quy tắc bảo mật cũ của bạn đã lỗi thời. Chế độ dữ liệu đào tạo mới của Google yêu cầu bạn phải chủ động từ chối tham gia (opt-out) một cách cụ thể bên trong Search Services History bằng cách bỏ chọn ô Save Media. Hành động đó, kết hợp với việc thiết lập thời gian tự động xóa ngắn, là cách đáng tin cậy duy nhất để giữ cho hình ảnh, âm thanh và video bạn tải lên không nằm trong quy trình đào tạo AI của Google. Hãy chia sẻ thông tin này. Các thiết lập mặc định không còn đứng về phía bạn nữa.