Google ha cambiado las reglas del juego. Si la semana pasada tomó una foto con Google Lens, practicó una frase en español en voz alta con Google Translate o le pidió a Maps que le indicara un lugar para almorzar, ese contenido podría estar ahora en una cola para entrenar los modelos de IA generativa de la compañía. Google ha reestructurado recientemente su arquitectura de privacidad para que las imágenes, los clips de audio y los videos que los usuarios suben a través de su ecosistema puedan conservarse y utilizarse para construir sistemas de aprendizaje automático. Se trata de un giro deliberado: pasar de la extracción de datos de páginas web públicas hacia la recolección de las interacciones directas y de alta intención que las personas tienen con los productos de Google cada día.
El silencioso cambio de política
Esto no es una actualización rutinaria de los términos de servicio. Durante años, el método habitual para entrenar grandes modelos de IA consistía en rastrear miles de millones de páginas web públicas, recopilando texto, imágenes y enlaces que ya eran visibles para el mundo. Ese enfoque tiene límites. La web abierta es finita y, en muchos dominios, los datos públicos más valiosos ya han sido extraídos e introducidos en los sistemas existentes. Competidores como Meta han presionado recientemente para aprovechar el contenido generado por los usuarios, y Google ahora se mueve en la misma dirección.
La actualización llegó a los usuarios a través de un correo electrónico de atención al cliente que presentaba dos nuevos controles de privacidad: Search Services History y Personalized Recommendations. A primera vista, parecen herramientas de personalización estándar destinadas a agilizar su próxima consulta o refinar sus recomendaciones. Sin embargo, si lee la letra pequeña, el alcance queda claro. Google afirma que los archivos multimedia guardados pueden utilizarse para "desarrollar y mejorar los servicios y tecnologías de Google, incluidos los modelos de IA y las medidas de seguridad". La redacción es amplia, la configuración predeterminada está activada y para desactivarla es necesario saber dónde buscar.
Lo que Google quiere de usted en realidad
El paraguas de recopilación de datos cubre casi todos los servicios principales de Google que utiliza. Cuando un turista apunta con Google Lens a un letrero callejero extranjero o a un menú de cena, la entrada visual no desaparece simplemente después de que aparecen los resultados. Cuando un estudiante usa Google Translate para practicar la pronunciación en voz alta, las grabaciones de audio capturadas durante esas sesiones son aptas para su conservación. Las consultas de voz enviadas a través de Search Live o la búsqueda de voz estándar entran en la misma política. Incluso las interacciones rutinarias con Maps, Shopping, Flights, Hotels y News pueden generar contenido multimedia que Google ahora clasifica como material de entrenamiento.
Anteriormente, los usuarios que se tomaban en serio la privacidad podían apoyarse en el interruptor de Web & App Activity para limitar la cantidad de datos de interacción que Google conservaba. Esa estrategia ya no funciona. Google ha desvinculado explícitamente estos nuevos ajustes de la Web & App Activity. Search Services History es un control independiente. Está activado de forma predeterminada, y cualquier elección que haya realizado en su panel de privacidad hace dos o tres años no evitará que sus archivos multimedia relacionados con las búsquedas se almacenen para el entrenamiento de la IA. El antiguo interruptor de apagado ya no controla este circuito en particular.
Cómo desactivarlo realmente
Google ofrece una anulación manual, pero la responsabilidad recae totalmente en usted. No existe un interruptor único para toda la cuenta que desactive la recopilación de datos de entrenamiento de IA con un solo clic. Debe visitar dos páginas específicas dentro del panel de control de su cuenta de Google: la página de Search Services History y la página de Search Services Personalization.
Una vez dentro de Search Services History, desplácese hasta encontrar la casilla de verificación "Save Media". Desmárquela. Esa única acción es la que evita que futuras imágenes, audios y videos se almacenen y se introduzcan potencialmente en el entrenamiento de modelos. No asuma que desactivar la Web & App Activity se encargará de esto por usted. No lo hará. La desvinculación es explícita y fácil de pasar por alto, lo que significa que muchos usuarios creerán que se han dado de baja cuando no es así.
Después de desactivar el guardado de archivos multimedia, configure sus preferencias de eliminación automática mientras aún se encuentra en el mismo panel. Google ofrece tres opciones: eliminar los datos después de 3 meses, 18 meses o 36 meses. Si desea el control más estricto, elija el intervalo de tres meses. Ese es el ciclo de limpieza más corto que Google permite a través de este control, y limita el historial acumulado de sus interacciones. Tenga en cuenta que desactivar "Save Media" detiene la recopilación futura. Cualquier dato que Google ya haya registrado bajo la configuración anterior puede permanecer en el almacenamiento a menos que elimine manualmente su historial existente a través de las mismas herramientas de la cuenta.
Si gestionas una cuenta familiar compartida o un espacio de trabajo donde varias personas interactúan con los servicios de Google, cada persona con acceso debe revisar estos ajustes individualmente. Los controles de personalización están vinculados a la cuenta, no al dispositivo, y la opción de participación predeterminada se aplica de forma generalizada.
Lo que esto nos dice sobre la próxima fase de la IA
Este cambio de política es una señal clara de hacia dónde se dirige la industria. La web pública ha sido explotada exhaustivamente para obtener material de entrenamiento. La próxima frontera para mejorar los modelos de lenguaje de gran tamaño y los sistemas multimodales son los datos propietarios generados por personas reales dentro de plataformas cerradas. Tus búsquedas visuales contienen contexto espacial. Tus sesiones de práctica de traducción contienen patrones de pronunciación e intención conversacional. Tus consultas de voz contienen tono, fraseo y urgencia que el texto web estático no puede replicar.
Para desarrolladores, fundadores y cualquier persona que observe el panorama competitivo, la implicación es directa. El "foso de datos" (data moat) que separa un modelo de lenguaje de gran tamaño de otro se está excavando cada vez más a partir de las interacciones privadas y las cargas de la propia base de usuarios de una plataforma. Los rastreos web de código abierto siguen siendo útiles, pero los datos de mayor valor son ahora aquellos que creas mientras estás conectado a un servicio e intentas realizar una tarea activamente.
En conclusión
Tu antiguo manual de privacidad ha quedado obsoleto. El nuevo régimen de datos de entrenamiento de Google requiere una exclusión voluntaria (opt-out) específica y deliberada dentro del Historial de Servicios de Búsqueda (Search Services History) al desmarcar la casilla "Guardar archivos multimedia" (Save Media). Esa acción, combinada con un intervalo de eliminación automática ajustado, es la única forma fiable de mantener tus imágenes, audios y vídeos subidos fuera del flujo de entrenamiento de la IA de Google. Pásalo. La configuración predeterminada ya no está a tu favor.