Google ha cambiato le regole del gioco. Se la scorsa settimana hai scattato una foto con Google Lens, hai praticato una frase in spagnolo ad alta voce con Google Translate o hai chiesto a Maps di trovare un posto dove pranzare, quel contenuto potrebbe ora trovarsi in una coda per l'addestramento dei modelli di IA generativa dell'azienda. Google ha recentemente ristrutturato la sua architettura della privacy in modo che le immagini, i clip audio e i video caricati dagli utenti attraverso il suo ecosistema possano essere conservati e utilizzati per costruire sistemi di machine learning. Si tratta di un cambiamento deliberato: si passa dallo scraping di pagine web pubbliche al prelievo delle interazioni dirette e ad alta intenzione che le persone hanno ogni giorno con i prodotti Google.
Il silenzioso cambiamento della policy
Questo non è un aggiornamento di routine dei termini di servizio. Per anni, la strategia standard per l'addestramento di grandi modelli di IA consisteva nel navigare tra miliardi di pagine web pubbliche, raccogliendo testi, immagini e link che erano già visibili al mondo. Questo approccio ha dei limiti. Il web aperto è finito e, in molti domini, i dati pubblici più preziosi sono già stati estratti e inseriti nei sistemi esistenti. Concorrenti come Meta si sono recentemente spinti verso l'utilizzo di contenuti generati dagli utenti, e Google si sta ora muovendo nella stessa direzione.
L'aggiornamento è arrivato agli utenti tramite un'e-mail che introduceva due nuovi controlli sulla privacy: Search Services History e Personalized Recommendations. In superficie, sembrano strumenti di personalizzazione standard volti ad accelerare la prossima query o a perfezionare i suggerimenti. Tuttavia, leggendo le clausole scritte in piccolo, l'ambito diventa chiaro. Google afferma che i media salvati possono essere utilizzati per "sviluppare e migliorare i servizi e le tecnologie Google, inclusi i modelli di IA e le misure di sicurezza". La formulazione è generica, l'impostazione predefinita è attiva e per disattivarlo è necessario sapere dove cercare.
Cosa vuole realmente Google da te
L'ombrello della raccolta dati copre quasi ogni importante servizio Google che utilizzi. Quando un turista punta Google Lens verso un segnale stradale straniero o un menu di un ristorante, l'input visivo non svanisce semplicemente dopo la comparsa dei risultati. Quando uno studente usa Google Translate per praticare la conversazione ad alta voce, le registrazioni audio catturate durante quelle sessioni sono idonee alla conservazione. Le query vocali inviate tramite Search Live o la ricerca vocale standard rientrano nella stessa policy. Persino le interazioni di routine con Maps, Shopping, Flights, Hotels e News possono generare media che Google ora classifica come materiale di addestramento.
In precedenza, gli utenti attenti alla privacy potevano fare affidamento sull'interruttore Web & App Activity per limitare la quantità di dati di interazione che Google conservava. Quella strategia non funziona più. Google ha esplicitamente scisso queste nuove impostazioni dalla Web & App Activity. Search Services History è un controllo indipendente. È attivo per impostazione predefinita e qualunque scelta tu abbia fatto nella tua dashboard della privacy due o tre anni fa non impedirà che i tuoi media relativi alla ricerca vengano memorizzati per l'addestramento dell'IA. Il vecchio interruttore di disattivazione non controlla più questo circuito specifico.
Come disattivare effettivamente il servizio
Google fornisce un comando manuale, ma l'onere ricade interamente su di te. Non esiste un interruttore globale dell'account che disabiliti la raccolta di dati per l'addestramento dell'IA con un solo clic. Devi visitare due pagine specifiche all'interno della dashboard del tuo account Google: la pagina Search Services History e la pagina Search Services Personalization.
Una volta all'interno di Search Services History, scorri fino a trovare la casella di controllo "Save Media". Deselezionala. Questa singola azione è ciò che impedisce che future immagini, audio e video vengano memorizzati e potenzialmente inseriti nell'addestramento dei modelli. Non dare per scontato che la disattivazione di Web & App Activity risolva il problema per te. Non lo farà. La separazione è esplicita e facile da ignorare, il che significa che molti utenti crederanno di aver disattivato il servizio quando non è così.
Dopo aver disattivato il salvataggio dei media, configura le tue preferenze di eliminazione automatica mentre ti trovi ancora nella stessa dashboard. Google offre tre opzioni: elimina i dati dopo 3 mesi, 18 mesi o 36 mesi. Se desideri il controllo più stretto, scegli la finestra di tre mesi. È il ciclo di pulizia più breve consentito da Google tramite questo controllo, e limita l'accumulo delle tue interazioni storiche. Tieni presente che disattivare "Save Media" interrompe la raccolta futura. Qualsiasi cosa Google abbia già registrato con le impostazioni precedenti potrebbe rimanere memorizzata, a meno che tu non elimini manualmente la tua cronologia esistente tramite gli stessi strumenti dell'account.
Se gestisci un account familiare condiviso o un workspace in cui più persone interagiscono con i servizi Google, tutti coloro che hanno accesso dovrebbero controllare queste impostazioni individualmente. I controlli di personalizzazione sono legati all'account, non al dispositivo, e l'opt-in predefinito si applica a tutti.
Cosa ci dice questo sulla prossima fase dell'IA
Questo cambiamento di policy è un segnale chiaro di verso dove si sta muovendo il settore. Il web pubblico è stato ampiamente sfruttato per ottenere materiale di addestramento. La prossima frontiera per il miglioramento dei grandi modelli linguistici e dei sistemi multimodali è rappresentata dai dati proprietari generati da persone reali all'interno di piattaforme chiuse. Le tue ricerche visive contengono un contesto spaziale. Le tue sessioni di pratica di traduzione contengono schemi di pronuncia e intenzioni conversazionali. Le tue query vocali contengono tono, fraseggio e urgenza che il testo statico del web non può replicare.
Per sviluppatori, fondatori e chiunque stia osservando il panorama competitivo, l'implicazione è semplice. Il "fossato di dati" (data moat) che separa un grande modello linguistico dall'altro viene scavato sempre più a partire dalle interazioni private e dai caricamenti della base utenti di una piattaforma stessa. Le scansioni web open-source sono ancora utili, ma i dati di maggior valore sono ora quelli che crei mentre sei connesso a un servizio e cerchi attivamente di portare a termine qualcosa.
In sintesi
Il tuo vecchio manuale della privacy è superato. Il nuovo regime di dati di addestramento di Google richiede un opt-out specifico e deliberato all'interno della cronologia dei servizi di ricerca (Search Services History), deselezionando la casella "Salva contenuti multimediali" (Save Media). Tale azione, combinata con una finestra di eliminazione automatica ristretta, è l'unico modo affidabile per mantenere le tue immagini, audio e video caricati al di fuori della pipeline di addestramento dell'IA di Google. Diffondilo. L'impostazione predefinita non è più a tuo favore.