I ricercatori di IA hanno scoperto un coordinato sforzo da parte di una rete di circa 150 siti di notizie a basso traffico per inondare i dati di addestramento dei modelli linguistici di grandi dimensioni (LLM) con narrazioni pro-Cremlino. I siti, collettivamente noti come rete Pravda, pubblicano circa tre milioni di articoli all'anno e i loro contenuti appaiono ora nel dataset Common Crawl che alimenta molti sistemi di IA commerciali.

Come funziona la pipeline della disinformazione

La rete Pravda non mira ad attirare lettori umani. Invece, ogni sito pubblica articoli ripetitivi che ripropongono un ristretto set di argomenti. Riempendo il testo di parole chiave che i motori di ricerca e i crawler web privilegiano, i siti aumentano la probabilità che un modello di IA li incontri durante la raccolta dei dati.

Due meccanismi di avvelenamento sono in gioco:

  • Avvelenamento in fase di recupero (Retrieval-time poisoning) – Quando un assistente IA recupera informazioni in tempo reale dal web, può far emergere un articolo di Pravda insieme a fonti legittime. Bloccare i domini malevoli noti può limitare questa esposizione.
  • Avvelenamento in fase di addestramento (Training-time poisoning) – Se gli articoli scivolano nei corpora massivi utilizzati per il pre-addestramento di un modello, le false affermazioni diventano parte della conoscenza interna del modello. Rimuovere tali contenuti in un secondo momento è molto più difficile.

I ricercatori hanno già tracciato articoli di Pravda all'interno di Common Crawl, un archivio pubblico utilizzato per addestrare molti modelli di IA. Ciò significa che l'avvelenamento non è ipotetico; ha già alterato la base di conoscenza di modelli su cui molti utenti fanno affidamento oggi.

Perché è importante

Non fidarti dell'IA solo perché dice "molte fonti concordano". Se sviluppi strumenti di IA, utilizza liste di blocco per i siti di disinformazione noti. Non usare il "numero di menzioni" come modo per misurare la verità. La quantità non equivale alla qualità. Verifica tutto ciò che l'IA ti dice, specialmente se sembra parziale.

Internet è il set di addestramento per la nostra tecnologia futura. Chiunque possieda un sito web può cercare di influenzare i pregiudizi delle macchine su cui facciamo affidamento.

Cosa possono fare gli sviluppatori ora

  • Mantenere liste di blocco (blocklists) – Aggiungi i domini di disinformazione noti ai filtri di crawling; una blocklist interrompe sia l'esposizione in fase di recupero che quella in fase di addestramento.
  • Ripensare le euristiche di frequenza – Smetti di equiparare il numero di menzioni alla veridicità. Un'affermazione ripetuta in decine di siti di bassa qualità può prevalere su una singola fonte autorevole in un modello ingenuo basato sulla frequenza.
  • Applicare controlli di provenienza – Traccia le informazioni fino alla loro fonte originale. Se la catena termina in un sito con traffico trascurabile e una storia di propaganda, segnala l'output per una revisione.
  • Implementare la sanificazione post-addestramento – Esegui audit mirati sugli output del modello che trattano argomenti politicamente sensibili. I revisori umani possono individuare pregiudizi sistematici che i filtri automatizzati non colgono.

Controargomentazioni e sfide

Bilanciare sicurezza e inclusività rimane un problema aperto.

Guardando al futuro

La rete Pravda mostra come gli attori statali possano trasformare il web aperto in un'arma per plasmare la prossima generazione di IA.

In sintesi: L'integrità dell'IA dipende dalla pulizia dei dati da cui apprende. Un'inondazione coordinata di siti a basso traffico e carichi di propaganda può già inserire falsità nei modelli di cui ci fidiamo. Gli sviluppatori devono trattare la reputazione delle fonti come una priorità assoluta, e non come un pensiero secondario, per evitare che le macchine che costruiamo diventino involontari portavoce della disinformazione.