AI-onderzoekers hebben een gecoördineerde inspanning ontdekt door een netwerk van ongeveer 150 nieuwswebsites met weinig verkeer om de trainingsdata van grote taalmodellen (LLM's) te overspoelen met pro-Kremlin-narratieven. De sites, collectief bekend als het Pravda-netwerk, publiceren jaarlijks ongeveer drie miljoen artikelen, en hun inhoud verschijnt nu in de Common Crawl-dataset die de basis vormt voor veel commerciële AI-systemen.
Hoe de desinformatie-pijplijn werkt
Het Pravda-netwerk is niet gericht op het aantrekken van menselijke lezers. In plaats daarvan publiceert elke site repetitieve artikelen die een beperkt aantal standpunten herhalen. Door de tekst vol te proppen met trefwoorden die zoekmachines en webcrawlers prioriteit geven, vergroten de sites de kans dat een AI-model ze tegenkomt tijdens de gegevensverzameling.
Er zijn twee mechanismen van vergiftiging (poisoning) in het spel:
- Retrieval-time poisoning – Wanneer een AI-assistent live informatie van het web ophaalt, kan een Pravda-artikel verschijnen naast legitieme bronnen. Het blokkeren van bekende kwaadaardige domeinen kan deze blootstelling beperken.
- Training-time poisoning – Als de artikelen in de bulkcorpora terechtkomen die worden gebruikt voor het voortrainen van een model, worden de onjuiste beweringen onderdeel van de interne kennis van het model. Het achteraf verwijderen van dergelijke inhoud is veel moeilijker.
Onderzoekers hebben al Pravda-artikelen teruggevonden in Common Crawl, een openbaar archief dat wordt gebruikt om veel AI-modellen te trainen. Dat betekent dat de vergiftiging niet hypothetisch is; het heeft de kennisbasis van modellen die vandaag de dag door veel gebruikers worden gebruikt, al veranderd.
Waarom dit belangrijk is
Vertrouw AI niet alleen omdat het zegt: "veel bronnen zijn het erover eens." Als je AI-tools bouwt, gebruik dan blocklists voor bekende desinformatiewebsites. Gebruik "het aantal vermeldingen" niet als een manier om waarheid te meten. Kwantiteit is niet gelijk aan kwaliteit. Verifieer alles wat een AI je vertelt, vooral als het bevooroordeeld lijkt.
Het internet is de trainingsset voor onze toekomstige technologie. Iedereen met een website kan proberen de machines waarop we vertrouwen te beïnvloeden.
Wat ontwikkelaars nu kunnen doen
- Beheer blocklists – Voeg bekende desinformatiedomeinen toe aan crawling-filters; een blocklist voorkomt zowel blootstelling tijdens het ophalen (retrieval-time) als tijdens het trainen (training-time).
- Heroverweeg frequentie-heuristieken – Stop met het gelijkstellen van het aantal vermeldingen aan de waarachtigheid. Een bewering die tientallen keren wordt herhaald op websites van lage kwaliteit, kan in een naïef op frequentie gebaseerd model een enkele betrouwbare bron overstemmen.
- Pas herkomstcontroles toe – Herleid informatie naar de oorspronkelijke bron. Als de keten eindigt bij een site met verwaarloosbaar verkeer en een geschiedenis van propaganda, markeer de output dan voor controle.
- Implementeer sanitatie na de training – Voer gecureerde audits uit op modeloutputs die politiek gevoelige onderwerpen raken. Menselijke beoordelaars kunnen systematische vooroordelen opsporen die automatische filters missen.
Tegenargumenten en uitdagingen
Het vinden van een balans tussen veiligheid en inclusiviteit blijft een openstaand probleem.
Vooruitblik
Het Pravda-netwerk laat zien hoe statelijke actoren het open web kunnen inzetten als wapen om de volgende generatie AI vorm te geven.
Kernboodschap: De integriteit van AI hangt af van de zuiverheid van de data waaruit het leert. Een gecoördineerde vloedgolf van websites met weinig verkeer en vol propaganda kan al onwaarheden in de modellen verankeren die we vertrouwen. Ontwikkelaars moeten de reputatie van bronnen behandelen als een prioriteit, en niet als een bijzaak, om te voorkomen dat de machines die we bouwen onbewuste woordvoerders van desinformatie worden.
