Investigadores de IA han descubierto un esfuerzo coordinado por parte de una red de unos 150 sitios de noticias de bajo tráfico para inundar los datos de entrenamiento de los modelos de lenguaje extensos (LLM) con narrativas pro-Kremlin. Los sitios, conocidos colectivamente como la red Pravda, publican aproximadamente tres millones de artículos al año, y su contenido aparece ahora en el conjunto de datos Common Crawl que alimenta muchos sistemas de IA comerciales.

Cómo funciona el flujo de desinformación

La red Pravda no tiene como objetivo atraer lectores humanos. En su lugar, cada sitio publica artículos repetitivos que reiteran un conjunto limitado de puntos de discusión. Al saturar el texto con palabras clave que los motores de búsqueda y los rastreadores web priorizan, los sitios aumentan la probabilidad de que un modelo de IA los encuentre durante la recopilación de datos.

Hay dos mecanismos de envenenamiento en juego:

  • Envenenamiento en tiempo de recuperación – Cuando un asistente de IA extrae información en vivo de la web, puede mostrar un artículo de Pravda junto a fuentes legítimas. Bloquear los dominios maliciosos conocidos puede frenar esta exposición.
  • Envenenamiento en tiempo de entrenamiento – Si los artículos se filtran en los corpus masivos utilizados para preentrenar un modelo, las afirmaciones falsas pasan a formar parte del conocimiento interno del modelo. Eliminar dicho contenido después del hecho es mucho más difícil.

Los investigadores ya han rastreado artículos de Pravda dentro de Common Crawl, un archivo público utilizado para entrenar muchos modelos de IA. Eso significa que el envenenamiento no es hipotético; ya ha alterado la base de conocimientos de modelos en los que muchos usuarios confían hoy en día.

Por qué es importante

No confíes en la IA solo porque diga "muchas fuentes coinciden". Si construyes herramientas de IA, utiliza listas de bloqueo para sitios de desinformación conocidos. No utilices el "número de menciones" como una forma de medir la verdad. La cantidad no equivale a la calidad. Verifica todo lo que la IA te diga, especialmente si parece sesgada.

Internet es el conjunto de entrenamiento para nuestra tecnología futura. Cualquier persona con un sitio web puede intentar sesgar las máquinas en las que confiamos.

Qué pueden hacer los desarrolladores ahora

  • Mantener listas de bloqueo – Añade dominios de desinformación conocidos a los filtros de rastreo; una lista de bloqueo detiene tanto la exposición en el tiempo de recuperación como en el de entrenamiento.
  • Replanteamiento de las heurísticas de frecuencia – Deja de equiparar el número de menciones con la veracidad. Una afirmación repetida en docenas de sitios de baja calidad puede superar en votos a una única fuente de prestigio en un modelo ingenuo basado en la frecuencia.
  • Aplicar comprobaciones de procedencia – Rastrea la información hasta su fuente original. Si la cadena termina en un sitio con tráfico insignificante y un historial de propaganda, marca el resultado para su revisión.
  • Implementar la sanitización post-entrenamiento – Realiza auditorías curadas en los resultados de los modelos que traten temas políticamente sensibles. Los revisores humanos pueden detectar sesgos sistemáticos que los filtros automatizados pasan por alto.

Contrapuntos y desafíos

Equilibrar la seguridad y la inclusividad sigue siendo un problema abierto.

Mirando hacia el futuro

La red Pravda muestra cómo los actores estatales pueden convertir la web abierta en un arma para moldear la próxima generación de IA.

Conclusión: La integridad de la IA depende de la limpieza de los datos de los que aprende. Una inundación coordinada de sitios de bajo tráfico y cargados de propaganda ya puede incrustar falsedades en los modelos en los que confiamos. Los desarrolladores deben tratar la reputación de las fuentes como una prioridad absoluta, y no como algo secundario, para evitar que las máquinas que construimos se conviertan en portavoces involuntarios de la desinformación.