AI 研究人员发现了一个由约 150 个低流量新闻网站组成的网络,正通过协同行动,试图向大语言模型 (LLM) 的训练数据中灌输亲克里姆林宫的叙事。这些网站统称为 Pravda 网络,每年发布约 300 万篇文章,其内容目前已出现在驱动许多商业 AI 系统的 Common Crawl 数据集中。

虚假信息管道的工作原理

Pravda 网络的目标并非吸引人类读者。相反,每个网站都会发布重复性的文章,反复强调一组狭隘的话题点。通过在文本中填充搜索引擎和网络爬虫优先考虑的关键词,这些网站增加了 AI 模型在数据收集过程中遇到它们的机会。

有两种投毒机制在起作用:

  • 检索时投毒 (Retrieval-time poisoning) —— 当 AI 助手从网络获取实时信息时,可能会将 Pravda 的文章与合法来源一并呈现。屏蔽已知的恶意域名可以遏制这种暴露。
  • 训练时投毒 (Training-time poisoning) —— 如果这些文章混入用于模型预训练的大规模语料库中,虚假主张就会成为模型内部知识的一部分。事后删除此类内容的难度要大得多。

研究人员已经追踪到 Common Crawl(一个用于训练许多 AI 模型的公共存档)中存在 Pravda 的文章。这意味着这种投毒并非假设;它已经改变了许多用户如今所依赖的模型知识库。

为什么这很重要

不要仅仅因为 AI 说“许多来源都一致认为”就信任它。 如果你正在构建 AI 工具,请对已知的虚假信息网站使用黑名单。 不要将“提及次数”作为衡量真理的标准。数量并不等于质量。 核实 AI 告诉你的每一件事,尤其是当它看起来带有偏见时。

互联网是我们未来技术的训练集。任何拥有网站的人都可以试图使我们所依赖的机器产生偏见。

开发者现在可以做什么

  • 维护黑名单 —— 将已知的虚假信息域名添加到爬虫过滤器中;黑名单可以同时阻止检索时和训练时的暴露。
  • 重新思考频率启发式算法 —— 不要再将提及次数等同于真实性。在朴素的基于频率的模型中,在数十个低质量网站上重复的主张可能会“投票”胜过单一的权威来源。
  • 应用溯源检查 —— 将信息追溯到其原始来源。如果溯源链终结于一个流量微乎其微且有宣传历史的网站,请将该输出标记为待审核。
  • 实施训练后清理 —— 对涉及政治敏感话题的模型输出进行精细化的审计。人工审核员可以发现自动化过滤器遗漏的系统性偏见。

反方观点与挑战

平衡安全性与包容性仍然是一个悬而未决的问题。

展望未来

Pravda 网络展示了国家行为体如何利用开放网络作为武器,来塑造下一代 AI。

核心要点: AI 的完整性取决于其学习数据的清洁度。通过大量低流量、充斥宣传内容的网站进行协同灌输,已经可以将虚假信息嵌入到我们信任的模型中。开发者必须将来源声誉视为首要关注的问题,而非事后才考虑的事项,以防止我们构建的机器在不知不觉中成为虚假信息的传声筒。