快速测试显示:AI 搜索引擎在引用失效或低质量来源时,语气可能显得非常笃定

对三种流行的 AI 驱动搜索工具进行简单的溯源检查发现,其中两个工具要么指向失效链接,要么以低可信度的网站作为答案依据,尽管这三者都展示了同样自信的措辞和一排来源“标签”。

引发意外的测试

我提出了一个关于近期事实的问题:“2026 年欧盟《人工智能法案》有哪些变化?” 答案存在于官方修正案文本中,所以它要么在那里,要么不在。我将该查询输入到三个会显示引用的 AI 搜索引擎中:Perplexity、Google 的 AI 模式和 Brave Search。

这三者返回的事实完全一致——日期相同,描述也相同——因此在纯粹的准确性上它们打平了。差异仅在我检查所引用的来源时才显现出来。

我如何评估来源质量

我创建了一个三级评分方案,根据主机类型对每个引用进行加权:

  • 原始来源(权重 3) —— 实际发布法律的网站(例如,欧盟官方公报)。
  • 官方来源(权重 2) —— 发布或监管法律的机构(政府域名、机构网站)。
  • 用户生成内容(UGC,权重 0) —— YouTube 或 Reddit 等平台。

每个引擎的总分是其显示的 URL 的平均权重。

引擎 报告的来源 分数
Perplexity 官方政府域名 2.00
Google AI mode 咨询公司和一段 YouTube 视频 1.00
Brave Search 原始来源 3.00

从数据上看,Brave 表现完美,Perplexity 表现尚可,而 Google 则落后了。

隐藏的失败:失效链接

分级映射仅查看域名;它并不验证链接页面是否能实际加载。我点击了每一个 URL。Brave 的“原始”引用返回了一个空页面——链接失效了。该引擎声称指向了法律文本,但实际上什么也没提供。

Perplexity 使用了官方政府域名。

Google 使用了咨询公司和一段 YouTube 视频。

出现了两个明显的问题:

  1. 高质量的域名并不保证页面可访问。
  2. 精心编写的摘要也可能由低可信度的来源支撑。

用户界面掩盖了这两个问题。这三种工具都呈现出同样自信的段落和整齐划一的来源“标签”行,没有任何视觉提示能告诉你某个标签链接到了失效页面,或者另一个标签指向的是 YouTube 教程而非法律条文。

为什么溯源对开发者至关重要

开发者可以将溯源转化为可测试的指标:

  • 为每个答案评分,使用类似于上述的分级加权法。
  • 自动验证链接健康状况;标记空响应或 HTTP 错误。
  • 触发警报,当答案的溯源分数低于可配置的阈值时。

这种方法比单纯追逐“幻觉”更具体——模型可能会生成一句听起来很有道理的话,但溯源检查能准确告诉你究竟是哪个引用(或缺失引用)导致了问题,从而实现针对性的修复。

总结

简短的溯源测试表明,AI 搜索引擎在引用失效或低质量来源时,依然可以表现得权威可靠。依赖这些引擎的开发者应当将引用质量视为一种可衡量的属性,而非理所当然的保证,并在其流水线中构建自动化检查。验证“原始”来源是否能实际加载,可能正是可靠答案与无声误导陷阱之间的分水岭。