快速测试显示:AI 搜索引擎在引用失效或低质量来源时,语气可能显得非常笃定
对三种流行的 AI 驱动搜索工具进行简单的溯源检查发现,其中两个工具要么指向失效链接,要么以低可信度的网站作为答案依据,尽管这三者都展示了同样自信的措辞和一排来源“标签”。
引发意外的测试
我提出了一个关于近期事实的问题:“2026 年欧盟《人工智能法案》有哪些变化?” 答案存在于官方修正案文本中,所以它要么在那里,要么不在。我将该查询输入到三个会显示引用的 AI 搜索引擎中:Perplexity、Google 的 AI 模式和 Brave Search。
这三者返回的事实完全一致——日期相同,描述也相同——因此在纯粹的准确性上它们打平了。差异仅在我检查所引用的来源时才显现出来。
我如何评估来源质量
我创建了一个三级评分方案,根据主机类型对每个引用进行加权:
- 原始来源(权重 3) —— 实际发布法律的网站(例如,欧盟官方公报)。
- 官方来源(权重 2) —— 发布或监管法律的机构(政府域名、机构网站)。
- 用户生成内容(UGC,权重 0) —— YouTube 或 Reddit 等平台。
每个引擎的总分是其显示的 URL 的平均权重。
| 引擎 | 报告的来源 | 分数 |
|---|---|---|
| Perplexity | 官方政府域名 | 2.00 |
| Google AI mode | 咨询公司和一段 YouTube 视频 | 1.00 |
| Brave Search | 原始来源 | 3.00 |
从数据上看,Brave 表现完美,Perplexity 表现尚可,而 Google 则落后了。
隐藏的失败:失效链接
分级映射仅查看域名;它并不验证链接页面是否能实际加载。我点击了每一个 URL。Brave 的“原始”引用返回了一个空页面——链接失效了。该引擎声称指向了法律文本,但实际上什么也没提供。
Perplexity 使用了官方政府域名。
Google 使用了咨询公司和一段 YouTube 视频。
出现了两个明显的问题:
- 高质量的域名并不保证页面可访问。
- 精心编写的摘要也可能由低可信度的来源支撑。
用户界面掩盖了这两个问题。这三种工具都呈现出同样自信的段落和整齐划一的来源“标签”行,没有任何视觉提示能告诉你某个标签链接到了失效页面,或者另一个标签指向的是 YouTube 教程而非法律条文。
为什么溯源对开发者至关重要
开发者可以将溯源转化为可测试的指标:
- 为每个答案评分,使用类似于上述的分级加权法。
- 自动验证链接健康状况;标记空响应或 HTTP 错误。
- 触发警报,当答案的溯源分数低于可配置的阈值时。
这种方法比单纯追逐“幻觉”更具体——模型可能会生成一句听起来很有道理的话,但溯源检查能准确告诉你究竟是哪个引用(或缺失引用)导致了问题,从而实现针对性的修复。
总结
简短的溯源测试表明,AI 搜索引擎在引用失效或低质量来源时,依然可以表现得权威可靠。依赖这些引擎的开发者应当将引用质量视为一种可衡量的属性,而非理所当然的保证,并在其流水线中构建自动化检查。验证“原始”来源是否能实际加载,可能正是可靠答案与无声误导陷阱之间的分水岭。
