AI検索エンジンは、リンク切れや低品質なソースを引用しながらも、自信満々に回答することがあることが簡単なテストで判明

人気のある3つのAI搭載検索ツールに対して簡単なプロベナンス(情報源の出所)チェックを行ったところ、3つとも同じような自信に満ちた文章と一連のソース「チップ」を表示していたにもかかわらず、そのうちの2つはリンク切れを指しているか、信頼性の低いサイトを回答の根拠としていたことが明らかになった。

驚きのきっかけとなったテスト

私は、事実に基づいた最近の質問を投げかけた。「2026年のEU AI法で何が変わるのか?」 という問いだ。答えは公式の修正条文の中に存在するため、そこにあるか、ないかのどちらかである。私は、引用を表示する3つのAI検索エンジン、Perplexity、GoogleのAIモード、そしてBrave Searchにこのクエリを入力した。

3つとも全く同じ事実(日付も説明も同じ)を返してきたため、純粋な正確性においては引き分けだった。相違点が現れたのは、引用されたソースを検証したときだけだった。

ソースの品質をどのように判断したか

私は、ホストのタイプごとに各引用に重み付けを行う、3段階のスコアリング方式を作成した。

  • Primary(重み 3) – 法律を実際に公開しているサイト(例:EUの公式登録簿)。
  • Official(重み 2) – 法律を発行または監督する機関(政府ドメイン、機関サイト)。
  • User-generated content (UGC, 重み 0) – YouTubeやRedditなどのプラットフォーム。

各エンジンの総合スコアは、表示されたURLの重みの平均値である。

エンジン 報告されたソース スコア
Perplexity 公式政府ドメイン 2.00
Google AI mode コンサルティング会社およびYouTube動画 1.00
Brave Search Primary source 3.00

書面上ではBraveは完璧に見え、Perplexityはまずまずで、Googleは後れを取っていた。

隠れた失敗:リンク切れ

このティアマップはドメイン名のみを確認するものであり、リンク先のページが実際に読み込まれるかどうかは検証しない。私はすべてのURLを辿ってみた。Braveの「primary」引用は空のボディを返した。つまり、リンク切れだったのだ。そのエンジンは法律を指していると主張しながら、何も提供できなかった。

Perplexityは公式の政府ドメインを使用していた。

Googleはコンサルティング会社とYouTube動画を使用していた。

2つの明確な問題が浮き彫りになった。

  1. 高品質なドメインであっても、ページにアクセスできることが保証されるわけではない。
  2. 巧みに作成された要約であっても、信頼性の低いソースに基づいている可能性がある。

ユーザーインターフェースは、これら両方の問題を隠蔽している。3つのツールすべてが、同じような自信に満ちた段落と統一されたソースチップの列を表示しており、あるチップがリンク切れのページに繋がっていることや、別のチップが条文ではなくYouTubeのチュートリアルを指していることを示す視覚的な手がかりは一切ない。

なぜ開発者にとってプロベナンスが重要なのか

開発者はプロベナンスをテスト可能な指標に変えることができる。

  • すべての回答をスコアリングする: 上記と同様の段階的な重み付けを使用する。
  • リンクの健全性を自動検証する: 空のレスポンスやHTTPエラーをフラグ立てする。
  • アラートをトリガーする: 回答のプロベナンススコアが設定可能な閾値を下回った場合に通知する。

このアプローチは、「ハルシネーション(幻覚)」を追いかけるよりも具体的である。モデルはもっともらしい文章を生成するかもしれないが、プロベナンスチェックを行えば、どの引用(あるいは引用の欠如)が問題を引き起こしたのかを正確に特定できるため、的を絞った修正が可能になる。

まとめ

短いプロベナンステストの結果、AI検索エンジンは、リンク切れや低品質なソースを引用しながらも、権威があるように見せかけることができることが示された。これらのエンジンに依存する開発者は、引用の品質を「当然保証されているもの」ではなく「測定可能な特性」として扱い、パイプラインに自動チェックを組み込むべきである。「primary」ソースが実際に読み込まれるかを確認することは、信頼できる回答と、静かな誤情報の罠との分かれ目になり得る。