Les moteurs de recherche IA peuvent paraître assurés tout en citant des sources mortes ou de faible qualité, montre un test rapide
Une simple vérification de la provenance effectuée sur trois outils de recherche populaires basés sur l'IA a révélé que deux d'entre eux pointaient soit vers des liens morts, soit s'appuyaient sur des sites de faible crédibilité, même si les trois affichaient la même prose assurée et une rangée de « puces » de sources.
Le test qui a suscité la surprise
J'ai posé une question factuelle et récente : « Qu'est-ce qui a changé dans l'IA Act de l'UE en 2026 ? » La réponse figure dans le texte officiel de l'amendement, elle est donc soit présente, soit absente. J'ai soumis la requête à trois moteurs de recherche IA qui affichent des citations : Perplexity, le mode IA de Google et Brave Search.
Les trois ont renvoyé des faits identiques — mêmes dates, même description — ils étaient donc à égalité sur la pure exactitude. La divergence n'est apparue que lorsque j'ai examiné les sources citées.
Comment j'ai évalué la qualité des sources
J'ai créé un système de notation à trois niveaux qui pondère chaque citation en fonction du type d'hôte :
- Primaire (poids 3) – le site qui publie réellement la loi (ex. : le registre officiel de l'UE).
- Officiel (poids 2) – l'institution qui émet ou supervise la loi (domaines gouvernementaux, sites d'agences).
- Contenu généré par l'utilisateur (UGC, poids 0) – des plateformes telles que YouTube ou Reddit.
Le score global de chaque moteur est la moyenne des poids des URL qu'il a affichées.
| Moteur | Sources rapportées | Score |
|---|---|---|
| Perplexity | Domaines gouvernementaux officiels | 2,00 |
| Google AI mode | Cabinets de conseil et une vidéo YouTube | 1,00 |
| Brave Search | Source primaire | 3,00 |
Sur le papier, Brave semblait parfait, Perplexity était correct et Google était à la traîne.
L'échec caché : les liens morts
La cartographie des niveaux ne regarde que le nom de domaine ; elle ne vérifie pas si la page liée se charge réellement. J'ai suivi chaque URL. La citation « primaire » de Brave renvoyait un corps vide — le lien était mort. Le moteur prétendait pointer vers la loi, mais n'a rien fourni.
Perplexity utilisait des domaines gouvernementaux officiels.
Google utilisait des cabinets de conseil et une vidéo YouTube.
Deux problèmes distincts sont apparus :
- Un domaine de haute qualité ne garantit pas une page accessible.
- Un résumé bien rédigé peut s'appuyer sur des sources de faible crédibilité.
L'interface utilisateur masque ces deux problèmes. Les trois outils présentent le même paragraphe assuré et une rangée uniforme de puces de sources, sans aucun indice visuel indiquant qu'une puce renvoie à une page morte ou qu'une autre pointe vers un tutoriel YouTube plutôt que vers le texte législatif.
Pourquoi la provenance est importante pour les développeurs
Les développeurs peuvent transformer la provenance en une métrique testable :
- Noter chaque réponse en utilisant une pondération par niveaux similaire à celle ci-dessus.
- Valider la santé des liens automatiquement ; signaler les réponses vides ou les erreurs HTTP.
- Déclencher des alertes lorsque le score de provenance d'une réponse tombe en dessous d'un seuil configurable.
Cette approche est plus concrète que la traque des « hallucinations » : le modèle peut générer une phrase plausible, mais la vérification de la provenance vous indique exactement quelle citation (ou l'absence de citation) a causé le problème, permettant ainsi une correction ciblée.
À retenir
Un bref test de provenance montre que les moteurs de recherche IA peuvent paraître faisant autorité tout en citant des sources mortes ou de faible qualité. Les développeurs qui s'appuient sur ces moteurs devraient traiter la qualité des citations comme une propriété mesurable, et non comme une garantie implicite, et intégrer des vérifications automatisées dans leurs pipelines. Vérifier qu'une source « primaire » se charge réellement peut faire la différence entre une réponse fiable et un piège à désinformation silencieux.
