एक त्वरित परीक्षण से पता चला है कि AI सर्च इंजन मृत या निम्न-गुणवत्ता वाले स्रोतों का हवाला देते हुए भी पूरी तरह आश्वस्त लग सकते हैं
तीन लोकप्रिय AI-संचालित सर्च टूल्स पर एक साधारण प्रोवेनेंस (provenance) जांच से पता चला कि उनमें से दो या तो मृत लिंक (dead links) की ओर इशारा कर रहे थे या उनके उत्तर कम-विश्वसनीय साइटों पर आधारित थे, भले ही तीनों ने एक ही तरह का आत्मविश्वासपूर्ण गद्य और स्रोतों की एक पंक्ति ("chips") प्रदर्शित की थी।
वह परीक्षण जिसने आश्चर्य पैदा किया
मैंने एक तथ्यात्मक और हालिया प्रश्न पूछा: “2026 में EU AI Act में क्या बदलाव हुआ?” इसका उत्तर आधिकारिक संशोधन पाठ (amendment text) में मौजूद है, इसलिए या तो वह वहां है या नहीं है। मैंने यह प्रश्न तीन ऐसे AI सर्च इंजन को दिया जो साइटेशन (citations) दिखाते हैं: Perplexity, Google का AI mode, और Brave Search।
तीनों ने एक जैसे तथ्य दिए—वही तारीखें, वही विवरण—इसलिए शुद्धता के मामले में वे बराबरी पर थे। अंतर केवल तब सामने आया जब मैंने उद्धृत (cited) स्रोतों की जांच की।
मैंने स्रोत की गुणवत्ता का आकलन कैसे किया
मैंने एक तीन-स्तरीय स्कोरिंग योजना बनाई जो प्रत्येक साइटेशन को होस्ट प्रकार के आधार पर वेटेज (weight) देती है:
- प्राथमिक (weight 3) – वह साइट जो वास्तव में कानून प्रकाशित करती है (जैसे, आधिकारिक EU रजिस्टर)।
- आधिकारिक (weight 2) – वह संस्थान जो कानून जारी करता है या उसकी देखरेख करता है (सरकारी डोमेन, एजेंसी साइटें)।
- यूजर-जेनरेटेड कंटेंट (UGC, weight 0) – YouTube या Reddit जैसे प्लेटफॉर्म।
प्रत्येक इंजन का कुल स्कोर उसके द्वारा प्रदर्शित किए गए URL का औसत वेटेज है।
| इंजन | रिपोर्ट किए गए स्रोत | स्कोर |
|---|---|---|
| Perplexity | आधिकारिक सरकारी डोमेन | 2.00 |
| Google AI mode | कंसल्टिंग फर्में और एक YouTube वीडियो | 1.00 |
| Brave Search | प्राथमिक स्रोत | 3.00 |
कागजों पर Brave एकदम सही लग रहा था, Perplexity ठीक-ठाक था, और Google पीछे रह गया।
छिपी हुई विफलता: मृत लिंक (dead links)
टियर मैप केवल डोमेन नाम को देखता है; यह सत्यापित नहीं करता कि लिंक किया गया पेज वास्तव में लोड हो रहा है या नहीं। मैंने प्रत्येक URL को खोलकर देखा। Brave का "प्राथमिक" साइटेशन एक खाली बॉडी (empty body) दिखा रहा था—लिंक मृत था। इंजन ने कानून की ओर इशारा करने का दावा किया लेकिन कुछ भी नहीं दिया।
Perplexity ने आधिकारिक सरकारी डोमेन का उपयोग किया।
Google ने कंसल्टेंसी और एक YouTube वीडियो का उपयोग किया।
दो अलग-अलग समस्याएं सामने आईं:
- एक उच्च-गुणवत्ता वाला डोमेन एक सुलभ (reachable) पेज की गारंटी नहीं देता है।
- एक अच्छी तरह से तैयार किया गया सारांश निम्न-विश्वसनीयता वाले स्रोतों पर आधारित हो सकता है।
यूजर इंटरफेस दोनों समस्याओं को छिपा देता है। तीनों टूल्स एक ही तरह का आत्मविश्वासपूर्ण पैराग्राफ और स्रोतों के चिप्स की एक समान पंक्ति प्रस्तुत करते हैं, बिना किसी विजुअल संकेत के कि एक चिप मृत पेज से लिंक है या दूसरा वैधानिक पाठ (statutory text) के बजाय YouTube ट्यूटोरियल की ओर इशारा कर रहा है।
डेवलपर्स के लिए प्रोवेनेंस (provenance) क्यों महत्वपूर्ण है
डेवलपर्स प्रोवेनेंस को एक परीक्षण योग्य मीट्रिक (testable metric) में बदल सकते हैं:
- प्रत्येक उत्तर को स्कोर दें: ऊपर दी गई योजना के समान एक टियर-आधारित वेटिंग का उपयोग करें।
- लिंक की स्थिति (link health) को स्वचालित रूप से सत्यापित करें: खाली प्रतिक्रियाओं या HTTP त्रुटियों को फ्लैग करें।
- अलर्ट ट्रिगर करें: जब किसी उत्तर का प्रोवेनेंस स्कोर कॉन्फ़िगर करने योग्य थ्रेशोल्ड (threshold) से नीचे गिर जाए।
यह दृष्टिकोण "hallucinations" (भ्रम) का पीछा करने की तुलना में अधिक ठोस है - मॉडल एक प्रशंसनीय वाक्य बना सकता है, लेकिन प्रोवेनेंस चेक आपको सटीक रूप से बताता है कि किस साइटेशन (या उसके अभाव) के कारण समस्या हुई, जिससे लक्षित सुधार (targeted fix) संभव हो पाता है।
निष्कर्ष (Takeaway)
एक संक्षिप्त प्रोवेनेंस परीक्षण से पता चलता है कि AI सर्च इंजन मृत या निम्न-गुणवत्ता वाले स्रोतों का हवाला देते हुए भी आधिकारिक लग सकते हैं। जो डेवलपर्स इन इंजनों पर भरोसा करते हैं, उन्हें साइटेशन की गुणवत्ता को एक मापने योग्य गुण (measurable property) के रूप में देखना चाहिए, न कि एक मानी हुई गारंटी के रूप में, और अपने पाइपलाइन में स्वचालित जांच (automated checks) शामिल करनी चाहिए। यह सत्यापित करना कि एक "प्राथमिक" स्रोत वास्तव में लोड हो रहा है, एक भरोसेमंद उत्तर और एक मौन गलत सूचना के जाल (misinformation trap) के बीच का अंतर हो सकता है।
