एआय सर्च इंजिन्स निकामी किंवा निकृष्ट दर्जाचे स्रोत सांगतानाही आत्मविश्वासाने बोलू शकतात, चाचणीतून समोर आले

तीन लोकप्रिय एआय-आधारित सर्च टूल्सच्या साध्या 'प्रोव्हेनन्स' (provenance - स्रोताची सत्यता) तपासणीतून असे दिसून आले की, त्यापैकी दोन टूल्सने एकतर निकामी (dead) लिंक्स दिल्या किंवा त्यांच्या उत्तरांसाठी कमी विश्वासार्ह साइट्सचा आधार घेतला, जरी तिन्ही टूल्सनी सारखीच आत्मविश्वासाने लिहिलेली माहिती आणि स्रोतांच्या "चिप्स" (chips) दाखवल्या तरीही.

आश्चर्यचकित करणारी ही चाचणी

मी एक तथ्यात्मक आणि अलीकडील प्रश्न विचारला: “२०२६ मध्ये EU AI Act मध्ये काय बदल झाले?” याचे उत्तर अधिकृत सुधारणा मजकुरात (amendment text) उपलब्ध आहे, त्यामुळे ते तिथे आहे किंवा नाही, हे स्पष्ट आहे. मी हा प्रश्न संदर्भ (citations) देणाऱ्या तीन एआय सर्च इंजिन्सना विचारला: Perplexity, Google’s AI mode आणि Brave Search.

तिन्ही इंजिन्सनी सारखीच तथ्ये दिली—तीच तारखा, तेच वर्णन—त्यामुळे शुद्ध अचूकतेच्या बाबतीत ते समान ठरले. मात्र, जेव्हा मी दिलेल्या स्रोतांची तपासणी केली, तेव्हा त्यांच्यात फरक दिसून आला.

मी स्रोतांच्या गुणवत्तेचे मूल्यमापन कसे केले

मी एक तीन-स्तरीय स्कोअरिंग योजना तयार केली, ज्यामध्ये प्रत्येक संदर्भ (citation) होस्टच्या प्रकारानुसार वजन (weight) दिले होते:

  • प्राथमिक (weight 3) – ती साइट जी प्रत्यक्षात कायदा प्रकाशित करते (उदा. अधिकृत EU रजिस्टर).
  • अधिकृत (weight 2) – कायदा जारी करणारी किंवा त्यावर देखरेख ठेवणारी संस्था (सरकारी डोमेन, एजन्सी साइट्स).
  • वापरकर्त्याद्वारे तयार केलेली सामग्री (UGC, weight 0) – YouTube किंवा Reddit सारखे प्लॅटफॉर्म.

प्रत्येक इंजिनचा एकूण स्कोअर हा त्याने दाखवलेल्या URL च्या सरासरी वजनावर (average weight) आधारित आहे.

इंजिन अहवाल दिलेले स्रोत स्कोअर
Perplexity अधिकृत सरकारी डोमेन 2.00
Google AI mode सल्लागार कंपन्या आणि एक YouTube व्हिडिओ 1.00
Brave Search प्राथमिक स्रोत 3.00

कागदावर Brave उत्तम दिसत होते, Perplexity समाधानकारक होते आणि Google मागे पडले होते.

ही टियर मॅप फक्त डोमेन नावाकडे पाहते; लिंक केलेली पेज प्रत्यक्षात लोड होते की नाही याची ती पडताळणी करत नाही. मी प्रत्येक URL तपासून पाहिली. Brave च्या "प्राथमिक" संदर्भाने रिकामी माहिती दिली—ती लिंक निकामी (dead) होती. इंजिनने कायद्याचा संदर्भ देण्याचा दावा केला होता, पण प्रत्यक्षात काहीही मिळाले नाही.

Perplexity ने अधिकृत सरकारी डोमेन वापरले होते.

Google ने सल्लागार कंपन्या आणि YouTube व्हिडिओचा वापर केला होता.

दोन स्पष्ट समस्या समोर आल्या:

  1. उच्च-गुणवत्तेचे डोमेन म्हणजे ती लिंक कार्यरत असेलच याची खात्री नसते.
  2. उत्तमरीत्या तयार केलेले सारांश हे कमी विश्वासार्ह स्रोतांवर आधारित असू शकतात.

युजर इंटरफेस (UI) या दोन्ही समस्या लपवून ठेवतो. तिन्ही टूल्स एकच आत्मविश्वासाने लिहिलेला परिच्छेद आणि स्रोतांच्या चिप्सची एक सारखीच ओळ सादर करतात. एखादी चिप निकामी पेजला लिंक करते किंवा दुसरी चिप कायदेशीर मजकुराऐवजी YouTube ट्युटोरियलकडे निर्देश करते, याचे कोणतेही दृश्य संकेत (visual cue) तिथे नसतात.

डेव्हलपर्ससाठी 'प्रोव्हेनन्स' (provenance) का महत्त्वाचे आहे

डेव्हलपर्स 'प्रोव्हेनन्स'ला एका चाचणीयोग्य मेट्रिकमध्ये (testable metric) रूपांतरित करू शकतात:

  • प्रत्येक उत्तराला स्कोअर द्या – वरीलप्रमाणेच टियर-आधारित वेटिंगचा वापर करा.
  • लिंकची स्थिती (link health) स्वयंचलितपणे तपासा; रिकाम्या प्रतिसादांना किंवा HTTP त्रुटींना फ्लॅग करा.
  • अलर्ट्स ट्रिगर करा – जेव्हा उत्तराचा प्रोव्हेनन्स स्कोअर ठरवून दिलेल्या मर्यादेपेक्षा (threshold) कमी होतो, तेव्हा सूचना द्या.

हा दृष्टिकोन केवळ "हॅलुसिनेशन्स" (hallucinations) शोधण्यापेक्षा अधिक ठोस आहे – मॉडेल कदाचित एक पटण्यासारखे वाक्य तयार करू शकते, परंतु प्रोव्हेनन्स तपासणी तुम्हाला नेमका कोणता संदर्भ (किंवा संदर्भाचा अभाव) समस्येचे कारण ठरला आहे हे सांगते, ज्यामुळे नेमका उपाय शोधणे सोपे होते.

निष्कर्ष

एका संक्षिप्त प्रोव्हेनन्स चाचणीवरून असे दिसून येते की, एआय सर्च इंजिन्स निकामी किंवा निकृष्ट दर्जाचे स्रोत सांगतानाही अधिकृत वाटू शकतात. या इंजिन्सवर अवलंबून असणाऱ्या डेव्हलपर्सनी संदर्भांच्या गुणवत्तेकडे एक मोजता येण्याजोगे गुणधर्म (measurable property) म्हणून पाहिले पाहिजे, केवळ गृहीत धरलेली खात्री म्हणून नाही; आणि त्यांच्या पाइपलाइनमध्ये स्वयंचलित तपासणी (automated checks) समाविष्ट केली पाहिजे. "प्राथमिक" स्रोत प्रत्यक्षात लोड होतो की नाही याची पडताळणी करणे, हे एका विश्वासार्ह उत्तरामध्ये आणि माहितीच्या शांतपणे पसरवणाऱ्या जाळ्यात (misinformation trap) मधील फरक ठरवू शकते.