മരിച്ചതോ ഗുണനിലവാരം കുറഞ്ഞതോ ആയ സ്രോതസ്സുകൾ ഉദ്ധരിച്ചുകൊണ്ട് ആത്മവിശ്വാസത്തോടെ സംസാരിക്കാൻ AI സെർച്ച് എഞ്ചിനുകൾക്ക് കഴിയുമെന്ന് ഒരു പരിശോധന വ്യക്തമാക്കുന്നു
ജനപ്രിയമായ മൂന്ന് AI അധിഷ്ഠിത സെർച്ച് ടൂളുകളിൽ നടത്തിയ ലളിതമായ ഒരു പ്രൊവനൻസ് (provenance) പരിശോധനയിൽ, മൂന്നും ഒരേപോലെ ആത്മവിശ്വാസമുള്ള വിവരണങ്ങളും സ്രോതസ്സുകളുടെ "ചിപ്പുകളും" (source chips) പ്രദർശിപ്പിച്ചെങ്കിലും, അവയിൽ രണ്ടെണ്ണം മരിച്ച ലിങ്കുകളിലേക്കോ (dead links) വിശ്വാസ്യത കുറഞ്ഞ സൈറ്റുകളിലേക്കോ ആണ് വിരൽ ചൂണ്ടുന്നത് എന്ന് കണ്ടെത്തി.
അത്ഭുതം вызാനായ പരിശോധന
ഞാൻ ഒരു വസ്തുതാപരമായ ചോദ്യം ചോദിച്ചു: “2026-ൽ EU AI Act-ൽ വന്ന മാറ്റങ്ങൾ എന്തൊക്കെയാണ്?” ഇതിനുള്ള ഉത്തരം ഔദ്യോഗിക ഭേദഗതി രേഖയിലുണ്ട്, അതിനാൽ അത് അവിടെ ഉണ്ടാവുകയോ അല്ലെങ്കിൽ ഇല്ലായിരിക്കുകയോ ചെയ്യും. ഉദ്ധരണികൾ (citations) നൽകുന്ന Perplexity, Google-ന്റെ AI mode, Brave Search എന്നീ മൂന്ന് AI സെർച്ച് എഞ്ചിനുകളിലാണ് ഞാൻ ഈ ചോദ്യം നൽകിയത്.
മൂന്നും ഒരേ വസ്തുതകളാണ് നൽകിയത്—ഒരേ തീയതികളും ഒരേ വിവരണവും—അതുകൊണ്ട് തന്നെ കൃത്യതയുടെ കാര്യത്തിൽ അവ തുല്യമായിരുന്നു. എന്നാൽ ഉദ്ധരിച്ച സ്രോതസ്സുകൾ പരിശോധിച്ചപ്പോഴാണ് അവ തമ്മിലുള്ള വ്യത്യാസം കണ്ടത്.
സ്രോതസ്സുകളുടെ ഗുണനിലവാരം ഞാൻ എങ്ങനെ വിലയിരുത്തി
ഓരോ ഉദ്ധരണിയെയും അതിന്റെ ഹോസ്റ്റ് തരം അനുസരിച്ച് വിലയിരുത്തുന്നതിനായി ഞാൻ മൂന്ന് തലങ്ങളുള്ള ഒരു സ്കോറിംഗ് രീതി തയ്യാറാക്കി:
- Primary (weight 3) – നിയമം യഥാർത്ഥത്തിൽ പ്രസിദ്ധീകരിക്കുന്ന സൈറ്റ് (ഉദാഹരണത്തിന്, ഔദ്യോഗിക EU രജിസ്റ്റർ).
- Official (weight 2) – നിയമം പുറപ്പെടുവിക്കുന്നതോ മേൽനോട്ടം വഹിക്കുന്നതോ ആയ സ്ഥാപനം (ഗവൺമെന്റ് ഡൊമെയ്നുകൾ, ഏജൻസി സൈറ്റുകൾ).
- User-generated content (UGC, weight 0) – YouTube അല്ലെങ്കിൽ Reddit പോലുള്ള പ്ലാറ്റ്ഫോമുകൾ.
ഓരോ എഞ്ചിനും പ്രദർശിപ്പിച്ച URL-കളുടെ ശരാശരി വെയ്റ്റാണ് (weight) അതിന്റെ മൊത്തത്തിലുള്ള സ്കോർ.
| എഞ്ചിൻ | റിപ്പോർട്ട് ചെയ്ത സ്രോതസ്സുകൾ | സ്കോർ |
|---|---|---|
| Perplexity | ഔദ്യോഗിക ഗവൺമെന്റ് ഡൊമെയ്നുകൾ | 2.00 |
| Google AI mode | കൺസൾട്ടിംഗ് സ്ഥാപനങ്ങളും ഒരു YouTube വീഡിയോയും | 1.00 |
| Brave Search | പ്രൈമറി സ്രോതസ്സ് | 3.00 |
രേഖാമൂലം നോക്കുമ്പോൾ Brave മികച്ചതായും, Perplexity മിതമായും, Google പിന്നിലുമായി തോന്നി.
മറഞ്ഞിരിക്കുന്ന പരാജയം: മരിച്ച ലിങ്കുകൾ
ഈ തരംതിരിക്കൽ രീതി ഡൊമെയ്ൻ പേര് മാത്രമേ പരിശോധിക്കുന്നുള്ളൂ; ലിങ്ക് ചെയ്ത പേജ് യഥാർത്ഥത്തിൽ ലോഡ് ആകുന്നുണ്ടോ എന്ന് ഇത് പരിശോധിക്കുന്നില്ല. ഞാൻ എല്ലാ URL-കളും പരിശോധിച്ചു. Brave-ന്റെ “primary” ഉദ്ധരണി ഒരു ശൂന്യമായ പേജാണ് കാണിച്ചത്—ആ ലിങ്ക് പ്രവർത്തിക്കുന്നുണ്ടായിരുന്നില്ല. നിയമത്തിലേക്ക് വിരൽ ചൂണ്ടുന്നു എന്ന് എഞ്ചിൻ അവകാശപ്പെട്ടെങ്കിലും ഒന്നും നൽകിയില്ല.
Perplexity ഔദ്യോഗിക ഗവൺമെന്റ് ഡൊമെയ്നുകൾ ഉപയോഗിച്ചു.
Google കൺസൾട്ടൻസികളും ഒരു YouTube വീഡിയോയും ഉപയോഗിച്ചു.
രണ്ട് പ്രധാന പ്രശ്നങ്ങൾ ഇവിടെ ഉയർന്നുവന്നു:
- ഉയർന്ന ഗുണനിലവാരമുള്ള ഒരു ഡൊമെയ്ൻ ഉണ്ടെന്നത് ആ പേജ് ലഭ്യമാണെന്ന് ഉറപ്പുനൽകുന്നില്ല.
- നന്നായി തയ്യാറാക്കിയ ഒരു സംഗ്രഹം പോലും വിശ്വാസ്യത കുറഞ്ഞ സ്രോതസ്സുകളെ അടിസ്ഥാനമാക്കിയുള്ളതാകാം.
യൂസർ ഇന്റർഫേസ് ഈ രണ്ട് പ്രശ്നങ്ങളെയും മറച്ചുവെക്കുന്നു. മൂന്ന് ടൂളുകളും ഒരേപോലെ ആത്മവിശ്വാസമുള്ള പാരഗ്രാഫുകളും സ്രോതസ്സുകളുടെ ചിപ്പുകളും നൽകുന്നു. ഒരു ചിപ്പ് മരിച്ച പേജിലേക്കോ അല്ലെങ്കിൽ നിയമപരമായ രേഖയ്ക്ക് പകരം ഒരു YouTube ട്യൂട്ടോറിയലിലേക്കോ ആണ് വിരൽ ചൂണ്ടുന്നതെന്നതിനെക്കുറിച്ച് യാതൊരു സൂചനയും നൽകുന്നില്ല.
ഡെവലപ്പർമാരെ സംബന്ധിച്ചിടത്തോളം പ്രൊവനൻസ് പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
ഡെവലപ്പർമാർക്ക് പ്രൊവനൻസിനെ ഒരു പരിശോധിക്കാവുന്ന മാനദണ്ഡമാക്കി മാറ്റാൻ കഴിയും:
- മുകളിൽ പറഞ്ഞതുപോലെ ഓരോ ഉത്തരവും ഒരു സ്കോറിംഗ് രീതി ഉപയോഗിച്ച് വിലയിരുത്തുക.
- ലിങ്കുകളുടെ പ്രവർത്തനക്ഷമത (link health) സ്വയമേവ പരിശോധിക്കുക; ശൂന്യമായ മറുപടികളോ HTTP പിശകുകളോ ഉണ്ടെങ്കിൽ അത് അടയാളപ്പെടുത്തുക.
- ഒരു ഉത്തരത്തിന്റെ പ്രൊവനൻസ് സ്കോർ നിശ്ചിത പരിധിയിൽ താഴെയാകുമ്പോൾ അലേർട്ടുകൾ നൽകുക.
"Hallucinations" (തെറ്റായ വിവരങ്ങൾ നിർമ്മിക്കൽ) പിടികൂടുന്നതിനേക്കാൾ പ്രായോഗികമായ രീതിയാണിത് - മോഡൽ ഒരു വിശ്വസനീയമായ വാചകം നിർമ്മിച്ചേക്കാം, എന്നാൽ ഏത് ഉദ്ധരണിയാണ് (അല്ലെങ്കിൽ ഏത് ഉദ്ധരണിയുടെ അഭാവമാണ്) പ്രശ്നമുണ്ടാക്കിയതെന്ന് പ്രൊവനൻസ് പരിശോധനയിലൂടെ കൃത്യമായി മനസ്സിലാക്കാൻ സാധിക്കും, ഇത് പ്രശ്നം പരിഹരിക്കാൻ സഹായിക്കുന്നു.
ചുരുക്കത്തിൽ
AI സെർച്ച് എഞ്ചിനുകൾക്ക് മരിച്ചതോ ഗുണനിലവാരം കുറഞ്ഞതോ ആയ സ്രോതസ്സുകൾ ഉദ്ധരിച്ചുകൊണ്ട് തന്നെ വിശ്വസനീയമായി തോന്നാൻ കഴിയുമെന്ന് ഒരു ചെറിയ പ്രൊവനൻസ് പരിശോധന കാണിച്ചുതരുന്നു. ഈ എഞ്ചിനുകളെ ആശ്രയിക്കുന്ന ഡെവലപ്പർമാർ ഉദ്ധരണികളുടെ ഗുണനിലവാരത്തെ ഒരു ഉറപ്പായ കാര്യമായി കാണാതെ, അളക്കാവുന്ന ഒരു ഗുണമായി (measurable property) പരിഗണിക്കുകയും അവരുടെ പൈപ്പ്ലൈനുകളിൽ (pipelines) ഓട്ടോമേറ്റഡ് പരിശോധനകൾ ഉൾപ്പെടുത്തുകയും വേണം. ഒരു “പ്രൈമറി” സ്രോതസ്സ് യഥാർത്ഥത്തിൽ ലോഡ് ആകുന്നുണ്ടോ എന്ന് പരിശോധിക്കുന്നത്, വിശ്വസനീയമായ ഒരു ഉത്തരവും നിശബ്ദമായ ഒരു തെറ്റായ വിവരക്കെട്ടും തമ്മിലുള്ള വ്യത്യാസമായിരിക്കാം.
