একটি দ্রুত পরীক্ষা দেখায় যে, AI সার্চ ইঞ্জিনগুলো মৃত বা নিম্নমানের উৎস উদ্ধৃত করার সময়ও আত্মবিশ্বাসী শোনাতে পারে

তিনটি জনপ্রিয় AI-চালিত সার্চ টুলের একটি সাধারণ প্রোভেন্যান্স (উৎস যাচাই) পরীক্ষা থেকে দেখা গেছে যে, তাদের মধ্যে দুটি হয় মৃত লিঙ্কে নির্দেশ করছে অথবা নিম্ন-বিশ্বাসযোগ্য সাইটের মাধ্যমে তাদের উত্তরের সমর্থন দিচ্ছে, যদিও তিনটিই একই আত্মবিশ্বাসী বর্ণনা এবং এক সারি সোর্স "চিপস" (source chips) প্রদর্শন করছিল।

সেই পরীক্ষা যা বিস্ময় জাগিয়ে তুলল

আমি একটি তথ্যমূলক এবং সাম্প্রতিক প্রশ্ন জিজ্ঞাসা করেছিলাম: “২০২৬ সালে EU AI Act-এ কী পরিবর্তন হয়েছে?” এর উত্তরটি অফিসিয়াল সংশোধনী টেক্সটে রয়েছে, তাই উত্তরটি হয় সেখানে আছে অথবা নেই। আমি এই প্রশ্নটি তিনটি AI সার্চ ইঞ্জিনকে দিয়েছিলাম যা সাইটেশন (উদ্ধৃতি) প্রদর্শন করে: Perplexity, Google-এর AI mode এবং Brave Search।

তিনটিই একই রকম তথ্য প্রদান করেছিল—একই তারিখ, একই বর্ণনা—তাই বিশুদ্ধ সঠিকতার দিক থেকে তারা সমান ছিল। পার্থক্যটি কেবল তখনই দেখা দিল যখন আমি উদ্ধৃত উৎসগুলো পরীক্ষা করলাম।

আমি যেভাবে উৎসের গুণমান বিচার করেছি

আমি একটি তিন-স্তরের স্কোরিং পদ্ধতি তৈরি করেছি যা হোস্টের ধরন অনুযায়ী প্রতিটি সাইটেশনকে গুরুত্ব (weight) প্রদান করে:

  • Primary (weight 3) – সেই সাইট যা প্রকৃতপক্ষে আইনটি প্রকাশ করে (যেমন, অফিসিয়াল EU রেজিস্টার)।
  • Official (weight 2) – সেই প্রতিষ্ঠান যা আইনটি জারি করে বা তদারকি করে (সরকারি ডোমেইন, এজেন্সির সাইট)।
  • User-generated content (UGC, weight 0) – YouTube বা Reddit-এর মতো প্ল্যাটফর্ম।

প্রতিটি ইঞ্জিনের সামগ্রিক স্কোর হলো তার প্রদর্শিত URL-গুলোর গড় ওয়েট (average weight)।

ইঞ্জিন রিপোর্ট করা উৎস স্কোর
Perplexity অফিসিয়াল সরকারি ডোমেইন 2.00
Google AI mode কনসাল্টিং ফার্ম এবং একটি YouTube ভিডিও 1.00
Brave Search Primary source 3.00

কাগজে-কলমে Brave নিখুঁত মনে হয়েছিল, Perplexity মোটামুটি ভালো ছিল এবং Google পিছিয়ে ছিল।

লুকানো ব্যর্থতা: মৃত লিঙ্ক

এই স্তরবিন্যাস (tier map) কেবল ডোমেইন নামের দিকে নজর দেয়; লিঙ্ক করা পেজটি আসলে লোড হচ্ছে কি না তা যাচাই করে না। আমি প্রতিটি URL অনুসরণ করেছি। Brave-এর “primary” সাইটেশনটি একটি খালি বডি (empty body) প্রদর্শন করেছিল—লিঙ্কটি মৃত ছিল। ইঞ্জিনটি আইনের দিকে নির্দেশ করার দাবি করলেও বাস্তবে কিছুই দেখাতে পারেনি।

Perplexity অফিসিয়াল সরকারি ডোমেইন ব্যবহার করেছিল।

Google কনসালটেন্সি এবং একটি YouTube ভিডিও ব্যবহার করেছিল।

দুটি ভিন্ন সমস্যা সামনে এসেছে:

  1. একটি উচ্চ-মানের ডোমেইন মানেই যে পেজটি অ্যাক্সেসযোগ্য হবে, তার কোনো নিশ্চয়তা নেই।
  2. একটি সুগঠিত সারাংশ নিম্ন-বিশ্বাসযোগ্য উৎসের মাধ্যমে সমর্থিত হতে পারে।

ইউজার ইন্টারফেস উভয় সমস্যাকেই আড়াল করে রাখে। তিনটি টুলই একই আত্মবিশ্বাসী অনুচ্ছেদ এবং সোর্স চিপসের একটি অভিন্ন সারি প্রদর্শন করে; সেখানে এমন কোনো ভিজ্যুয়াল সংকেত থাকে না যা নির্দেশ করে যে একটি চিপ মৃত পেজের লিঙ্ক অথবা অন্যটি বিধিবদ্ধ টেক্সটের পরিবর্তে একটি YouTube টিউটোরিয়ালের দিকে নির্দেশ করছে।

ডেভেলপারদের জন্য প্রোভেন্যান্স কেন গুরুত্বপূর্ণ

ডেভেলপাররা প্রোভেন্যান্সকে একটি পরীক্ষাযোগ্য মেট্রিক হিসেবে ব্যবহার করতে পারেন:

  • প্রতিটি উত্তরের স্কোর নির্ধারণ করুন উপরে বর্ণিত পদ্ধতির মতো একটি স্তরভিত্তিক ওয়েটিং ব্যবহার করে।
  • লিঙ্কের কার্যকারিতা স্বয়ংক্রিয়ভাবে যাচাই করুন; খালি রেসপন্স বা HTTP এরর চিহ্নিত করুন।
  • অ্যালার্ট ট্রিগার করুন যখন কোনো উত্তরের প্রোভেন্যান্স স্কোর একটি নির্দিষ্ট সীমার নিচে নেমে যায়।

"Hallucinations" বা বিভ্রান্তিকর তথ্য খোঁজার চেয়ে এই পদ্ধতিটি অনেক বেশি কার্যকর – মডেলটি একটি বিশ্বাসযোগ্য বাক্য তৈরি করতে পারে, কিন্তু প্রোভেন্যান্স চেক আপনাকে ঠিক জানিয়ে দেবে কোন সাইটেশন (বা সাইটেশনের অভাব) সমস্যার কারণ হয়েছে, যা আপনাকে সুনির্দিষ্টভাবে সমাধান করতে সাহায্য করবে।

সারসংক্ষেপ

একটি সংক্ষিপ্ত প্রোভেন্যান্স পরীক্ষা দেখায় যে, AI সার্চ ইঞ্জিনগুলো মৃত বা নিম্নমানের উৎস উদ্ধৃত করার সময়ও নির্ভরযোগ্য মনে হতে পারে। যারা এই ইঞ্জিনগুলোর ওপর নির্ভর করেন, ডেভেলপারদের উচিত সাইটেশনের গুণমানকে একটি পরিমাপযোগ্য বৈশিষ্ট্য হিসেবে বিবেচনা করা, কোনো নিশ্চিত গ্যারান্টি হিসেবে নয়, এবং তাদের পাইপলাইনে স্বয়ংক্রিয় যাচাইকরণ ব্যবস্থা যুক্ত করা। একটি “primary” উৎস আসলে লোড হচ্ছে কি না তা যাচাই করা একটি নির্ভরযোগ্য উত্তর এবং একটি নীরব ভুল তথ্যের ফাঁদের মধ্যে পার্থক্য তৈরি করতে পারে।