AI গবেষকরা প্রায় ১৫০টি স্বল্প-ট্রাফিকযুক্ত নিউজ সাইটের একটি নেটওয়ার্কের সমন্বিত প্রচেষ্টা উন্মোচন করেছেন, যা লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) ট্রেনিং ডেটাকে ক্রেমলিন-পন্থী আখ্যান (pro-Kremlin narratives) দিয়ে ভাসিয়ে দিচ্ছে। 'প্রাভদা নেটওয়ার্ক' (Pravda network) নামে পরিচিত এই সাইটগুলো বছরে প্রায় ৩০ লক্ষ নিবন্ধ প্রকাশ করে এবং তাদের কন্টেন্ট এখন Common Crawl ডেটাসেটে দেখা যাচ্ছে, যা অনেক বাণিজ্যিক AI সিস্টেমকে চালিত করে।

কীভাবে এই ডিসইনফরমেশন পাইপলাইন কাজ করে

Pravda নেটওয়ার্কের লক্ষ্য মানুষের কাছে পৌঁছানো নয়। পরিবর্তে, প্রতিটি সাইট একটি নির্দিষ্ট সেট অফ টকিং পয়েন্ট পুনরাবৃত্তি করে এমন সব নিবন্ধ প্রকাশ করে। সার্চ ইঞ্জিন এবং ওয়েব ক্রলারগুলো যে কিওয়ার্ডগুলোকে অগ্রাধিকার দেয়, সেই কিওয়ার্ডগুলো দিয়ে টেক্সট ঠাসা করার মাধ্যমে সাইটগুলো নিশ্চিত করে যে ডেটা সংগ্রহের সময় একটি AI মডেলের সামনে এগুলো আসার সম্ভাবনা বেড়ে যায়।

দুটি পয়জনিং মেকানিজম এখানে কাজ করছে:

  • Retrieval-time poisoning – যখন একটি AI অ্যাসিস্ট্যান্ট ওয়েব থেকে লাইভ তথ্য সংগ্রহ করে, তখন এটি বৈধ উৎসের পাশাপাশি একটি Pravda নিবন্ধকেও সামনে নিয়ে আসতে পারে। পরিচিত ক্ষতিকারক ডোমেইনগুলো ব্লক করলে এই ঝুঁকি কমানো সম্ভব।
  • Training-time poisoning – যদি নিবন্ধগুলো মডেল প্রি-ট্রেনিংয়ের জন্য ব্যবহৃত বিশাল কর্পোরা (bulk corpora)-তে ঢুকে পড়ে, তবে সেই মিথ্যা দাবিগুলো মডেলের অভ্যন্তরীণ জ্ঞানের অংশ হয়ে যায়। পরবর্তীতে এই ধরনের কন্টেন্ট সরিয়ে ফেলা অনেক বেশি কঠিন।

গবেষকরা ইতিমধ্যে Common Crawl-এর ভেতরে Pravda নিবন্ধগুলোর সন্ধান পেয়েছেন, যা অনেক AI মডেল প্রশিক্ষণের জন্য ব্যবহৃত একটি পাবলিক আর্কাইভ। এর মানে হলো এই পয়জনিং কেবল তাত্ত্বিক নয়; এটি ইতিমধ্যে সেই মডেলগুলোর জ্ঞানভাণ্ডারকে প্রভাবিত করেছে যেগুলোর ওপর অনেক ব্যবহারকারী আজ নির্ভর করেন।

কেন এটি গুরুত্বপূর্ণ

AI কেবল "অনেক উৎস একমত" বলছে বলেই তাকে বিশ্বাস করবেন না। আপনি যদি AI টুল তৈরি করেন, তবে পরিচিত ডিসইনফরমেশন সাইটগুলোর জন্য ব্লক লিস্ট ব্যবহার করুন। সত্যতা মাপার উপায় হিসেবে "উল্লেখনার সংখ্যা" (number of mentions) ব্যবহার করবেন না। পরিমাণের মানেই গুণমান নয়। AI আপনাকে যা বলছে তার সবকিছু যাচাই করুন, বিশেষ করে যদি তা পক্ষপাতদুষ্ট মনে হয়।

ইন্টারনেট হলো আমাদের ভবিষ্যৎ প্রযুক্তির ট্রেনিং সেট। যার একটি ওয়েবসাইট আছে, সে সহজেই আমাদের নির্ভরতা থাকা মেশিনগুলোকে পক্ষপাতদুষ্ট করার চেষ্টা করতে পারে।

ডেভেলপাররা এখন কী করতে পারেন

  • ব্লক লিস্ট রক্ষণাবেক্ষণ করুন – ক্রলিং ফিল্টারে পরিচিত ডিসইনফরমেশন ডোমেইনগুলো যুক্ত করুন; একটি ব্লক লিস্ট রিট্রিভাল-টাইম এবং ট্রেনিং-টাইম—উভয় ক্ষেত্রেই এক্সপোজার বন্ধ করে।
  • ফ্রিকোয়েন্সি হিউরিস্টিকস (frequency heuristics) নিয়ে নতুন করে ভাবুন – উল্লেখনার সংখ্যার সাথে সত্যতার সমীকরণ করা বন্ধ করুন। একটি সাধারণ ফ্রিকোয়েন্সি-ভিত্তিক মডেলে, ডজন ডজন নিম্নমানের সাইটে বারবার বলা একটি দাবি একটি নির্ভরযোগ্য উৎসের চেয়ে বেশি গুরুত্ব পেয়ে যেতে পারে।
  • প্রোভেন্যান্স চেক (provenance checks) প্রয়োগ করুন – তথ্যকে তার মূল উৎসে খুঁজে বের করুন। যদি তথ্যের সূত্রটি এমন একটি সাইটে গিয়ে শেষ হয় যার ট্রাফিক নেই বললেই চলে এবং যার প্রপাগান্ডা বা অপপ্রচারের ইতিহাস আছে, তবে আউটপুটটি পর্যালোচনার জন্য ফ্ল্যাগ করুন।
  • পোস্ট-ট্রেনিং স্যানিটাইজেশন (post-training sanitization) বাস্তবায়ন করুন – রাজনৈতিকভাবে সংবেদনশীল বিষয়গুলো নিয়ে মডেলের আউটপুটগুলোর ওপর কিউরেটেড অডিট চালান। মানুষের মাধ্যমে পর্যালোচনা করলে এমন পদ্ধতিগত পক্ষপাত ধরা সম্ভব যা স্বয়ংক্রিয় ফিল্টার মিস করতে পারে।

পাল্টা যুক্তি এবং চ্যালেঞ্জসমূহ

নিরাপত্তা এবং অন্তর্ভুক্তির (inclusivity) মধ্যে ভারসাম্য বজায় রাখা একটি অমীমাংসিত সমস্যা।

ভবিষ্যতের দিকে দৃষ্টি

Pravda নেটওয়ার্ক দেখায় কীভাবে রাষ্ট্রীয় পক্ষগুলো (state actors) এআই-এর পরবর্তী প্রজন্মকে প্রভাবিত করতে উন্মুক্ত ওয়েবকে অস্ত্র হিসেবে ব্যবহার করতে পারে।

মূল কথা: AI-এর অখণ্ডতা নির্ভর করে এটি যে ডেটা থেকে শেখে তার পরিচ্ছন্নতার ওপর। স্বল্প-ট্রাফিকযুক্ত এবং অপপ্রচারমূলক সাইটের একটি সমন্বিত জোয়ার ইতিমধ্যে আমাদের বিশ্বস্ত মডেলগুলোর মধ্যে মিথ্যা তথ্য গেঁথে দিতে পারে। ডেভেলপারদের অবশ্যই সোর্স রেপুটেশন বা উৎসের নির্ভরযোগ্যতাকে একটি প্রাথমিক বিষয় হিসেবে বিবেচনা করতে হবে, কোনো অবহেলিত বিষয় হিসেবে নয়; যাতে আমরা যে মেশিনগুলো তৈরি করি সেগুলো অজান্তেই অপপ্রচারের মুখপাত্র হয়ে না ওঠে।