AI ஆராய்ச்சியாளர்கள் சுமார் 150 குறைந்த போக்குவரத்து கொண்ட செய்தித் தளங்களின் வலையமைப்பால், பெரிய மொழி மாதிரிகளின் (LLM) பயிற்சித் தரவுகளில் க்ரெம்ளின் ஆதரவு கதையாடல்களைத் திணிக்க ஒரு ஒருங்கிணைந்த முயற்சி மேற்கொள்ளப்படுவதைக் கண்டறிந்துள்ளனர். Pravda நெட்வொர்க் என்று அழைக்கப்படும் இந்தத் தளங்கள், ஆண்டுக்கு சுமார் முப்பத்து மூன்று மில்லியன் கட்டுரைகளை வெளியிடுகின்றன; அவற்றின் உள்ளடக்கங்கள் தற்போது பல வணிக ரீதியான AI அமைப்புகளுக்குத் தேவையான Common Crawl தரவுத்தொகுப்பில் காணப்படுகின்றன.

தவறான தகவல் பரப்பும் வழிமுறை எவ்வாறு செயல்படுகிறது

Pravda நெட்வொர்க் மனித வாசகர்களைக் கவர இலக்கு வைப்பதில்லை. மாறாக, ஒவ்வொரு தளமும் ஒரு குறுகிய அளவிலான கருத்துக்களைத் திரும்பத் திரும்பக் கூறும் கட்டுரைகளை வெளியிடுகின்றன. தேடுபொறிகள் மற்றும் இணையக் குரோலர்கள் (web crawlers) முன்னுரிமை அளிக்கும் முக்கியச் சொற்களை (keywords) உரையில் திணிப்பதன் மூலம், தரவு சேகரிப்பின் போது ஒரு AI மாதிரி அவற்றைச் சந்திக்கும் வாய்ப்பை இந்தத் தளங்கள் அதிகரிக்கின்றன.

இரண்டு நச்சுத்தன்மை வழிமுறைகள் செயல்படுகின்றன:

  • மீட்டெடுக்கும் நேரத் நச்சுத்தன்மை (Retrieval-time poisoning) – ஒரு AI உதவியாளர் இணையத்திலிருந்து நேரடித் தகவல்களைப் பெறும்போது, முறையான ஆதாரங்களுடன் ஒரு Pravda கட்டுரையும் வெளிப்படலாம். அறியப்பட்ட தீய டொமைன்களைத் தடுப்பதன் மூலம் இதைத் தவிர்க்கலாம்.
  • பயிற்சியளிக்கும் நேரத் நச்சுத்தன்மை (Training-time poisoning) – இந்தக் கட்டுரைகள் ஒரு மாதிரியைப் முன்-பயிற்சி செய்யப் பயன்படுத்தப்படும் பெருமளவிலான தரவுத் தொகுப்புகளுக்குள் நுழைந்துவிட்டால், அந்தத் தவறானக் கோரிக்கைகள் மாதிரியின் உள் அறிவின் ஒரு பகுதியாகிவிடும். அவ்வாறு நடந்த பிறகு அத்தகைய உள்ளடக்கங்களை நீக்குவது மிகவும் கடினம்.

பல AI மாதிரிகளைப் பயிற்றுவிக்கப் பயன்படுத்தப்படும் பொதுவான ஆவணக் காப்பகமான Common Crawl-க்குள் Pravda கட்டுரைகள் இருப்பதை ஆராய்ச்சியாளர்கள் ஏற்கனவே கண்டறிந்துள்ளனர். இதன் பொருள், இந்த நச்சுத்தன்மை என்பது வெறும் கற்பனையல்ல; இது இன்று பல பயனர்கள் நம்பியிருக்கும் மாதிரிகளின் அறிவுத் தளத்தை ஏற்கனவே மாற்றியமைத்துள்ளது.

இது ஏன் முக்கியமானது

"பல ஆதாரங்கள் உடன்படுகின்றன" என்று ஒரு AI கூறினால் மட்டும் அதை நம்பிவிடாதீர்கள். நீங்கள் AI கருவிகளை உருவாக்குகிறீர்கள் என்றால், அறியப்பட்ட தவறான தகவல் தளங்களுக்கான தடுப்புப் பட்டியல்களைப் (blocklists) பயன்படுத்துங்கள். உண்மையை அளவிடுவதற்கான வழியாக "குறிப்புகள் எண்ணிக்கை" (number of mentions) என்பதைப் பயன்படுத்தாதீர்கள். அளவு என்பது தரத்திற்குச் சமம் அல்ல. AI உங்களுக்குச் சொல்லும் அனைத்தையும் சரிபார்க்கவும், குறிப்பாக அது ஒருதலைப்பட்சமாகத் தோன்றினால்.

இணையம் என்பது நமது எதிர்காலத் தொழில்நுட்பத்திற்கான பயிற்சித் தொகுப்பாகும். இணையதளத்தைக் கொண்ட எவரும் நாம் நம்பியிருக்கும் இயந்திரங்களை ஒருதலைப்பட்சமாக மாற்ற முயற்சிக்கலாம்.

டெவலப்பர்கள் இப்போது என்ன செய்யலாம்

  • தடுப்புப் பட்டியல்களைப் பராமரிக்கவும் – அறியப்பட்ட தவறான தகவல் டொமைன்களை குரோலிங் (crawling) வடிகட்டிகளில் சேர்க்கவும்; ஒரு தடுப்புப் பட்டியல் மீட்டெடுக்கும் நேரம் மற்றும் பயிற்சியளிக்கும் நேரம் ஆகிய இரண்டிலும் ஏற்படும் பாதிப்புகளைத் தடுக்கும்.
  • அதிர்வெண் வழிமுறைகளை (frequency heuristics) மறுபரிசீலனை செய்யவும் – குறிப்புகளின் எண்ணிக்கையை உண்மையுடன் சமமாகப் பார்ப்பதை நிறுத்துங்கள். ஒரு சாதாரண அதிர்வெண் அடிப்படையிலான மாதிரியில், டஜன் கணக்கான குறைந்த தரமான தளங்களில் மீண்டும் மீண்டும் கூறப்படும் ஒரு கூற்று, ஒரு நம்பகமான ஆதாரத்தை விட அதிக வாக்குகள் பெறக்கூடும்.
  • மூலத் தடயச் சரிபார்ப்புகளைப் (provenance checks) பயன்படுத்தவும் – தகவலை அதன் அசல் ஆதாரத்திற்குத் திருப்புங்கள். அந்தத் தொடர் மிகக் குறைந்த போக்குவரத்து மற்றும் பிரச்சார வரலாறு கொண்ட ஒரு தளத்தில் முடிவடைந்தால், அந்த வெளியீட்டை மறுஆய்வுக்குக் கொண்டு செல்லவும்.
  • பயிற்சிக்குப் பிந்தைய தூய்மைப்படுத்துதலைச் செயல்படுத்தவும் – அரசியல் ரீதியாகத் संवेदनशील தலைப்புகளைத் தொடும் மாதிரி வெளியீடுகளின் மீது முறையான தணிக்கைகளைச் செய்யவும். தானியங்கி வடிகட்டிகள் தவறவிடும் முறையான ஒருதலைப்பட்சமான தன்மையை மனித ஆய்வாளர்களால் கண்டறிய முடியும்.

முரண்பட்ட கருத்துக்கள் மற்றும் சவால்கள்

பாதுகாப்பு மற்றும் உள்ளடக்கிய தன்மை (inclusivity) ஆகியவற்றுக்கு இடையே சமநிலையைப் பேணுவது இன்னும் ஒரு தீர்க்கப்படாத பிரச்சனையாகவே உள்ளது.

எதிர்காலத்தைப் பார்ப்போம்

அடுத்த தலைமுறை AI-ஐ வடிவமைக்க அரசு அமைப்புகள் எவ்வாறு திறந்த இணையத்தைப் (open web) ஆயுதமாகப் பயன்படுத்த முடியும் என்பதை Pravda நெட்வொர்க் காட்டுகிறது.

முக்கியக் கருத்து: AI-ன் நம்பகத்தன்மை அது கற்றுக்கொள்ளும் தரவின் தூய்மையைப் பொறுத்தே அமைகிறது. குறைந்த போக்குவரத்து கொண்ட, பிரச்சாரங்கள் நிறைந்த தளங்களின் ஒருங்கிணைந்தத் தாக்குதல், நாம் நம்பும் மாதிரிகளில் ஏற்கனவே பொய்களைப் பதியச் செய்துவிடக்கூடும். நாம் உருவாக்கும் இயந்திரங்கள் தவறான தகவல்களுக்கான அறியாமையுள்ள கருவியாக மாறிவிடாமல் இருக்க, டெவலப்பர்கள் மூலத்தின் நற்பெயரை (source reputation) ஒரு முக்கியக் கருத்தாகக் கருத வேண்டுமே தவிர, அதைத் தற்செயலான ஒன்றாகக் கருதக்கூடாது.