2026 ஆய்வின்படி, முன்னணியில் உள்ள 107 இணையதளங்களில் 44.9% குறைந்தது ஒரு AI crawler-ஐத் தடுக்கின்றன. இது வெறும் போக்குவரத்து (traffic) இழப்பு மட்டுமல்ல; பயனர்கள் இன்று தகவல்களைப் பெறும் புதிய தளங்களில் இருந்து காணாமல் போகும் அபாயமும் கூட.
பிரச்சனையின் அளவு
Googlebot மற்றும் பிற பாரம்பரிய தேடல் crawlers எந்தப் பக்கங்களைத் தரம் பிரிக்க வேண்டும் (index) என்று சொல்வதற்கு robots.txt ஒரு முக்கியக் கோப்பாக இருந்து வருகிறது. இப்போது இதே போன்ற ஒரு கோப்பு AI crawlers-ஐக் கட்டுப்படுத்துகிறது—இவை ChatGPT, Claude மற்றும் Perplexity போன்ற கருவிகளுக்குப் பதில்களை உருவாக்க இணைய உள்ளடக்கத்தைப் படிக்கும் மென்பொருள் முகவர்கள் (software agents) ஆகும். ஆய்வு செய்யப்பட்ட தளங்களில் 44.9% தளங்கள் வேண்டுமென்றே இந்த போட்களில் (bots) ஒன்றையாவது தடை செய்துள்ளன என்பதைக் கண்டறிந்துள்ளது. GPTBot, OpenAI-ன் மாடல்களால் பயன்படுத்தப்படும் crawler, தடுக்கப்பட்ட முகவர்களின் பட்டியலில் முதலிடத்தில் உள்ளது.
Cloudflare போன்ற சேவைகளில் உள்ள 'ஒரே கிளிக்கில்' (one-click) மாற்றங்கள் மூலம் எதிர்பாராத விதமாக AI அணுகல் மறுக்கப்படுவதும் ஒரு ஆச்சரியமான விஷயமாகும். இணையதள உரிமையாளர்கள் பாதுகாப்பை அதிகரிக்க முயலும்போது இது தெரியாமல் நடக்கலாம்.
"AI crawlability" என்பதன் உண்மையான பொருள் என்ன?
Crawlability என்பது ஒரு போட் (bot) ஒரு பக்கத்தைப் பெறுவதற்கான (fetch) திறன் ஆகும். AI-ஐப் பொறுத்தவரை, ஒரு பயனர் கேள்வி கேட்கும்போது ஒரு பிராண்ட், தயாரிப்பு அல்லது சேவையைப் பற்றிய சமீபத்திய உண்மைகளை ஒரு மாடல் எடுக்க முடியுமா என்பதை crawlability தீர்மானிக்கிறது. ஒரு தளம் crawl செய்ய முடியாத நிலையில் இருந்தால், AI-யிடம் மேற்கோள் காட்ட எந்த ஆதாரமும் இருக்காது, இதனால் அந்த பிராண்ட் பதில்களின் பட்டியலில் இருந்து மறைந்துவிடும்.
பழைய SEO முறையானது, Googlebot பக்கங்களை crawl செய்து அவற்றை இணைப்புகளின் பட்டியலில் (list of links) தரவரிசைப்படுத்துவதில் கவனம் செலுத்தியது. AI crawlability இலக்கை மாற்றுகிறது: தரவரிசைக்கு பதிலாக, உரையாடல் ரீதியான பதிலுக்குள் ஒரு பரிந்துரையாக (recommendation) முடிவுகள் அமையும்.
பயிற்சி போட்கள் (Training bots) vs. பதில் போட்கள் (Answer bots)
எல்லா AI crawlers-களும் ஒரே நோக்கத்திற்காகச் செயல்படுவதில்லை.
- Training bots – GPTBot, ClaudeBot மற்றும் Google-Extended ஆகியவை இதற்கு உதாரணங்கள். இவை அடிப்படை மொழி மாதிரிகளுக்கு (language models) தேவையான பிரம்மாண்டமான தரவுத் தொகுப்புகளை (datasets) உருவாக்க இணையத்தின் பெரும் பகுதிகளைத் திரட்டுகின்றன (scrape). எதிர்கால மாடல் பயிற்சிகளில் தங்கள் பிரத்யேக உள்ளடக்கத்தைப் பயன்படுத்தக் கூடாது என்று விரும்பினால், இணையதள உரிமையாளர்கள் இவற்றைத் தடுக்கலாம்.
- Answer bots – OAI-SearchBot, Claude-SearchBot மற்றும் PerplexityBot ஆகியவை இதற்கு உதாரணங்கள். இவை நிகழ்நேரத்தில் (real time) செயல்பட்டு, பயனரின் கேள்விக்கு பதிலளிக்கத் தேவையான குறிப்பிட்டத் தகவல்களைப் பெறுகின்றன. ஒரு answer bot-ஐத் தடுப்பது என்பது, அதே பக்கம் பாரம்பரிய தேடுபொறிகளால் (search engines) தரம் பிரிக்கப்பட்டாலும், உரையாடல் ரீதியான பதில்களில் அந்தத் தளத்தின் உள்ளடக்கம் ஒருபோதும் வெளிப்படாது என்று அர்த்தம்.
பல தளங்கள் இவ்விரண்டையும் குழப்பிக் கொள்வதையும், இதனால் உண்மையான அறிவுசார் சொத்துக்களை (IP) பாதுகாக்காமல், அனைத்து AI-களையும் தடுக்கும் பொதுவான விதியைப் பின்பற்றித் தங்கள் பார்வைத்திறனை (visibility) இழப்பதையும் இந்த ஆய்வு காட்டுகிறது.
ஏன் தவறான போட்கள் தடுக்கப்படுகின்றன?
தவறான அமைப்புகளுக்கு (misconfiguration) சில காரணங்கள் உள்ளன:
- Default security presets – "AI-ஐத் தடு" (block AI) என்ற ஒற்றை பொத்தானை வழங்கும் தளங்கள், பெரும்பாலும் answer bots உட்பட அனைத்துத் தெரிந்த crawlers-களையும் ஒரே நேரத்தில் தடுத்துவிடுகின்றன.
- விழிப்புணர்வு இல்லாமை – பெரும்பாலான இணைய நிர்வாகிகளுக்கு (webmasters) Googlebot-க்கான robots.txt பற்றித் தெரியும், ஆனால் புதிய AI-தனித்துவமான வழிமுறைகள் (directives) அவர்களுக்குப் பழகியவை அல்ல.
- தரவுத் தவறாகப் பயன்படுத்தப்படும் என்ற பயம் – பயிற்சி போட்கள் தங்கள் உள்ளடக்கத்தை எதிர்கால மாடல்களில் இணைத்துவிடுமோ என்று உரிமையாளர்கள் கவலைப்படுகிறார்கள். இது ஒரு நியாயமான கவலைதான், ஆனால் தேவைப்படும்போது மட்டும் தரவைப் பெறும் answer bots-களுக்கு இது பொருந்தாது.
சரியான சமநிலையை எவ்வாறு பெறுவது?
- robots.txt-ஐத் திருத்துங்கள் – நீங்கள் தொடர்பு கொள்ள விரும்பும் answer bots-களைத் தெளிவாக அனுமதிப்பீர்கள்.
User-agent: OAI-SearchBot\nAllow: /போன்ற ஒரு வரி, மற்ற முகவர்களைத் தடுத்தவாறே OpenAI answer bot முழுத் தளத்தையும் crawl செய்ய அனுமதிக்கும். - பயிற்சித் தரவு குறித்துத் தீர்மானியுங்கள் – உங்கள் பிரத்யேகப் பொருட்களைப் பாதுகாப்பதே முன்னுரிமை என்றால், GPTBot, ClaudeBot மற்றும் அது போன்ற பயிற்சி முகவர்களுக்கு
Disallowவிதியைப் பயன்படுத்துங்கள். - llms.txt-ஐப் பின்பற்றுங்கள் – இந்த வளர்ந்து வரும் தரநிலை, AI பயன்பாட்டிற்காக மிக முக்கியமான பக்கங்களை வெளியிடுபவர்கள் முன்னிலைப்படுத்த உதவுகிறது, இது answer bots தகவல்களைக் கண்டறியும் வேகத்தை அதிகரிக்கிறது.
- மூன்றாம் தரப்பு அமைப்புகளைச் சரிபார்க்கவும் – AI crawlers-களைத் தானாகத் தடுத்திருக்கக்கூடிய பாதுகாப்பு அல்லது CDN அமைப்புகளை ஆய்வு செய்து, விதிகளைத் திருத்திக் கொள்ளுங்கள்.
நீங்கள் கவனிக்க வேண்டிய சமநிலை (Trade-off)
Answer bots-களை அனுமதிப்பது AI உரையாடல்களில் பிராண்டின் வெளிப்பாட்டை (exposure) மேம்படுத்துகிறது, ஆனால் பயனர்களுக்கு வழங்கப்படும் பதில்களில் உள்ளடக்கம் அப்படியே (verbatim) பிரதிபலிக்கக்கூடும் என்பதையும் இது குறிக்கிறது. பயிற்சி போட்களைத் தடுப்பது, எதிர்கால மாடல் எடைகளில் (model weights) தரவு சேமிக்கப்படுவதிலிருந்து பாதுகாக்கிறது, ஆனால் அது answer bots பொதுவான பக்கங்களைப் பெறுவதைத் தடுப்பதில்லை.
ஒரு நிறுவனத்தின் முக்கிய மதிப்பு அதன் அறிவுசார் சொத்துக்களின் (IP) மீதான கடுமையான கட்டுப்பாடாக இருந்தால், கடுமையானத் தடை நியாயமானதாக இருக்கலாம், ஆனால் அதன் விலை, இன்று பல பயனர்கள் தங்கள் ஆராய்ச்சியைத் தொடங்கும் தளங்களில் நிறுவனத்தின் இருப்பு குறைவதாகும். மாறாக, தயாரிப்புகளைக் கண்டறிவதில் (product discovery) சிறந்து விளங்கும் ஒரு இ-காமர்ஸ் தளம், சில மேற்கோள்கள் காட்டப்படும் சிறிய அபாயத்தை விட, AI-களால் கண்டறியப்படுவதன் மூலம் அதிகப் பலனைப் பெறும்.
அடுத்து எதைக் கவனிக்க வேண்டும்
- llms.txt-ன் பயன்பாடு – இந்தத் தரநிலை பிரபலமடையும் போது, அதை பகுப்பாய்வு செய்யும் கருவிகள் AI பதில் பாட்கள் (answer bots) மதிப்புமிக்க உள்ளடக்கத்தைக் கண்டறியும் முதன்மையான வழியாக மாறக்கூடும்.
- AI வழங்குநர்களிடமிருந்து கொள்கை மாற்றங்கள் – OpenAI, Anthropic மற்றும் பிற நிறுவனங்கள் தங்கள் க்ராவலர் (crawler) கொள்கைகளை மேம்படுத்தலாம், மேலும் நுணுக்கமான விருப்பத்தேர்வு (opt-in) வழிமுறைகளை வழங்கக்கூடும்.
- AI பயிற்சித் தரவு குறித்த சட்ட வழிகாட்டுதல்கள் – பொதுவெளியில் இருந்து சேகரிக்கப்பட்ட உள்ளடக்கத்தை மாடல் பயிற்சிக்காகப் பயன்படுத்தலாமா என்பது குறித்த தொடர்ச்சியான விவாதங்கள், எத்தனை இணையதளங்கள் பயிற்சி பாட்களை (training bots) முற்றிலுமாகத் தடுக்கத் தீர்மானிக்கின்றன என்பதில் தாக்கத்தை ஏற்படுத்தக்கூடும்.
முக்கியமான விஷயம் என்னவென்றால்: பயனர்கள் முக்கியச் சொற்களைத் (keywords) தட்டச்சு செய்வதற்குப் பதிலாகக் கேள்விகளைக் கேட்கும் சூழலில், ஒரு பிராண்ட் தங்களை வெளிப்படுத்திக் கொள்ள விரும்பினால், அது தனது இணையதளத்தை AI-க்ராவல் செய்யக்கூடியதாக (AI-crawlable) மாற்ற வேண்டும். முதல் படி ஒரு எளிய robots.txt திருத்தம்; இரண்டாவது படி, அடுத்த தலைமுறைத் தேடலுடன் எந்தத் தரவைப் பகிர்ந்து கொள்ளத் தயார் என்பது குறித்த தெளிவான முடிவாகும். பயிற்சி பாட்கள் (training bots) மற்றும் பதில் பாட்களுக்கு (answer bots) இடையிலான வேறுபாட்டைப் புறக்கணிப்பது, தகவல்கள் கண்டறியப்படும் முறையை மறுசீரமைத்துக் கொண்டிருக்கும் அதே தளத்தில் ஒரு நிறுவனத்தை மறைந்து போகச் செய்துவிடும்.
