طبق تحلیل سال ۲۰۲۶، ۴۴.۹٪ از ۱۰۷ وبسایت برتر، حداقل یک خزنده (crawler) هوش مصنوعی را مسدود میکنند. خطر تنها از دست دادن ترافیک نیست؛ بلکه احتمال ناپدید شدن از کانالهای جدیدی است که کاربران امروزه اطلاعات خود را از آنها دریافت میکنند.
دامنه مشکل
فایل robots.txt همواره فایل اصلی برای اطلاعرسانی به Googlebot و سایر خزندههای سنتی جستجو بوده تا بدانند کدام صفحات باید ایندکس شوند. اکنون فایل مشابهی خزندههای هوش مصنوعی را کنترل میکند—عوامل نرمافزاری که محتوای وب را برای تولید پاسخ در ابزارهایی مانند ChatGPT، Claude و Perplexity میخوانند. این مطالعه نشان داد که ۴۴.۹٪ از سایتهای بررسیشده، عمداً دسترسی حداقل یکی از این رباتها را منع کردهاند. GPTBot، خزنده مورد استفاده مدلهای OpenAI، در صدر لیست عوامل مسدودشده قرار دارد.
بخش غافلگیرکنندهای از این مسدودسازیها ناشی از تنظیمات تککلیکی در سرویسهایی مانند Cloudflare است، جایی که مالکان سایت ممکن است در تلاش برای افزایش امنیت، بهطور ناخواسته دسترسی هوش مصنوعی را قطع کنند.
معنای واقعی «قابلیت خزیدن هوش مصنوعی» (AI crawlability) چیست
قابلیت خزیدن (Crawlability) به معنای توانایی یک ربات برای واکشی (fetch) یک صفحه است. برای هوش مصنوعی، این قابلیت تعیین میکند که آیا یک مدل میتواند هنگام پرسش کاربر، آخرین حقایق مربوط به یک برند، محصول یا خدمت را استخراج کند یا خیر. اگر سایتی قابلیت خزیدن نداشته باشد، هوش مصنوعی منبعی برای ارجاع دادن نخواهد داشت و برند از فید پاسخها ناپدید میشود.
استراتژیهای قدیمی SEO بر خزیدن صفحات توسط Googlebot تمرکز داشتند تا بتوانند در فهرستی از لینکها رتبه بگیرند. اما قابلیت خزیدن هوش مصنوعی هدف را تغییر میدهد: به جای رتبهبندی، نتیجه نهایی یک «پیشنهاد» در دل یک پاسخ گفتگومحور است.
رباتهای آموزشی در مقابل رباتهای پاسخگو
همه خزندههای هوش مصنوعی هدف یکسانی ندارند.
- رباتهای آموزشی (Training bots) – از جمله نمونهها میتوان به GPTBot، ClaudeBot و Google-Extended اشاره کرد. آنها بخشهای وسیعی از وب را برای تغذیه مجموعهدادههای عظیمی که مدلهای زبانی زیربنایی را قدرت میبخشند، استخراج (scrape) میکنند. مالکان سایت میتوانند در صورت تمایل به دور نگه داشتن محتوای اختصاصی خود از آموزش مدلهای آینده، این رباتها را مسدود کنند.
- رباتهای پاسخگو (Answer bots) – از جمله نمونهها میتوان به OAI-SearchBot، Claude-SearchBot و PerplexityBot اشاره کرد. این رباتها بهصورت آنی (real time) عمل کرده و قطعات مشخصی از اطلاعات را برای پاسخ به پرسش کاربر استخراج میکنند. مسدود کردن یک ربات پاسخگو به این معناست که محتوای سایت هرگز در یک پاسخ گفتگومحور ظاهر نخواهد شد، حتی اگر همان صفحه همچنان توسط موتورهای جستجوی سنتی ایندکس شده باشد.
این تحلیل نشان میدهد که بسیاری از سایتها این دو را با هم اشتباه میگیرند و در نهایت به یک قانون کلی «مسدودسازی همه هوش مصنوعیها» روی میآورند که بدون محافظت از مالکیت معنوی (IP) واقعی، باعث آسیب به دیده شدن (visibility) سایت میشود.
چرا رباتهای اشتباه مسدود میشوند
چند عامل این پیکربندی اشتباه را توضیح میدهند:
- تنظیمات پیشفرض امنیتی – پلتفرمهایی که یک گزینه تککلیکی «مسدودسازی هوش مصنوعی» ارائه میدهند، اغلب آن را برای هر خزنده شناختهشدهای اعمال میکنند، از جمله رباتهای پاسخگویی که سایت در واقع تمایل دارد به آنها دسترسی داشته باشد.
- عدم آگاهی – اکثر مدیران وب با
robots.txtبرای Googlebot آشنا هستند، اما دستورالعملهای جدیدتر و مخصوص هوش مصنوعی کمتر شناخته شدهاند. - ترس از سوءاستفاده از دادهها – مالکان نگران هستند که رباتهای آموزشی محتوای آنها را در مدلهای آینده ادغام کنند؛ این یک نگرانی مشروع است، اما در مورد رباتهای پاسخگو که فقط دادهها را در صورت درخواست واکشی میکنند، صدق نمیکند.
چگونه تعادل مناسب را برقرار کنیم
- ویرایش robots.txt – بهطور صریح به رباتهای پاسخگویی که میخواهید به آنها دسترسی داشته باشید، اجازه دهید. خطی مانند
User-agent: OAI-SearchBot\nAllow: /به ربات پاسخگوی OpenAI اجازه میدهد کل سایت را بررسی کند، در حالی که سایر عوامل همچنان مسدود باقی میمانند. - تصمیمگیری درباره دادههای آموزشی – اگر محافظت از مطالب اختصاصی یک اولویت است، قانون
Disallowرا برای GPTBot، ClaudeBot و عوامل آموزشی مشابه حفظ کنید. - بهکارگیری llms.txt – این استاندارد نوظهور به ناشران اجازه میدهد مهمترین صفحات را برای مصرف هوش مصنوعی مشخص کنند و فرآیند کشف توسط رباتهای پاسخگو را سرعت ببخشند.
- بازبینی تنظیمات شخص ثالث – هرگونه پیکربندی امنیتی یا CDN را که ممکن است خزندههای هوش مصنوعی را بهطور خودکار مسدود کرده باشد، بررسی کرده و قوانین را بهصورت دستی تنظیم کنید.
موازنهای که باید در نظر بگیرید
اجازه دادن به رباتهای پاسخگو، میزان مواجهه با برند را در گفتگوهای مبتنی بر هوش مصنوعی بهبود میبخشد، اما این بدان معناست که محتوا میتواند عیناً در پاسخهای رو به کاربر بازتولید شود. مسدود کردن رباتهای آموزشی از ورود دادهها به وزنهای مدلهای آینده جلوگیری میکند، اما مانع از آن نمیشود که رباتهای پاسخگو همان صفحات عمومی را استخراج کنند.
اگر ارزش اصلی یک شرکت، کنترل دقیق بر مالکیت معنوی (IP) خود باشد، مسدودسازی شدیدتر ممکن است توجیهپذیر باشد، اما هزینه آن کاهش حضور در کانالهایی است که امروزه بسیاری از کاربران تحقیقات خود را از آنها شروع میکنند. برعکس، یک سایت تجارت الکترونیک که بر پایه کشف محصول شکوفا میشود، احتمالاً از قابلیت خزیدن هوش مصنوعی بیشتر از ریسک ناچیزِ نقلقول شدن چند قطعه از محتوای خود سود خواهد برد.
آنچه در آینده باید زیر نظر داشت
- پذیرش llms.txt – با افزایش محبوبیت این استاندارد، ابزارهایی که آن را تجزیه میکنند، میتوانند به روش اصلی باتهای پاسخدهنده هوش مصنوعی برای یافتن محتوای باارزش تبدیل شوند.
- تغییر سیاستهای ارائهدهندگان هوش مصنوعی – OpenAI، Anthropic و سایرین ممکن است سیاستهای خزنده (crawler) خود را اصلاح کنند و احتمالاً مکانیسمهای انتخاب (opt-in) دقیقتری را ارائه دهند.
- راهنماییهای حقوقی در مورد دادههای آموزشی هوش مصنوعی – بحثهای جاری در مورد اینکه آیا محتوای عمومی استخراجشده (scraped) میتواند برای آموزش مدلها استفاده شود یا خیر، میتواند بر تعداد سایتهایی که تصمیم میگیرند باتهای آموزشی را بهطور کامل مسدود کنند، تأثیر بگذارد.
خلاصه کلام: اگر برندی میخواهد در جایی که کاربران بهجای تایپ کلمات کلیدی، بهطور فزایندهای سوال میپرسند، قابل مشاهده باقی بماند، باید سایت خود را برای خزش توسط هوش مصنوعی (AI-crawlable) آماده کند. اولین قدم، یک ویرایش ساده در robots.txt است؛ قدم دوم، تصمیمگیری شفاف در مورد دادههایی است که مایل است با نسل بعدی جستجو به اشتراک بگذارد. نادیده گرفتن تفاوت بین باتهای آموزشی و باتهای پاسخدهنده میتواند یک شرکت را در همان فضایی که در حال بازتعریف نحوه یافتن اطلاعات است، نامرئی سازد.
