44.9% מ-107 האתרים המובילים חוסמים לפחות סורק AI אחד, על פי ניתוח משנת 2026. הסיכון אינו רק אובדן תנועה; מדובר בסיכון להיעלמות פוטנציאלית מהערוצים החדשים שבהם משתמשים מקבלים מידע כיום.
היקף הבעיה
קובץ robots.txt היה הקובץ המרכזי להנחיית Googlebot וסורקי חיפוש מסורתיים אחרים אילו דפים לאנדקס. קובץ דומה שולט כעת בסורקי AI — סוכנים תוכנתיים הקוראים תוכן אינטרנטי כדי ליצור תשובות עבור כלים כמו ChatGPT, Claude ו-Perplexity. המחקר מצא כי ב-44.9% מהאתרים שנבדקו נאסר במכוון השימוש בלפחות אחד מהבוטים הללו. GPTBot, הסורק המשמש את המודלים של OpenAI, בראש רשימת הסוכנים החסומים.
חלק מפתיע מהחסימות נובע מהגדרות של "קליק אחד" בשירותים כמו Cloudflare, שבהם בעלי אתרים עלולים לחסום גישת AI בטעות בזמן שהם מנסים להדק את האבטחה.
מה המשמעות האמיתית של "יכולת סריקה ב-AI"
יכולת סריקה (Crawlability) היא היכולת של בוט למשוך דף. עבור AI, יכולת הסריקה קובעת האם מודל יכול לשלוף את העובדות העדכניות ביותר על מותג, מוצר או שירות כאשר משתמש שואל שאלה. אם אתר אינו ניתן לסריקה, ל-AI אין מקור לצטט, והמותג נעלם מזרם התשובות.
אסטרטגיית ה-SEO הישנה התמקדה בסריקת דפים על ידי Googlebot כדי שיוכלו להיות מדורגים ברשימת קישורים. יכולת סריקה ב-AI משנה את המטרה: במקום דירוג, התוצאה היא המלצה בתוך תשובה שיחתית.
בוטים לאימון לעומת בוטים לתשובות
לא כל סורקי ה-AI משרתים את אותה מטרה.
- בוטים לאימון (Training bots) – דוגמאות כוללות את GPTBot, ClaudeBot ו-Google-Extended. הם אוספים (scrape) שטחים נרחבים מהרשת כדי להזין את מאגרי הנתונים העצומים המניעים את מודלי השפה שבבסיסם. בעלי אתרים יכולים לחסום אותם אם הם רוצים למנוע מתוכן קנייני להיכנס לאימון מודלים עתידיים.
- בוטים לתשובות (Answer bots) – דוגמאות כוללות את OAI-SearchBot, Claude-SearchBot ו-PerplexityBot. אלו פועלים בזמן אמת, ושולפים קטעים (snippets) ספציפיים כדי לענות על שאילתת משתמש. חסימת בוט תשובות פירושה שתוכן האתר לעולם לא יופיע בתגובה שיחתית, גם אם אותו דף עדיין מאונדקס על ידי מנועי חיפוש מסורתיים.
הניתוח מראה כי אתרים רבים מערבבים בין השניים, מה שמוביל לחוק "חסום את כל ה-AI" גורף, הפוגע בנראות מבלי להגן על קניין רוחני (IP) אמיתי.
מדוע נחסמים הבוטים הלא נכונים
מספר גורמים מסבירים את השגיאה בהגדרות:
- הגדרות אבטחה מוגדרות מראש (Default security presets) – פלטפורמות המציעות כפתור "חסום AI" יחיד חלות אותו לעיתים קרובות על כל סורק ידוע, כולל בוטים לתשובות שהאתר למעשה היה רוצה שיגיע אליו.
- חוסר מודעות – רוב מנהלי האתרים מכירים את robots.txt עבור Googlebot, אך ההנחיות החדשות יותר הייחודיות ל-AI פחות מוכרות.
- חשש משימוש לרעה בנתונים – בעלים חוששים שבוטים לאימון ישלבו את התוכן שלהם במודלים עתידיים, חשש לגיטימי שאינו חל על בוטים לתשובות, אשר רק שולפים נתונים לפי דרישה.
איך להשיג את האיזון הנכון
- עריכת robots.txt – אפשרו במפורש את הבוטים לתשובות שתרצו שיגיעו אליהם. שורה כגון
User-agent: OAI-SearchBot\nAllow: /תאפשר לבוט התשובות של OpenAI לסרוק את כל האתר תוך המשך חסימת סוכנים אחרים. - קבלת החלטה לגבי נתוני אימון – אם הגנה על חומר קנייני היא בעדיפות עליונה, שמרו על כלל
Disallowעבור GPTBot, ClaudeBot וסוכני אימון דומים. - אימוץ תקן llms.txt – תקן מתהווה זה מאפשר למוציאים לאור להדגיש את הדפים החשובים ביותר לצריכה על ידי AI, מה שמאיץ את תהליך הגילוי עבור בוטים לתשובות.
- ביצוע ביקורת על הגדרות צד שלישי – בדקו כל הגדרת אבטחה או CDN שעלולה לחסום אוטומטית סורקי AI, והתאימו את הכללים באופן ידני.
הפשרה שעליכם לשקול
מתן אפשרות לבוטים לתשובות משפר את החשיפה למותג בשיחות מונעות AI, אך פירושו גם שהתוכן יכול להיות משוכפל מילה במילה בתשובות המופנות למשתמש. חסימת בוטים לאימון מגנה על הנתונים מפני הטמעה במשקולות המודל העתידיות, אך היא אינה מונעת מבוטים לתשובות לשלוף את אותם דפים ציבוריים.
אם הערך המרכזי של חברה הוא שליטה קפדנית בקניין הרוחני שלה, חסימה הדוקה יותר עשויה להיות מוצדקת, אך המחיר הוא נוכחות מופחתת בערוצים שבהם משתמשים רבים מתחילים כיום את המחקר שלהם. לעומת זאת, אתר מסחר אלקטרוני (e-commerce) המשגשל בזכות גילוי מוצרים יפיק ככל הנראה תועלת רבה יותר מכך שהוא ניתן לסריקה ב-AI מאשר מהסיכון השולי של כמה קטעי ציטוט.
מה כדאי לעקוב אחריו בהמשך
- אימוץ של llms.txt – ככל שהתקן צובר תאוצה, כלים שמנתחים אותו עשויים להפוך לדרך העיקרית שבה בוטים למתן תשובות מבוססי AI מאתרים תוכן בעל ערך גבוה.
- שינויי מדיניות מצד ספקי AI – OpenAI, Anthropic ואחרים עשויים לדייק את מדיניות הסורקים (crawlers) שלהם, וייתכן שיציעו מנגנוני opt-in מפורטים יותר.
- הנחיות משפטיות בנוגע לנתוני אימון של AI – ויכוחים מתמשכים בשאלה האם ניתן להשתמש בתוכן ציבורי שנאסף (scraped) לצורך אימון מודלים עשויים להשפיע על מספר האתרים שיבחרו לחסום בוטים של אימון באופן מוחלט.
השורה התחתונה: אם מותג רוצה להישאר נראה במקום שבו משתמשים שואלים שאלות יותר ויותר במקום להקליד מילות מפתח, עליו להפוך את האתר שלו לניתן לסריקה על ידי AI. הצעד הראשון הוא עריכה פשוטה של robots.txt; השני הוא החלטה ברורה לגבי אילו נתונים הוא מרגיש בנוח לשתף עם הדור הבא של החיפוש. התעלמות מההבחנה בין בוטים של אימון לבין בוטים של תשובות עלולה להשאיר חברה בלתי נראית בדיוק במרחב שמעצב מחדש את הדרך שבה מוצאים מידע.
