44,9% dei primi 107 siti web blocca almeno un crawler AI, secondo un'analisi del 2026. Il rischio non è solo la perdita di traffico; è la potenziale scomparsa dai nuovi canali attraverso i quali gli utenti ottengono informazioni oggi.

L'entità del problema

Robots.txt è sempre stato il file di riferimento per indicare a Googlebot e ad altri crawler di ricerca tradizionali quali pagine indicizzare. Un file simile controlla ora i crawler AI: agenti software che leggono i contenuti web per generare risposte per strumenti come ChatGPT, Claude e Perplexity. Lo studio ha rilevato che il 44,9% dei siti esaminati ha deliberatamente disabilitato almeno uno di questi bot. GPTBot, il crawler utilizzato dai modelli di OpenAI, è in cima alla lista degli agenti bloccati.

Una quota sorprendente di blocchi deriva da impostazioni con un solo clic in servizi come Cloudflare, dove i proprietari dei siti potrebbero negare involontariamente l'accesso all'AI nel tentativo di rafforzare la sicurezza.

Cosa significa realmente "indicizzabilità AI"

L'indicizzabilità è la capacità di un bot di recuperare una pagina. Per l'AI, l'indicizzabilità determina se un modello può estrarre i fatti più recenti su un marchio, un prodotto o un servizio quando un utente pone una domanda. Se un sito non è indicizzabile, l'AI non ha una fonte da citare e il marchio scompare dal feed delle risposte.

Il vecchio manuale della SEO si concentrava sul fatto che Googlebot indicizzasse le pagine affinché potessero essere classificate in un elenco di link. L'indicizzabilità AI sposta l'obiettivo: invece di un posizionamento, il risultato è un suggerimento all'interno di una risposta conversazionale.

Bot di addestramento vs bot di risposta

Non tutti i crawler AI servono allo stesso scopo.

  1. Bot di addestramento – gli esempi includono GPTBot, ClaudeBot e Google-Extended. Estraggono enormi porzioni del web per alimentare i massicci dataset che alimentano i modelli linguistici sottostanti. I proprietari dei siti possono bloccarli se desiderano escludere i contenuti proprietari dall'addestramento dei futuri modelli.
  2. Bot di risposta – gli esempi includono OAI-SearchBot, Claude-SearchBot e PerplexityBot. Questi operano in tempo reale, estraendo frammenti specifici per rispondere alla query di un utente. Bloccare un bot di risposta significa che il contenuto del sito non verrà mai presentato in una risposta conversazionale, anche se la stessa pagina è ancora indicizzata dai motori di ricerca tradizionali.

L'analisi mostra che molti siti stanno confondendo le due tipologie, finendo per adottare una regola generica di "blocca tutta l'AI" che danneggia la visibilità senza proteggere alcuna vera proprietà intellettuale (IP).

Perché vengono bloccati i bot sbagliati

Alcuni fattori spiegano questa errata configurazione:

  • Impostazioni di sicurezza predefinite – le piattaforme che offrono un unico interruttore "blocca AI" spesso lo applicano a ogni crawler noto, inclusi i bot di risposta che il sito vorrebbe effettivamente raggiungere.
  • Mancanza di consapevolezza – la maggior parte dei webmaster conosce robots.txt per Googlebot, ma le nuove direttive specifiche per l'AI sono meno familiari.
  • Timore dell'uso improprio dei dati – i proprietari temono che i bot di addestramento incorporino i loro contenuti nei futuri modelli, una preoccupazione legittima che non si applica ai bot di risposta, che recuperano i dati solo su richiesta.

Come trovare il giusto equilibrio

  1. Modificare robots.txt – consentire esplicitamente i bot di risposta che si desidera raggiungere. Una riga come User-agent: OAI-SearchBot\nAllow: / permette al bot di risposta di OpenAI di scansionare l'intero sito, mantenendo comunque bloccati gli altri agenti.
  2. Decidere per i dati di addestramento – se la protezione del materiale proprietario è una priorità, mantenere una regola Disallow per GPTBot, ClaudeBot e agenti di addestramento simili.
  3. Adottare llms.txt – questo standard emergente consente agli editori di evidenziare le pagine più importanti per il consumo da parte dell'AI, accelerando il processo di scoperta per i bot di risposta.
  4. Audit delle impostazioni di terze parti – controllare qualsiasi configurazione di sicurezza o CDN che potrebbe aver bloccato automaticamente i crawler AI e regolare manualmente le regole.

Il compromesso da valutare

Consentire i bot di risposta migliora l'esposizione del marchio nelle conversazioni guidate dall'AI, ma significa anche che il contenuto può essere riprodotto parola per parola nelle risposte rivolte all'utente. Bloccare i bot di addestramento protegge i dati dall'essere incorporati nei futuri pesi dei modelli, ma non impedisce ai bot di risposta di recuperare le stesse pagine pubbliche.

Se il valore fondamentale di un'azienda è il controllo rigoroso della propria IP, un blocco più stretto può essere giustificato, ma il costo è una presenza ridotta nei canali in cui molti utenti iniziano ora le loro ricerche. Al contrario, un sito di e-commerce che vive della scoperta di prodotti trarrà probabilmente più beneficio dall'essere indicizzabile dall'AI che dal rischio marginale di pochi frammenti citati.

Cosa osservare in seguito

  • Adozione di llms.txt – man mano che lo standard acquista terreno, gli strumenti che lo analizzano potrebbero diventare il modo principale con cui i bot di risposta AI individuano contenuti di alto valore.
  • Cambiamenti nelle policy dei fornitori di AI – OpenAI, Anthropic e altri potrebbero affinare le proprie policy relative ai crawler, offrendo potenzialmente meccanismi di opt-in più granulari.
  • Orientamenti legali sui dati di addestramento dell'AI – i dibattiti in corso sull'uso di contenuti pubblici raccolti tramite scraping per l'addestramento dei modelli potrebbero influenzare il numero di siti che scelgono di bloccare direttamente i bot di addestramento.

Il punto fondamentale: se un brand vuole rimanere visibile laddove gli utenti pongono sempre più domande invece di digitare parole chiave, deve rendere il proprio sito scansionabile dalle AI. Il primo passo è una semplice modifica al file robots.txt; il secondo è una decisione chiara su quali dati si è disposti a condividere con la prossima generazione di ricerca. Ignorare la distinzione tra bot di addestramento e bot di risposta potrebbe rendere un'azienda invisibile proprio in quello spazio che sta rimodellando il modo in cui si trova l'informazione.