Impara / Glossario

robots.txt

robots.txt è un piccolo file nella radice di un sito che indica ai crawler quali parti possono richiedere.

Prima via email. Invia l’URL robots.txt e la pagina che ti preoccupa: ti indicheremo il prossimo passo pratico.

Usalo come guida per i crawler, non come interruttore di indicizzazione.

robots.txt può bloccare la scansione, ma non rimuove in modo affidabile un URL da Google se Google lo conosce già.

robots.txt è un file di testo, di solito in /robots.txt. Dice ai crawler quali percorsi possono o non possono richiedere.

I motori di ricerca di solito lo rispettano, ma non è uno strumento di privacy e non è un modo affidabile per togliere pagine dai risultati.

Per pagine da non indicizzare serve anche il metodo corretto: noindex, canonical, eliminazione, redirect, protezione con password o rimozione in Search Console secondo il caso.

Cosa può controllare robots.txt 🧭

Scansione di percorsi specifici
Regole diverse per crawler diversi con User-agent, Allow e Disallow

robots.txt appartiene alla SEO tecnica. Funziona meglio con una sitemap XML pulita, canonical corretti e pagine accessibili quando devono posizionarsi.

Un errore comune è bloccare una pagina in robots.txt e aggiungere noindex sulla stessa pagina. Se Google non può scansionarla, potrebbe non vedere mai l’istruzione noindex.

Domande frequenti su robots.txt 🙋

Torna al glossario.

Che cos’è robots.txt?

robots.txt è un file di testo che fornisce istruzioni di scansione per un sito.

robots.txt può rimuovere una pagina da Google?

Non in modo affidabile. Può bloccare la scansione, ma la rimozione dalla ricerca richiede spesso noindex, eliminazione, redirect, password o Search Console.

Devo aggiungere la sitemap in robots.txt?

Sì, è comune indicare la sitemap XML in robots.txt per aiutare i crawler a trovarla rapidamente.

robots.txt può bloccare bot malevoli?

Solo i bot che scelgono di rispettarlo. Sicurezza e abuso richiedono regole server, firewall o accesso.

Non sai se robots.txt aiuta o blocca la cosa sbagliata?

Invia l’URL robots.txt e la pagina che ti preoccupa. Possiamo verificare se il problema riguarda scansione, indicizzazione, canonical o struttura del sito.