robots.txt
robots.txt è un piccolo file nella radice di un sito che indica ai crawler quali parti possono richiedere.
Prima via email. Invia l’URL robots.txt e la pagina che ti preoccupa: ti indicheremo il prossimo passo pratico.
Usalo come guida per i crawler, non come interruttore di indicizzazione.
robots.txt può bloccare la scansione, ma non rimuove in modo affidabile un URL da Google se Google lo conosce già.
robots.txt è un file di testo, di solito in /robots.txt. Dice ai crawler quali percorsi possono o non possono richiedere.
I motori di ricerca di solito lo rispettano, ma non è uno strumento di privacy e non è un modo affidabile per togliere pagine dai risultati.
Per pagine da non indicizzare serve anche il metodo corretto: noindex, canonical, eliminazione, redirect, protezione con password o rimozione in Search Console secondo il caso.
Cosa può controllare robots.txt 🧭
- Scansione di percorsi specifici
- Scoperta della sitemap tramite una riga sitemap XML
- Regole diverse per crawler diversi con
User-agent,AlloweDisallow
robots.txt appartiene alla SEO tecnica. Funziona meglio con una sitemap XML pulita, canonical corretti e pagine accessibili quando devono posizionarsi.
Un errore comune è bloccare una pagina in robots.txt e aggiungere noindex sulla stessa pagina. Se Google non può scansionarla, potrebbe non vedere mai l’istruzione noindex.
Domande frequenti su robots.txt 🙋
Che cos’è robots.txt?
robots.txt è un file di testo che fornisce istruzioni di scansione per un sito.
Dove si trova robots.txt?
Di solito nella radice del dominio, per esempio https://example.com/robots.txt.
robots.txt può rimuovere una pagina da Google?
Non in modo affidabile. Può bloccare la scansione, ma la rimozione dalla ricerca richiede spesso noindex, eliminazione, redirect, password o Search Console.
Devo aggiungere la sitemap in robots.txt?
Sì, è comune indicare la sitemap XML in robots.txt per aiutare i crawler a trovarla rapidamente.
robots.txt può bloccare bot malevoli?
Solo i bot che scelgono di rispettarlo. Sicurezza e abuso richiedono regole server, firewall o accesso.
Torna al glossario.
Non sai se robots.txt aiuta o blocca la cosa sbagliata?
Invia l’URL robots.txt e la pagina che ti preoccupa. Possiamo verificare se il problema riguarda scansione, indicizzazione, canonical o struttura del sito.