学习 / 词典

robots.txt

robots.txt 是放在网站根目录的小文件,用来告诉爬虫可以请求网站的哪些部分。

先发邮件。把 robots.txt 地址和你担心的页面发来,我们会指出下一步该怎么查。

把它当成爬虫指引,不要当成索引开关。

robots.txt 可以阻止抓取,但 Google 已经知道某个 URL 时,它不一定能把这个 URL 从 Google 中移除。

robots.txt 是纯文本文件,通常位于 /robots.txt。它告诉爬虫哪些路径可以请求,哪些路径不应请求。

搜索引擎通常会遵守它,但它不是隐私工具,也不是从搜索结果移除页面的可靠方法。

如果某些页面不希望被索引,还需要使用正确的索引控制方式,例如 noindex、canonical 标签、删除、重定向、密码保护,或按情况使用 Search Console 移除。

robots.txt 能控制什么 🧭

特定路径的抓取
用 User-agent、Allow 和 Disallow 给不同爬虫设置不同规则

robots.txt 属于技术 SEO。它最好和清晰的 XML 站点地图、canonical 标签,以及需要排名时允许抓取的页面一起使用。

常见错误是在 robots.txt 中阻止页面,同时又在页面上放 noindex。如果 Google 无法抓取页面,可能永远看不到 noindex 指令。

robots.txt 常见问题 🙋

返回词典

什么是 robots.txt?

robots.txt 是一个纯文本文件,用来给网站爬虫提供抓取指令。

robots.txt 能把页面从 Google 移除吗?

不可靠。它可以阻止抓取,但从搜索中移除通常需要 noindex、删除、重定向、密码保护或 Search Console 移除,具体看情况。

应该把 sitemap 放进 robots.txt 吗?

是的,常见做法是在 robots.txt 中引用 XML 站点地图,方便爬虫快速找到。

robots.txt 能阻止恶意机器人吗?

只能阻止愿意遵守规则的机器人。安全和滥用控制需要服务器、防火墙或访问规则。

不确定 robots.txt 是在帮忙,还是挡住了错误的东西?

发送 robots.txt 地址和你担心的页面给我们。我们可以检查问题出在抓取、索引、canonical,还是网站结构。