学习 词典

robots.txt

robots.txt 是放在网站根目录的小文件,用来告诉爬虫可以请求网站的哪些部分。

先发邮件。把 robots.txt 地址和你担心的页面发来,我们会指出下一步该怎么查。

把它当成爬虫指引,不要当成索引开关。

robots.txt 可以阻止抓取,但 Google 已经知道某个 URL 时,它不一定能把这个 URL 从 Google 中移除。

robots.txt 是纯文本文件,通常位于 /robots.txt。它告诉爬虫哪些路径可以请求,哪些路径不应请求。

搜索引擎通常会遵守它,但它不是隐私工具,也不是从搜索结果移除页面的可靠方法。

如果某些页面不希望被索引,还需要使用正确的索引控制方式,例如 noindex、canonical 标签、删除、重定向、密码保护,或按情况使用 Search Console 移除。


robots.txt 能控制什么 🧭

robots.txt 属于技术 SEO。它最好和清晰的 XML 站点地图、canonical 标签,以及需要排名时允许抓取的页面一起使用。

常见错误是在 robots.txt 中阻止页面,同时又在页面上放 noindex。如果 Google 无法抓取页面,可能永远看不到 noindex 指令。


robots.txt 常见问题 🙋

什么是 robots.txt?

robots.txt 是一个纯文本文件,用来给网站爬虫提供抓取指令。

robots.txt 放在哪里?

它通常位于域名根目录,例如 https://example.com/robots.txt。

robots.txt 能把页面从 Google 移除吗?

不可靠。它可以阻止抓取,但从搜索中移除通常需要 noindex、删除、重定向、密码保护或 Search Console 移除,具体看情况。

应该把 sitemap 放进 robots.txt 吗?

是的,常见做法是在 robots.txt 中引用 XML 站点地图,方便爬虫快速找到。

robots.txt 能阻止恶意机器人吗?

只能阻止愿意遵守规则的机器人。安全和滥用控制需要服务器、防火墙或访问规则。

返回词典

不确定 robots.txt 是在帮忙,还是挡住了错误的东西?

发送 robots.txt 地址和你担心的页面给我们。我们可以检查问题出在抓取、索引、canonical,还是网站结构。