robots.txt
robots.txt là một tệp nhỏ ở thư mục gốc của website, dùng để nói với trình thu thập dữ liệu phần nào của site có thể được yêu cầu.
Gửi email trước. Hãy gửi URL robots.txt và trang bạn lo ngại, chúng tôi sẽ chỉ ra bước kiểm tra thực tế tiếp theo.
Hãy dùng nó như hướng dẫn cho crawler, không phải công tắc lập chỉ mục.
robots.txt có thể chặn crawl, nhưng không xoá URL khỏi Google một cách đáng tin cậy nếu Google đã biết URL đó.
robots.txt là tệp văn bản thuần, thường nằm ở /robots.txt. Nó cho crawler biết đường dẫn nào được phép hoặc không được phép yêu cầu.
Công cụ tìm kiếm thường tôn trọng tệp này, nhưng đây không phải công cụ bảo mật riêng tư và không phải cách chắc chắn để xoá trang khỏi kết quả tìm kiếm.
Với trang không muốn lập chỉ mục, vẫn cần phương án đúng như noindex, canonical, xoá trang, chuyển hướng, bảo vệ bằng mật khẩu hoặc xoá trong Search Console tuỳ trường hợp.
robots.txt có thể kiểm soát gì 🧭
- Việc crawl các đường dẫn cụ thể
- Giúp phát hiện sơ đồ trang qua dòng sơ đồ trang XML
- Quy tắc khác nhau cho từng crawler bằng
User-agent,AllowvàDisallow
robots.txt thuộc phần SEO kỹ thuật. Nó hiệu quả nhất khi đi cùng sơ đồ trang XML rõ ràng, thẻ canonical đúng và các trang được phép crawl khi cần xếp hạng.
Một lỗi thường gặp là chặn một trang trong robots.txt rồi đặt noindex trên chính trang đó. Nếu Google không crawl được trang, Google có thể không bao giờ thấy lệnh noindex.
Câu hỏi về robots.txt 🙋
robots.txt là gì?
robots.txt là tệp văn bản thuần cung cấp hướng dẫn crawl cho một website.
robots.txt nằm ở đâu?
Nó thường nằm ở thư mục gốc của tên miền, ví dụ https://example.com/robots.txt.
robots.txt có xoá được trang khỏi Google không?
Không đáng tin cậy. Nó có thể chặn crawl, nhưng việc xoá khỏi tìm kiếm thường cần noindex, xoá trang, chuyển hướng, mật khẩu hoặc Search Console tuỳ trường hợp.
Có nên thêm sitemap vào robots.txt không?
Có. Thường nên tham chiếu sơ đồ trang XML trong robots.txt để crawler tìm thấy nhanh.
robots.txt có chặn được bot xấu không?
Chỉ với bot chọn tôn trọng nó. Bảo mật và chống lạm dụng cần quy tắc máy chủ, tường lửa hoặc quyền truy cập.
Quay lại từ điển.
Không chắc robots.txt đang giúp hay đang chặn nhầm?
Gửi URL robots.txt và trang bạn lo ngại. Chúng tôi có thể kiểm tra vấn đề nằm ở crawl, lập chỉ mục, canonical hay cấu trúc website.