Trình tạo Robots.txt
Kết Quả: robots.txt
Quy tắc
Giới thiệu Trình tạo Robots.txt
Trình tạo Robots.txt xây dựng các chỉ thị cho crawler của công cụ tìm kiếm và AI biết khu vực nào trên website được phép truy cập.
Bạn có thể chọn chính sách mặc định, thêm quy tắc theo từng user-agent, khai báo sitemap và xuất tệp robots.txt sẵn sàng đưa lên máy chủ.
Tính năng chính
- Mẫu cấu hình có sẵn: Bắt đầu nhanh với cấu hình cho WordPress, Laravel, website thương mại điện tử, Blogger và nhiều nền tảng phổ biến.
- Quy tắc riêng cho từng crawler: Tạo nhiều nhóm User-agent và kết hợp Allow, Disallow, Crawl-delay để kiểm soát hoạt động thu thập dữ liệu.
- Hỗ trợ sitemap và bot AI: Thêm URL sitemap, tùy chọn chặn các crawler AI phổ biến rồi sao chép hoặc tải tệp hoàn chỉnh.
Cách sử dụng Trình tạo Robots.txt
Thực hiện các bước sau để sử dụng Trình tạo Robots.txt.
- Chọn chính sách khởi đầu Chọn một mẫu hoặc quy định user-agent mặc định * được phép crawl toàn bộ website hay không.
- Thêm quy tắc crawler Thêm nhóm User-agent, chọn Allow hoặc Disallow và nhập đường dẫn thư mục áp dụng cho từng quy tắc.
- Khai báo chỉ thị tùy chọn Đặt độ trễ crawl khi cần, nhập URL sitemap tuyệt đối và chọn có chặn các crawler AI phổ biến hay không.
- Phát hành và kiểm tra tệp Đọc lại các chỉ thị, sao chép hoặc tải robots.txt, đưa tệp lên thư mục gốc và kiểm tra URL thực tế.
Lưu ý khi sử dụng
- Đưa tệp vào thư mục gốc để có thể truy cập tại địa chỉ https://example.com/robots.txt.
- Kiểm tra các quy tắc quan trọng bằng công cụ kiểm thử robots.txt trong trang quản trị của công cụ tìm kiếm trước khi phát hành.
- Không ghi mật khẩu hoặc đường dẫn nhạy cảm vào robots.txt vì đây là tệp công khai và URL bị chặn vẫn có thể bị lộ.
- Dùng noindex hoặc cơ chế kiểm soát truy cập nếu trang không được xuất hiện trên kết quả tìm kiếm; Disallow chỉ kiểm soát việc crawl.
Câu hỏi thường gặp
Hãy đặt tệp ở thư mục gốc website. Với example.com, crawler phải truy cập được https://example.com/robots.txt.
Không. Disallow yêu cầu bot tuân thủ không crawl đường dẫn, nhưng URL vẫn có thể được lập chỉ mục. Hãy dùng noindex hoặc xác thực khi cần loại bỏ trang.
Không. Tệp này là công khai và bot độc hại có thể bỏ qua quy tắc. Nội dung riêng tư phải được bảo vệ bằng xác thực và phân quyền phía máy chủ.
Disallow chặn crawler truy cập đường dẫn khớp với user-agent đã chọn. Allow có thể mở lại một đường dẫn con cụ thể bên trong vùng bị chặn rộng hơn.