Sitemap và robots.txt cho website doanh nghiệp: khác nhau ở đâu?
Biên soạn: Nguyễn Minh Phương · 5 phút đọc · Cập nhật 21/8/2026
Trả lời nhanh
Sitemap hỗ trợ công cụ tìm kiếm khám phá URL; robots.txt quản lý việc bot có thể thu thập đường dẫn nào. Cả hai không tự bảo đảm URL được lập chỉ mục.
Khung áp dụng
Ba tiêu chí giúp so sánh lựa chọn
Phù hợp với doanh nghiệp đang kiểm tra sitemap trong Search Console hoặc chuẩn bị thay đổi cấu trúc website.
| STT | Câu hỏi ra quyết định | Hành động hoặc bằng chứng cần có |
|---|---|---|
| 1 | Sitemap có chứa URL canonical và hoạt động không? | Kiểm tra domain canonical. |
| 2 | Robots.txt có chặn tài nguyên hoặc trang quan trọng không? | Rà URL trong sitemap. |
| 3 | Doanh nghiệp đang muốn chặn crawl, noindex hay xóa URL? | Đọc từng quy tắc robots.txt. |
Sitemap liệt kê URL doanh nghiệp muốn Google biết tới
Sitemap giúp công cụ tìm kiếm khám phá URL và metadata liên quan nhưng không bảo đảm lập chỉ mục. Tệp nên chứa URL canonical, hoạt động và có giá trị; không nên tiếp tục liệt kê trang đã xóa, chuyển hướng hoặc bản nháp chưa duyệt.
- Dùng URL tuyệt đối và đúng domain chuẩn.
- Cập nhật khi thêm, gộp hoặc xóa trang.
- Không đưa URL noindex hoặc redirect vào sitemap.
Robots.txt quản lý việc thu thập, không phải công cụ xóa URL khỏi Google
Robots.txt có thể cho phép hoặc chặn bot truy cập đường dẫn. Chặn crawl không đồng nghĩa trang chắc chắn biến mất khỏi kết quả nếu URL đã được biết từ nguồn khác. Doanh nghiệp cần kiểm tra kỹ trước khi chặn thư mục chứa CSS, JavaScript hoặc trang quan trọng.
- Không dùng robots.txt để bảo vệ dữ liệu bí mật.
- Kiểm tra cú pháp sau mỗi thay đổi.
- Phân biệt disallow với noindex.
Tình huống minh họa
URL vẫn xuất hiện dù bị chặn crawl
Nếu Google biết URL từ liên kết khác, chặn robots.txt không phải phương pháp chắc chắn để xóa trang khỏi kết quả.
Sơ đồ kiểm soát crawl
Khám phá URL, thu thập dữ liệu và lập chỉ mục là ba bước khác nhau
Kiểm tra mục tiêu kỹ thuật trước khi sửa tệp
Sitemap thông báo URL ưu tiên khám phá; robots.txt đưa quy tắc crawl. Nếu mục tiêu là loại URL khỏi chỉ mục, doanh nghiệp phải dùng phương pháp phù hợp và vẫn cho bot truy cập khi cần đọc noindex. Tệp sai có thể ảnh hưởng cả thư mục, vì vậy thay đổi phải được kiểm tra và lưu phiên bản. Ngoài hai tệp này, trạng thái HTTP, canonical, nội dung và khả năng render vẫn quyết định Google có thể xử lý URL đúng cách hay không.
- Không chặn tài nguyên cần để render.
- Không để bản nháp trong sitemap.
- Không dùng robots.txt bảo vệ bí mật.
Checklist triển khai
- Kiểm tra domain canonical.
- Rà URL trong sitemap.
- Đọc từng quy tắc robots.txt.
- Kiểm tra Search Console sau thay đổi.
Tóm tắt
Giữ sitemap sạch và kiểm tra mục tiêu trước khi chặn crawl. Sitemap và robots.txt không tự bảo đảm hoặc loại bỏ việc lập chỉ mục.
Tài liệu tham khảo
- Google Search Central — Learn about sitemaps
- Google Search Central — Introduction to robots.txt
- Google Search Central — SEO Starter Guide
Ghi chú biên soạn: nội dung được tổng hợp từ các tài liệu được liệt kê và giới hạn ở góc nhìn quản lý thông tin marketing; bài không bảo đảm vị trí hiển thị trên Google.
