Cách sử dụng file robots.txt cho SEO
Tìm hiểu robots.txt kiểm soát những gì, cách viết quy tắc đúng, xác minh hành vi bằng curl và DevTools, và tránh các lỗi SEO phổ biến.

Hướng dẫn này bao gồm những gì
Bài viết này giải thích robots.txt kiểm soát những gì và không kiểm soát những gì, trình bày cú pháp đúng và ví dụ thực tế, cung cấp các lệnh dòng lệnh bạn có thể chạy, và liệt kê các bước khắc phục để phục hồi sau các lỗi phổ biến. Bạn cũng sẽ nhận được mẹo xác minh phù hợp với môi trường tìm kiếm 2026 (mobile-first indexing là mặc định của Google từ July 2024 và Google đã loại bỏ các trang cached truyền thống vào early 2024).
Robots.txt là gì và nó kiểm soát những gì
robots.txt là một file văn bản thô ở thư mục gốc của site, gửi hướng dẫn crawling tới các robot web hành xử đúng chuẩn. Nó là một phần của Robots Exclusion Standard. Dùng file này để nói cho crawlers biết những đường dẫn họ có thể fetch; nó điều khiển crawling, không phải indexing hay ranking.
Các điểm khác biệt quan trọng cần nhớ:
Crawling vs indexing vs ranking — robots.txt ảnh hưởng đến crawling (những gì một agent fetch). Một URL bị chặn khỏi crawling vẫn có thể được index nếu các trang khác liên kết tới nó và công cụ tìm kiếm quyết định index URL mà không fetch nội dung.
robots.txt mang tính khuyến nghị — chỉ các crawler tuân thủ mới theo. Bot độc hại, thu thập spam và một số trình quét có thể bỏ qua nó.
robots.txt không thay thế cơ chế kiểm soát truy cập. Dùng HTTP authentication, bảo vệ bằng mật khẩu, hoặc các kiểm soát phía server cho nội dung riêng tư.
Nơi robots.txt phải đặt và quy tắc cơ bản
robots.txt phải được phục vụ từ thư mục gốc trên chính xác host và protocol mà các quy tắc áp dụng. Ví dụ vị trí khác nhau: https://example.com/robots.txt và https://sub.example.com/robots.txt. Bạn không thể đặt một robots.txt trong thư mục con và mong nó điều khiển toàn bộ domain.
Để tiện và làm ví dụ trong hướng dẫn này, đường dẫn kiểm tra chuẩn là http://www.yoursite.com/robots.txt.
Cú pháp robots.txt và các directive phổ biến
Một robots.txt tối giản dùng các directive nhóm theo user-agent. Tên directive không phân biệt chữ hoa/thường. Ví dụ dưới đây dùng các token chuẩn được hầu hết crawlers lớn hỗ trợ:
Chặn tất cả crawler khỏi một thư mục:
User-agent: *
Disallow: /private/
Cho phép một file cụ thể trong khi chặn toàn bộ thư mục (hữu ích cho kiểu phân tích của Googlebot):
User-agent: *
Disallow: /images/
Allow: /images/logo.png
Bạn có thể khai báo sitemaps trong robots.txt để hướng crawlers tới XML sitemap:
Sitemap: http://www.yoursite.com/sitemap.xml
Phép khớp mẫu: các search engines hỗ trợ ký tự đại diện asterisk (*) và ký hiệu kết thúc chuỗi ($) trong pattern robots.txt. Directive không chuẩn Crawl-delay bị một số engine bỏ qua (Google không hỗ trợ Crawl-delay).
Ví dụ thực tế
1) Cho phép mọi crawler truy xuất mọi thứ (tùy chọn an toàn mặc định):
User-agent: *
Disallow:
2) Chặn một crawler (ví dụ, chặn một agent cụ thể khỏi mọi nội dung):
User-agent: BadBot
Disallow: /
3) Ngăn crawler truy xuất các tài nguyên cần cho rendering (lỗi phổ biến — xem phần khắc phục):
Disallow: /static/js/
Chặn CSS/JS có thể khiến Google không thấy trang giống cách người dùng thấy. Vì Google sử dụng phiên bản mobile làm cơ sở chính cho crawling and indexing và đánh giá Core Web Vitals từ trang đã render, đừng chặn các tài nguyên cần cho rendering.
Cách xác minh và khắc phục robots.txt
Các kiểm tra cơ bản bạn có thể chạy từ bên ngoài site:
Lấy nội dung file: curl http://www.yoursite.com/robots.txt — lệnh này trả về nội dung file mà crawler sẽ thấy.
Chỉ kiểm tra headers: curl -I http://www.yoursite.com/robots.txt — xác minh HTTP status (200 vs 4xx/5xx) và Content-Type. -I chỉ trả về response headers.
Xem cách trình duyệt nhận file: mở https://www.yoursite.com/robots.txt trong trình duyệt và xác nhận nội dung giống curl.
Kiểm tra server logs để tìm các request thực tế của crawler tới /robots.txt và các agent như Googlebot cố gắng truy xuất các trang bị chặn — logs là tín hiệu bên thứ ba đáng tin cậy nhất về hành vi crawler.
Các kiểm tra nên chạy khi bạn sở hữu property:
Dùng URL Inspection của Google Search Console cho từng trang để xem Google đã fetched hay indexed một URL chưa. URL Inspection là nguồn có thẩm quyền cho các property bạn sở hữu.
Sau khi thay robots.txt, theo dõi server logs và báo cáo Performance trong Search Console để xác nhận hành vi crawl cho các trang quan trọng.
Dấu hiệu phổ biến của các vấn đề và cách xử lý
Bạn vô tình chặn CSS/JS — triệu chứng: trang hiển thị khác với crawler; Cách xử lý: loại bỏ các đường dẫn tài nguyên khỏi Disallow để crawler có thể fetch.
robots.txt trả về 404/5xx — triệu chứng: một số crawler có thể coi site hoàn toàn có thể crawl hoặc tạm dừng crawl; Cách xử lý: khôi phục robots.txt hợp lệ trả về 200 và Content-Type đúng.
Bạn chặn toàn bộ host hoặc protocol bằng cách đặt robots.txt trên subdomain sai — triệu chứng: trang biến mất khỏi crawl logs; Cách xử lý: thêm robots.txt vào host đúng (và kiểm tra redirects).
Nếu một trang bị chặn khỏi crawling nhưng vẫn xuất hiện trong kết quả tìm kiếm mà không có đoạn trích, điều đó cho thấy URL được index dựa trên tín hiệu bên ngoài dù nội dung không được fetch. Để xóa các URL như vậy khỏi kết quả, dùng xác thực HTTP thích hợp, xóa trang, hoặc trả về directive noindex trên chính trang đó (noindex yêu cầu crawler phải fetch trang, nên không chặn nó trong robots.txt nếu bạn định dùng noindex).
Danh sách kiểm tra: triển khai và rà soát robots.txt an toàn
Đặt robots.txt ở thư mục gốc của site cho chính xác host và protocol.
Kiểm tra file với curl (body và headers) và trong trình duyệt.
Tránh chặn CSS, JavaScript, hoặc các asset khác dùng cho rendering trừ khi bạn cố ý muốn ngăn crawler render.
Khai báo sitemaps trong robots.txt để giúp crawler phát hiện các URL có thể index của bạn.
Theo dõi server logs và Search Console để biết hành vi crawl sau khi thay đổi.
Nếu bạn cần tài liệu tham khảo từng bước, đọc Read the Technical SEO Guide để có bối cảnh rộng hơn về crawlability và Core Web Vitals.
Các cân nhắc bổ sung trong 2026
Vì Google sử dụng phiên bản mobile làm cơ sở chính cho crawling và indexing và vì các trang cached truyền thống đã bị loại bỏ vào early 2024, nội dung cố ý ẩn khỏi crawlers qua robots.txt có thể ít có khả năng xuất hiện trong các tổng quan AI hiện đại và các tính năng Search Generative Experience. Nếu bạn muốn nội dung có thể xuất hiện trong các tổng quan AI hoặc được dùng cho các tính năng SERP phong phú, hãy cho phép crawlers fetch và index trang và sử dụng structured data khi phù hợp.
Câu hỏi thường gặp
robots.txt phải được host ở đâu?
robots.txt phải có thể truy cập ở thư mục gốc của chính xác host và protocol bạn định kiểm soát, ví dụ https://www.example.com/robots.txt. Các quy tắc không kế thừa từ domain cha xuống subdomain.
Chặn một trang trong robots.txt có thể xóa nó khỏi kết quả tìm kiếm không?
Chặn một trang khỏi crawling không luôn ngăn URL xuất hiện trong kết quả tìm kiếm nếu các trang khác liên kết tới nó. Để ngăn indexing, cho phép trang được crawl và trả về directive noindex hoặc dùng kiểm soát truy cập phía server.
Thay đổi robots.txt có tác dụng nhanh thế nào?
Crawlers lấy robots.txt định kỳ; không có khung thời gian cố định chung. Để xác nhận thay đổi, kiểm tra server logs xem có request mới tới /robots.txt và theo dõi Search Console và crawl logs để xem thay đổi hành vi.
Tôi có nên dùng robots.txt để ẩn nội dung riêng tư không?
Không. robots.txt là file công khai và không nên dùng để bảo vệ dữ liệu nhạy cảm. Dùng authentication, loại bỏ nội dung khỏi đường dẫn công khai, hoặc trả các HTTP response codes phù hợp để ngăn truy cập.
Làm sao để chỉ cho một crawler (ví dụ Googlebot) truy cập site của tôi?
Bạn có thể thêm một nhóm user-agent cho crawler cụ thể và nhóm hạn chế hơn cho những crawler khác, ví dụ:
User-agent: Googlebot
Disallow:
User-agent: *
Disallow: /
Hãy nhớ rằng điều này dựa vào user-agent strings và các crawler tuân thủ; nó không phải là cơ chế kiểm soát truy cập an toàn.
Bài viết liên quan

Checklist on-page SEO tăng hạng và UX
Checklist on-page SEO thực dụng gồm bước kiểm tra kỹ thuật, nội dung, UX và xác minh — làm được ngay.

Mẹo SEO thực tế để cải thiện xếp hạng tìm kiếm
Các chiến lược SEO có thể thực hiện và bền vững: chọn từ khóa, cơ bản on-page, kiểm tra kỹ thuật, best practices link-building và các bước kiểm chứng bạn có thể dùng ngay.

Thực hành tốt nhất cho tiêu đề SEO
Cách cấu trúc thẻ H1–H3 để rõ ràng, dễ truy cập và tạo tín hiệu thu thập/lập chỉ mục nhất quán.

Steps to build an organic traffic pipeline
A step-by-step guide to create a repeatable organic traffic pipeline: align content to intent, fix technical blockers, amplify distribution, and verify indexability.

FAQ schema: những điều cơ bản cần biết
Hướng dẫn thực tế về FAQ schema: nó là gì, cách thêm JSON-LD vào trang, bước kiểm tra và những lỗi thường gặp cần tránh.

Thu thập và lập chỉ mục: hướng dẫn khám phá công cụ tìm kiếm
Các bước cụ thể để đảm bảo công cụ tìm kiếm có thể tìm, render và lập chỉ mục đúng các trang quan trọng của bạn.

Robots.txt SEO: kiểm soát thu thập dữ liệu hiệu quả
Tìm cách dùng robots.txt để hướng dẫn crawler an toàn, tránh lỗi lập chỉ mục, kiểm tra bằng curl và log, và áp dụng ví dụ thực tế cho site production.

Audit Technical SEO: phát hiện lỗi kìm hãm hiệu suất tìm kiếm
Một audit Technical SEO thực tế theo từng bước để phát hiện các vấn đề crawl, render, index và performance — và hướng dẫn cách xác minh, ưu tiên sửa.
