Jak używać pliku robots.txt dla SEO
Konkretny przewodnik po robots.txt: co robi, jak go zbudować, jak testować i jak unikać najczęstszych błędów SEO.

Co otrzymasz w tym artykule
Krótko i praktycznie: wyjaśnię, jak działa plik robots.txt, jakie ma ograniczenia względem indeksowania i rankingów, pokażę użyteczne przykłady dyrektyw oraz polecę kroki do testowania i naprawy problemów.
Czym jest robots.txt i co robi
Robots.txt (standard wykluczania robotów) to plik tekstowy umieszczony w katalogu głównym witryny, np. https://www.domain.com/robots.txt lub http://www.yoursite.com/robots.txt. Informuje on uprzejmie crawlery, które ścieżki mogą być przeszukiwane. Ważne: robots.txt dotyczy wykrywania i pobierania (crawlingu), a nie bezpośrednio rankingu. Rozróżnij crawling, indeksowanie i ranking — robots.txt wpływa głównie na to, co roboty mogą pobrać.
Czego robots.txt nie robi (ograniczenia)
Robots.txt nie jest narzędziem do bezpiecznego ukrywania poufnych danych — plik jest publiczny i każdy może go przeczytać. Ponadto zablokowanie ścieżki w robots.txt zapobiega pobraniu zasobu przez uprzejmie zachowujące się boty, ale nie gwarantuje, że adres URL nie pojawi się w indeksie (np. jako "URL bez treści"), gdy inne strony linkują do tego URL. Jeśli chcesz wyłączyć stronę z indeksu, zastosuj meta tag noindex lub nagłówek X-Robots-Tag i pozwól botom ją pobrać, albo użyj zabezpieczeń (np. uwierzytelnianie).
Podstawowe dyrektywy i przykłady
Robots.txt składa się z reguł dla konkretnych user-agentów i kilku prostych dyrektyw. Oto najważniejsze z nich i przykłady.
Pełen dokument może wyglądać np. tak:
User-agent: *
Disallow: /private/
Allow: /private/public-info.html
Sitemap: https://www.domain.com/sitemap.xml
Krótkie wyjaśnienia:
- User-agent: identyfikuje bota, np. * — wszystkie boty, Googlebot — tylko Google.
- Disallow: ścieżka, której bot nie powinien pobierać. Przykład: Disallow: /admin/
- Allow: nadpisuje bardziej ogólne Disallow i pozwala na pobieranie określonej ścieżki.
- Sitemap: informuje boty o lokalizacji mapy witryny (wiele wyszukiwarek potrafi ją odczytać).
Przykłady praktyczne
Blokowanie całej witryny (np. staging):
User-agent: *
Disallow: /
Uwaga: zamiast polegać na robots.txt dla środowisk przedprodukcyjnych, lepszym rozwiązaniem jest ochrona hasłem (HTTP auth) lub kontrola dostępu serwera — to skuteczniej zapobiega przypadkowemu indeksowaniu.
Pozwolenie na pobieranie wszystkich zasobów (domyślnie) — pusty lub brak pliku robots.txt oznacza, że boty mogą indeksować stronę:
User-agent: *
Disallow:
Jak testować i debugować robots.txt
Podstawowe kroki, które wykonasz z zewnątrz (nie potrzebujesz dostępu do Google Search Console właściciela domeny):
- Otwórz w przeglądarce: https://www.domain.com/robots.txt lub http://www.yoursite.com/robots.txt — plik jest publiczny, więc jego zawartość powinna być widoczna.
- Sprawdź nagłówki i treść za pomocą curl: użyj `curl -I https://www.domain.com/robots.txt` aby zobaczyć nagłówki odpowiedzi lub `curl https://www.domain.com/robots.txt` aby pobrać zawartość pliku.
- Symuluj różne user-agenty, jeśli chcesz zobaczyć, czy serwer różnicuje odpowiedź, np. `curl -A "Googlebot/2.1" https://www.domain.com/robots.txt`. (Uwaga: serwer powinien nie różnicować zawartości robots.txt ze względu na user-agent — zmiana odpowiedzi dla crawlerów może wyglądać jak cloaking.)
- Jeżeli masz dostęp do narzędzi właściciela, użyj Google Search Console, aby sprawdzić, czy Google zgłasza problemy z dostępem do zasobów. Pamiętaj, że URL Inspection wymaga własności domeny — nie jest narzędziem do badania zewnętrznych witryn.
Najczęstsze błędy i jak ich unikać
- Błąd: przypadkowe zablokowanie całej witryny (np. `Disallow: /`). Skutek: roboty nie pobierają stron, co utrudnia zastosowanie meta noindex — zamiast robots.txt użyj uwierzytelniania na środowisku testowym.
- Błąd: mylenie blokowania z usuwaniem z indeksu. Jeśli celem jest usunięcie treści z indeksu, zastosuj meta noindex i pozwól na pobranie strony.
- Błąd: poleganie na robots.txt jako na zabezpieczeniu prywatnych plików. Plik jest publiczny; stosuj autoryzację lub serwerowe mechanizmy dostępu.
Dobre praktyki
- Utrzymuj prostotę: im prostszy i czytelniejszy plik, tym mniejsze ryzyko pomyłek.
- Dodaj dyrektywę Sitemap: ułatwia to wyszukiwarkom znalezienie mapy strony.
- Sprawdzaj plik po każdej zmianie: prosty błąd formatowania może spowodować zablokowanie ważnych sekcji.
- Preferuj kontrolę dostępu (uwierzytelnianie) dla treści prywatnych zamiast polegać wyłącznie na robots.txt.
Dodatkowa uwaga dot. Google: Google używa wersji mobilnej jako podstawy do indeksowania; od lipca 2024 Google eksploruje witryny do Search za pomocą Googlebot Smartphone jako domyślnego crawlra. Oznacza to, że warto testować, co widzą boty mobilne, gdy ocenisz dostępność zasobów.
Jak postępować, gdy Google nie pobiera zasobów
Jeśli Google nie pobiera zasobów (np. skrypty, CSS lub obrazy) i to wpływa na renderowanie strony, sprawdź robots.txt, a następnie nagłówki odpowiedzi serwera. Pobierz stronę za pomocą curl bez -I, aby zobaczyć treść: `curl https://www.domain.com/page.html`. Upewnij się, że zasoby nie są zablokowane przez Disallow i że serwer zwraca prawidłowe kody statusu.
Krótka checklista przed publikacją zmian
- Sprawdź plik pod kątem literówek i błędów składniowych.
- Zweryfikuj w przeglądarce i za pomocą curl, że dostęp do pliku jest możliwy: `curl -I https://www.domain.com/robots.txt`.
- Jeśli blokujesz zasoby krytyczne dla renderowania, zastanów się nad ich udostępnieniem lub zapewnieniem alternatyw.
Jeżeli chcesz dodać dodatkową lekturę o technicznym SEO, Przeczytaj przewodnik po Technical SEO.
FAQ
Czy robots.txt może całkowicie zapobiec indeksowaniu strony?
Nie zawsze. Robots.txt zapobiega pobieraniu treści przez uprzejme boty, ale adres URL może nadal trafić do indeksu, jeśli inne strony linkują do niego. Aby wyłączyć stronę z indeksu, użyj meta noindex (i pozwól na pobranie strony) lub zabezpieczeń serwera.
Jak sprawdzić, czy mój robots.txt jest poprawny?
Otwórz https://www.domain.com/robots.txt lub użyj `curl -I`/`curl` do pobrania pliku. Sprawdź poprawność składni i czy dyrektywy odnoszą się do właściwych ścieżek. Jeśli jesteś właścicielem witryny, użyj Google Search Console, aby monitorować problemy z dostępem.
Czy mogę użyć robots.txt do ukrycia prywatnych plików?
Nie polecam. Robots.txt jest publiczny — każdy może zobaczyć odwołania do katalogów, które próbujesz ukryć. Dla prawdziwie prywatnych zasobów stosuj uwierzytelnianie lub serwerowe reguły dostępu.
Powiązane artykuły

Checklista SEO on-page: zwiększ rankingi i UX
Kompletna checklista on-page SEO: jak poprawić wydajność, strukturę treści, indeksowalność i doświadczenie użytkownika krok po kroku.

Wskazówki SEO: praktyczne, ponadczasowe strategie
Konkretne, praktyczne wskazówki SEO: techniczne ustawienia, optymalizacja treści, weryfikacja backlinków i checklisty do wdrożenia.

Najlepsze praktyki nagłówków SEO (H1–H3)
Praktyczny przewodnik po nagłówkach H1–H3: kiedy i jak ich używać, typowe błędy oraz szybkie sposoby na weryfikację poprawnej struktury.

Kroki do skutecznego lejka ruchu organicznego
Jak zaprojektować lejek ruchu organicznego: mapowanie intencji, techniczne ustawienia, strategia treści i sposoby weryfikacji efektów.

FAQ Schema — podstawy, które musisz znać
Jak poprawnie wdrożyć FAQ Schema (JSON‑LD), czego unikać i jak zweryfikować poprawność za pomocą narzędzi takich jak Rich Results Test i Search Console.
