Skip to content
Szukaj

Robots.txt — co to jest i jak działa

Robots.txt to plik tekstowy w katalogu głównym witryny, który instruuje roboty wyszukiwarek, które ścieżki mają być crawlowane, a które pomijane; wpływa głównie na indeksowanie i dostęp do zasobów, nie bezpośrednio na pozycję w wynikach.

Robots.txt: co to jest i jak działa

Co to jest robots.txt?

Robots.txt to prosty plik tekstowy umieszczony w katalogu głównym serwera (np. https://example.com/robots.txt). Wykorzystuje on tzw. robots exclusion protocol — zestaw dyrektyw takich jak User-agent, Disallow, Allow i Sitemap — by informować roboty wyszukiwarek, które URL-e powinny zostać odwiedzone, a które pominąć.

Dlaczego robots.txt ma znaczenie dla SEO

Robots.txt kontroluje dostęp crawlerów do zasobów witryny, więc wpływa na to, co może być crawlowane i w konsekwencji indeksowane. Ważne: blokada w robots.txt może uniemożliwić Googleowi pobranie zasobów potrzebnych do poprawnego renderowania strony (CSS/JS), co z kolei może utrudnić ocenę zawartości. Jednak sam robots.txt nie jest mechanizmem ustalającym pozycję w wynikach — ranking to efekt wielu sygnałów; robots.txt wpływa głównie na etap crawl/index, a nie bezpośrednio na ranking.

Jak działa robots.txt

Kolejność działania w uproszczeniu: crawler żąda /robots.txt z katalogu głównego; jeżeli plik istnieje, parser interpretuje dyrektywy dla pasujących User-agent; następnie crawler podejmuje decyzję, czy odwiedzić dany URL. Pamiętaj o rozróżnieniu: crawling = pobieranie URL, indexing = decyzja o przechowaniu treści w indeksie, ranking = porządkowanie wyników; robots.txt wpływa głównie na crawling i pośrednio na indexing.

Przykładowe dyrektywy (w pliku robots.txt):

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Rodzaje konfiguracji robots.txt

Poniżej kilka typowych wzorców i ich zastosowań:

- Strona publiczna z minimalnymi blokadami — User-agent: *; brak Disallow (crawler ma dostęp do większości treści).

- Sekcja administracyjna z blokadą — Disallow: /admin/ (użyteczne, gdy chcesz uniemożliwić crawlowanie paneli).

- Złożone reguły per-wyszukiwarka — oddzielne bloki User-agent dla Googlebot, Bingbot itd., gdy potrzebujesz różnych zasad.

Rozpoczęcie pracy z robots.txt

Zasady implementacji:

- Umieść plik dokładnie pod adresem /robots.txt w katalogu głównym domeny.

- Używaj prostych, czytelnych reguł; testuj zmiany przed wdrożeniem na produkcji.

- Dodaj dyrektywę Sitemap, aby wskazać lokalizację map XML: Sitemap: https://example.com/sitemap.xml

Typowe błędy w robots.txt

Najczęściej spotykane problemy i ich skutki:

- Blokowanie plików CSS/JS — może uniemożliwić poprawne renderowanie strony przez Googlebot Smartphone (od lipca 2024 Google domyślnie używa Googlebot Smartphone), co wpływa na ocenę treści.

- Przez przypadek zablokowane katalogi (np. Disallow: /) — skutkuje brakiem crawlowania i brakiem aktualizacji zawartości w indeksie.

- Zależność od robots.txt zamiast użycia właściwych nagłówków HTTP lub meta-robots. Jeśli chcesz, żeby strona pozostała niewidoczna w indeksie, użyj meta-robots noindex na stronie, ale pamiętaj: jeżeli strona jest zablokowana przez robots.txt, Google nie będzie mógł pobrać meta-tagów.

Robots.txt: sprawdzenie i rozwiązywanie problemów — techniczny checklist

Praktyczny zbiór kontroli (format: {Nazwa kontroli} — gdzie sprawdzić — zaliczona gdy {warunek}):

- Dostępność robots.txt — curl -I https://twojadomena.pl/robots.txt — zaliczona gdy zwracany jest status 200 i nagłówek Content-Type zawiera text/plain.

- Zawartość reguł — pobierz pełny plik: curl https://twojadomena.pl/robots.txt — zaliczona gdy dyrektywy odpowiadają zamierzonym blokadom (User-agent, Disallow, Allow, Sitemap).

- Test zachowania dla konkretnego user-agenta — curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://twojadomena.pl/some-url — zaliczona gdy URL jest dostępny zgodnie z oczekiwaniami.

- Sprawdzenie blokad zasobów (CSS/JS) — Chrome DevTools > Network lub zakładka Coverage — zaliczona gdy krytyczne pliki nie są zablokowane i ładują się poprawnie.

- Indeksacja konkretnego URL (Twoja witryna) — Google Search Console > URL Inspection — zaliczona gdy URL może być zaindeksowany (brak błędów wynikających z blokady robots.txt).

- Sygnały publiczne dla stron zewnętrznych — operator site: oraz cytat unikalnego fragmentu w Google — użyteczne jako wskazówka, ale nie jednoznaczne potwierdzenie indeksacji.

Jak weryfikować: narzędzia i polecenia

Szybkie zestawienie narzędzi i typowych komend:

- curl — sprawdź nagłówki: curl -I https://example.com/robots.txt; pobierz treść: curl https://example.com/robots.txt

- Google Search Console — URL Inspection do sprawdzenia indeksacji własnych URL-i; symulacja pobierania przez Googlebot (jeżeli masz uprawnienia).

- Chrome DevTools — Network, Coverage i Rendering dla sprawdzenia blokad zasobów i ich wpływu na render.

- Server logs — analiza żądań z user-agentami crawlerów pozwala potwierdzić, czy crawler odwiedza strony i jakie statusy otrzymuje.

- Bing Webmaster Tools > Site Explorer — podobne możliwości inspekcji dla botów Bing i sprawdzenia robots.txt.

Najczęściej zadawane pytania

Czy robots.txt może zastąpić meta-robots noindex? — Nie. Jeśli zablokujesz stronę w robots.txt, robot nie pobierze jej treści, więc nie zobaczy meta-tagów noindex; użyj noindex na stronach, które mają być wyłączone z indeksu, ale dostępne dla crawlera.

Czy robots.txt wszystko blokuje? — Nie wszystkie roboty respektują robots.txt; to dobry mechanizm względem głównych wyszukiwarek, ale nie zastępuje zabezpieczeń autoryzacyjnych dla wrażliwych danych.

Czy mogę mieć różne robots.txt dla mobilnej i desktopowej wersji? — Robots.txt jest specyficzny dla hosta i protokołu (np. https://); nie ma osobnych plików dla urządzeń. Zamiast tego zadbaj o to, aby zasoby potrzebne do renderowania mobilnego nie były zablokowane.

Czy można używać reguł opartych na IP lub nagłówkach? — Robots.txt nie obsługuje reguł opartych na IP lub nagłówkach; zaawansowane filtrowanie należy realizować na warstwie serwera lub przez konfigurację CDN, pamiętając o unikaniu cloakingu względem crawlerów.

Przeczytaj także: Przewodnik Technical SEO

Podsumowanie i wezwanie do działania

Poprawnie skonfigurowany robots.txt to podstawowy element technicznego SEO: pozwala ograniczyć crawlowanie nieistotnych zasobów, wskazać mapy sitemap oraz chronić części witryny przed niezamierzonym indexowaniem. Regularnie testuj plik po zmianach i używaj narzędzi (curl, Google Search Console, Chrome DevTools, logs) aby potwierdzić oczekiwane zachowanie.

Budowanie autorytetu tematycznego wymaga nie tylko poprawnej technicznej konfiguracji, ale też jakościowych linków od wydawców i zaufanych stron. Jeśli szukasz ofert i listy wydawców, sprawdź naszą platformę z ofertami umieszczonymi w sekcji marketplace

Powiązane terminy