Skip to content
Hledat

Robots.txt SEO: Efektivní řízení procházení

Jak správně používat robots.txt k řízení procházení, co může a co nemůže ovlivnit indexaci, jak testovat a jaké chyby se nejčastěji dělají.

Robots.txt SEO: Efektivní kontrola procházení

Co robots.txt dělá (a nedělá)

robots.txt je jednoduchý textový soubor umístěný v kořenovém adresáři domény, jehož primární úlohou je řídit, které části webu procházejí roboti. Používá se k ochraně oblastí s nízkou hodnotou pro vyhledávače — například staging, administrační cesty nebo interní výsledky vyhledávání — aby se zlepšila efektivita procházení. Je přitom zásadní rozlišovat tři fáze: crawling (objev a načtení URL), indexing (rozhodnutí, co uložit do indexu) a ranking (pořadí v SERP). robots.txt ovlivňuje především crawling, nikoli přímo indexaci nebo pořadí.

Důležité právdy:

  • robots.txt nezaručuje odstranění URL z indexu. Pokud na blokovanou adresu vedou externí odkazy nebo ji vyhledávače znají, může být i nadále zobrazena ve výsledcích bez načtení obsahu.
  • Blokování zdrojů (CSS/JS) může poškodit schopnost Googlebotu stránku správně vykreslit a vyhodnotit Core Web Vitals; od července 2024 Google používá Googlebot Smartphone jako výchozí pro crawling.
  • Sitemap direktivu lze deklarovat v robots.txt, což vyhledávačům usnadní nalezení mapy stránek.

Základní syntax a rozšíření

Základní direktivy jsou jednoduché a čitelné. Pár příkladů zápisu (uvádíme jako inline ukázky):

  • `User-agent: *` – cílí na všechny roboty.
  • `Disallow: /private/` – neprocházej adresář /private/.
  • `Allow: /assets/` – explicitně povolí procházení cesty, pokud jiná pravidla blokují širší oblast.
  • `Sitemap: https://example.com/sitemap.xml` – odkazy na mapu stránek.

V praxi velcí vyhledávací roboti podporují i jednoduché rozšíření patternů, jako jsou hvězdičky (*) a ukončovací znak ($). Nicméně chování se může lišit mezi implementacemi, proto testujte na konkrétních cílových robotech.

Jak robots.txt ovlivňuje indexaci a kdy ho nepoužívat

Než zablokujete URL v robots.txt, rozhodněte, zda chcete URL úplně odstranit z indexu nebo jen zabránit jejímu procházení. Pokud chcete URL deindexovat, je správný postup: povolit procházení a přidat na stránku metatag `meta name="robots" content="noindex"` nebo nastavit HTTP hlavičku `X-Robots-Tag: noindex`. robots.txt není náhradou za noindex.

Příklady, kdy robots.txt NEPOUŽÍT k odstranění obsahu z výsledků:

  • Stránky, které chcete, aby byly úplně deindexovány (použijte noindex místo Disallow).
  • Zdroje, které jsou potřeba pro správné vykreslení stránky (CSS/JS). Jejich zablokování může zhoršit interpretaci obsahu.

Ověření a testování (krok za krokem)

1) Zkontrolujte obsah souboru přímo: stáhněte ho přes HTTP(S). Například:

Zobrazit obsah: `curl https://example.com/robots.txt`

Zobrazit pouze hlavičky: `curl -I https://example.com/robots.txt`

2) Emulujte konkrétní user‑agent, pokud chcete vidět, zda server vrací jiný obsah podle UA:

Příklad: `curl -A "Googlebot" https://example.com/robots.txt` — toto vrátí obsah souboru s nastaveným user‑agentem.

3) Pro vlastní stránky použijte Google Search Console: nástroje URL Inspection a vestavěný testér robots.txt (pokud je k dispozici) vám ukážou, zda Google vidí blokování a jaké části jsou ovlivněné.

4) Kontrola přístupnosti zdrojů: pokud blokujete CSS/JS, otestujte vykreslení v Chrome DevTools nebo pomocí robotů, abyste viděli, jak Googlebot stránku interpretuje.

5) Server‑logy a validace Googlebotu: záznamy přístupů ukážou, zda Googlebot skutečně prochází plánované URL. Uvědomte si, že user‑agent lze zfalšovat; při ověřování identity použijte reverzní DNS a porovnání s oficiálními rozsahy, pokud je to nutné.

Běžné chyby a jak je řešit

Níže jsou často opakované problémy s návrhem nebo nasazením robots.txt a konkrétní nápravy.

  • Nahodilé blokování celé domény (`Disallow: /`) — problém: zablokujete crawling a Google nemusí mít přístup k důležitým stránkám. Řešení: používejte selektivní pravidla a testujte v stagingu.
  • Blokování zdrojů potřebných pro vykreslení — problém: Google může špatně vyhodnotit obsah a Core Web Vitals. Řešení: povolte CSS/JS používané pro kritické vykreslení.
  • Použití robots.txt k ukrytí citlivých dat — problém: robots.txt je veřejný soubor a uvádí cesty, které chcete skrýt. Řešení: použijte autentizaci nebo jiné serverové způsoby ochrany.
  • Rozdíly mezi roboty — problém: některé direktivy (např. Crawl‑delay) Google ignoruje. Řešení: prověřte dokumentaci konkrétního vyhledávače a nezávisle testujte chování.

Praktické šablony a příklady

Uvedené šablony jsou výchozí, upravte je podle struktury svého webu.

Základní bezpečné nastavení pro CMS (příklad):

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cgi-bin/
Sitemap: https://example.com/sitemap.xml

Šablona pro web s interními nástroji a stagingem:

User-agent: *
Disallow: /staging/
Disallow: /internal-tools/
Disallow/
Allow: /assets/
Sitemap: https://example.com/sitemap.xml

Poznámka: pokud chcete, aby URL byly odstraněny z indexu, nepoužívejte výhradní Disallow; místo toho povolte procházení a použijte noindex nebo X‑Robots‑Tag.

Doporučený postup při nasazení

1) Test v izolovaném prostředí: nasazujte a ověřte robots.txt v testovacím stagingu.

  1. 2) Kontrola klíčových URL: projděte seznam důležitých stránek a ověřte, že nejsou omylem zablokované.
  2. 3) Monitorování po nasazení: sledujte Search Console, server‑logy a indexační signály; rychlé odhalení chybných blokací zkrátí dobu nápravy.
  3. 4) Dokumentace změn: verzujte robots.txt v repozitáři a zaznamenávejte důvod každého pravidla.

Pokud potřebujete doplňující přehled o širších technických postupech, Přečtěte si průvodce Technical SEO

Často kladené otázky

Může robots.txt zabránit indexaci stránky?

Ne přímo. robots.txt brání crawlerům v přístupu k obsahu, ale vyhledávače mohou stále URL indexovat na základě externích odkazů nebo jiných signálů. Pokud chcete stránku deindexovat, povolte crawling a použijte metatag `noindex` nebo HTTP hlavičku `X-Robots-Tag: noindex`.

Proč Google nebere v úvahu `Crawl-delay`?

Directive `Crawl-delay` není součástí oficiální implementace Google; Google má vlastní algoritmy řízení crawlovací rychlosti. Pokud potřebujete omezit zátěž, řeště to serverovou konfigurací, rate‑limitingem na úrovni IP nebo v nastavení hostingu.

Jak ověřím, že jsem neblokoval důležité soubory CSS/JS?

Otestujte stránku v Chrome DevTools (Lighthouse) a porovnejte vykreslení s tím, jak ji vidíte v prohlížeči. Pro vlastní domény použijte URL Inspection v Google Search Console, který ukáže, jak Google stránku renderuje. Pokud jsou klíčové zdroje blokované, povolte je v robots.txt.

Jak mohu bezpečně skrýt interní nástroje bez uvedení cest v robots.txt?

robots.txt je veřejný soubor, takže uvádění citlivých cest může vést k jejich objevení. Pro citlivé oblasti používejte autentizaci, IP‑whitelisting nebo serverové přesměrování s kontrolou přístupu. robots.txt je vhodný pro řízení crawlování, nikoli jako bezpečnostní mechanismus.

Související články