Robots.txt SEO: Efektivní řízení procházení
Jak správně používat robots.txt k řízení procházení, co může a co nemůže ovlivnit indexaci, jak testovat a jaké chyby se nejčastěji dělají.

Co robots.txt dělá (a nedělá)
robots.txt je jednoduchý textový soubor umístěný v kořenovém adresáři domény, jehož primární úlohou je řídit, které části webu procházejí roboti. Používá se k ochraně oblastí s nízkou hodnotou pro vyhledávače — například staging, administrační cesty nebo interní výsledky vyhledávání — aby se zlepšila efektivita procházení. Je přitom zásadní rozlišovat tři fáze: crawling (objev a načtení URL), indexing (rozhodnutí, co uložit do indexu) a ranking (pořadí v SERP). robots.txt ovlivňuje především crawling, nikoli přímo indexaci nebo pořadí.
Důležité právdy:
- robots.txt nezaručuje odstranění URL z indexu. Pokud na blokovanou adresu vedou externí odkazy nebo ji vyhledávače znají, může být i nadále zobrazena ve výsledcích bez načtení obsahu.
- Blokování zdrojů (CSS/JS) může poškodit schopnost Googlebotu stránku správně vykreslit a vyhodnotit Core Web Vitals; od července 2024 Google používá Googlebot Smartphone jako výchozí pro crawling.
- Sitemap direktivu lze deklarovat v robots.txt, což vyhledávačům usnadní nalezení mapy stránek.
Základní syntax a rozšíření
Základní direktivy jsou jednoduché a čitelné. Pár příkladů zápisu (uvádíme jako inline ukázky):
- `User-agent: *` – cílí na všechny roboty.
- `Disallow: /private/` – neprocházej adresář /private/.
- `Allow: /assets/` – explicitně povolí procházení cesty, pokud jiná pravidla blokují širší oblast.
- `Sitemap: https://example.com/sitemap.xml` – odkazy na mapu stránek.
V praxi velcí vyhledávací roboti podporují i jednoduché rozšíření patternů, jako jsou hvězdičky (*) a ukončovací znak ($). Nicméně chování se může lišit mezi implementacemi, proto testujte na konkrétních cílových robotech.
Jak robots.txt ovlivňuje indexaci a kdy ho nepoužívat
Než zablokujete URL v robots.txt, rozhodněte, zda chcete URL úplně odstranit z indexu nebo jen zabránit jejímu procházení. Pokud chcete URL deindexovat, je správný postup: povolit procházení a přidat na stránku metatag `meta name="robots" content="noindex"` nebo nastavit HTTP hlavičku `X-Robots-Tag: noindex`. robots.txt není náhradou za noindex.
Příklady, kdy robots.txt NEPOUŽÍT k odstranění obsahu z výsledků:
- Stránky, které chcete, aby byly úplně deindexovány (použijte noindex místo Disallow).
- Zdroje, které jsou potřeba pro správné vykreslení stránky (CSS/JS). Jejich zablokování může zhoršit interpretaci obsahu.
Ověření a testování (krok za krokem)
1) Zkontrolujte obsah souboru přímo: stáhněte ho přes HTTP(S). Například:
Zobrazit obsah: `curl https://example.com/robots.txt`
Zobrazit pouze hlavičky: `curl -I https://example.com/robots.txt`
2) Emulujte konkrétní user‑agent, pokud chcete vidět, zda server vrací jiný obsah podle UA:
Příklad: `curl -A "Googlebot" https://example.com/robots.txt` — toto vrátí obsah souboru s nastaveným user‑agentem.
3) Pro vlastní stránky použijte Google Search Console: nástroje URL Inspection a vestavěný testér robots.txt (pokud je k dispozici) vám ukážou, zda Google vidí blokování a jaké části jsou ovlivněné.
4) Kontrola přístupnosti zdrojů: pokud blokujete CSS/JS, otestujte vykreslení v Chrome DevTools nebo pomocí robotů, abyste viděli, jak Googlebot stránku interpretuje.
5) Server‑logy a validace Googlebotu: záznamy přístupů ukážou, zda Googlebot skutečně prochází plánované URL. Uvědomte si, že user‑agent lze zfalšovat; při ověřování identity použijte reverzní DNS a porovnání s oficiálními rozsahy, pokud je to nutné.
Běžné chyby a jak je řešit
Níže jsou často opakované problémy s návrhem nebo nasazením robots.txt a konkrétní nápravy.
- Nahodilé blokování celé domény (`Disallow: /`) — problém: zablokujete crawling a Google nemusí mít přístup k důležitým stránkám. Řešení: používejte selektivní pravidla a testujte v stagingu.
- Blokování zdrojů potřebných pro vykreslení — problém: Google může špatně vyhodnotit obsah a Core Web Vitals. Řešení: povolte CSS/JS používané pro kritické vykreslení.
- Použití robots.txt k ukrytí citlivých dat — problém: robots.txt je veřejný soubor a uvádí cesty, které chcete skrýt. Řešení: použijte autentizaci nebo jiné serverové způsoby ochrany.
- Rozdíly mezi roboty — problém: některé direktivy (např. Crawl‑delay) Google ignoruje. Řešení: prověřte dokumentaci konkrétního vyhledávače a nezávisle testujte chování.
Praktické šablony a příklady
Uvedené šablony jsou výchozí, upravte je podle struktury svého webu.
Základní bezpečné nastavení pro CMS (příklad):
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cgi-bin/
Sitemap: https://example.com/sitemap.xml
Šablona pro web s interními nástroji a stagingem:
User-agent: *
Disallow: /staging/
Disallow: /internal-tools/
Disallow/
Allow: /assets/
Sitemap: https://example.com/sitemap.xml
Poznámka: pokud chcete, aby URL byly odstraněny z indexu, nepoužívejte výhradní Disallow; místo toho povolte procházení a použijte noindex nebo X‑Robots‑Tag.
Doporučený postup při nasazení
1) Test v izolovaném prostředí: nasazujte a ověřte robots.txt v testovacím stagingu.
- 2) Kontrola klíčových URL: projděte seznam důležitých stránek a ověřte, že nejsou omylem zablokované.
- 3) Monitorování po nasazení: sledujte Search Console, server‑logy a indexační signály; rychlé odhalení chybných blokací zkrátí dobu nápravy.
- 4) Dokumentace změn: verzujte robots.txt v repozitáři a zaznamenávejte důvod každého pravidla.
Pokud potřebujete doplňující přehled o širších technických postupech, Přečtěte si průvodce Technical SEO
Často kladené otázky
Může robots.txt zabránit indexaci stránky?
Ne přímo. robots.txt brání crawlerům v přístupu k obsahu, ale vyhledávače mohou stále URL indexovat na základě externích odkazů nebo jiných signálů. Pokud chcete stránku deindexovat, povolte crawling a použijte metatag `noindex` nebo HTTP hlavičku `X-Robots-Tag: noindex`.
Proč Google nebere v úvahu `Crawl-delay`?
Directive `Crawl-delay` není součástí oficiální implementace Google; Google má vlastní algoritmy řízení crawlovací rychlosti. Pokud potřebujete omezit zátěž, řeště to serverovou konfigurací, rate‑limitingem na úrovni IP nebo v nastavení hostingu.
Jak ověřím, že jsem neblokoval důležité soubory CSS/JS?
Otestujte stránku v Chrome DevTools (Lighthouse) a porovnejte vykreslení s tím, jak ji vidíte v prohlížeči. Pro vlastní domény použijte URL Inspection v Google Search Console, který ukáže, jak Google stránku renderuje. Pokud jsou klíčové zdroje blokované, povolte je v robots.txt.
Jak mohu bezpečně skrýt interní nástroje bez uvedení cest v robots.txt?
robots.txt je veřejný soubor, takže uvádění citlivých cest může vést k jejich objevení. Pro citlivé oblasti používejte autentizaci, IP‑whitelisting nebo serverové přesměrování s kontrolou přístupu. robots.txt je vhodný pro řízení crawlování, nikoli jako bezpečnostní mechanismus.
Související články

Jak používat soubor robots.txt pro SEO
Praktický návod k robots.txt: umístění souboru, základní direktivy, jak testovat a které chyby mohou poškodit indexaci a vykreslení stránek.

Nejlepší SEO služby pro optimalizaci vyhledávačů
Praktický průvodce výběrem a ověřením SEO služeb: služby, technické kontroly, on‑page, link building a měření výsledků.

SEO tipy pro lepší pozice: praktické evergreen strategie
Akční SEO checklist: technické kontroly, obsahová vylepšení, ověřitelné link-building kroky a rychlé tipy pro dlouhodobé zlepšení pozic.
