Skip to content
Hledat

Robots.txt — co to je a jak funguje

Robots.txt je textový soubor v kořenovém adresáři webu, který crawlerům sděluje pravidla pro procházení a indexaci stránek; určuje, co se má nebo nemá procházet, ale sám o sobě neurčuje pořadí ve výsledcích vyhledávání.

Robots.txt: Co to je a jak funguje

Co je robots.txt?

Robots.txt (robots exclusion protocol) je jednoduchý textový soubor dostupný na adrese https://tvuj-web.cz/robots.txt. Slouží jako soubor pravidel, který crawlerům (botům) sděluje, které cesty mají nebo nemají procházet. Protože je soubor veřejně přístupný, nikdy do něj nevkládejte citlivé informace.

Proč robots.txt záleží pro SEO

Robots.txt ovlivňuje fáze procházení (crawling) a indexace (indexing). Zablokováním přístupu k určitým zdrojům zabrání jejich zařazení do indexu. Má tedy nepřímý vliv na to, co se objeví ve vyhledávání, ale robots.txt sám o sobě neurčuje pořadí (ranking). Nesprávné zablokování CSS/JS nebo důležitých URL může zhoršit viditelnost a učinit stránky pro vyhledávače méně použitelné.

Jak robots.txt funguje

Když crawler narazí na doménu, nejprve se pokusí stáhnout soubor /robots.txt. Soubor obsahuje sekce s direktivami pro konkrétní user-agenty (např. User-agent: Googlebot) a pravidla Disallow/Allow. Vyhledávače tato pravidla vnímají jako pokyn, co mají procházet; některé direktivy (např. Sitemap:) jsou však pouze doporučením. robots.txt je dobrovolný protokol — běžné vyhledávací boty jej respektují, ale škodlivé boty jej mohou ignorovat.

Důležité poznámky k syntaxi a chování:

- Řádky začínají klíčovými slovy: User-agent, Disallow, Allow a Sitemap.
- Google a další hlavní vyhledávače v pravidlech podporují zástupné znaky (*) a ukončení řetězce ($); rozhodující je nejdelší shoda.
- Rozdíl mezi direktivou "Disallow" a HTTP hlavičkou "X-Robots-Tag: noindex" nebo meta tagem robots: robots.txt blokuje přístup, ale explicitně neříká vyhledávači "neindexovat" — jde o samostatné signály.

Typy robots.txt

Neexistují oficiálně "typy" robots.txt, ale v praxi narazíte na varianty podle záměru:

- Základní povolení: povolí přístup všem botům (User-agent: * / Disallow:).
- Selektivní blokace interních adresářů: zabrání procházení admin částí nebo dočasných složek.
- Specifická pravidla pro jednotlivé crawlery: platí jen pro vybrané roboty (např. User-agent: Bingbot).
- Dočasné blokování během vývoje: často se používá při stagingu, ale je třeba dbát opatrnosti, aby stránky nezůstaly dlouhodobě blokované.

Začínáme s robots.txt

1) Uložte soubor jako plain text do kořenového adresáře webu pod /robots.txt.
2) Zajistěte, aby byl soubor dostupný přes HTTPS a vracel stavový kód 200.
3) Nevkládejte citlivé cesty jako "security by obscurity" — pokud nechcete, aby se obsah zobrazoval, použijte autentizaci nebo noindex na úrovni dokumentu (pokud je indexace povolena).
4) Přidejte direktivu Sitemap, aby vyhledávače věděly, kde najít seznam URL: Sitemap: https://example.com/sitemap.xml

Běžné chyby v robots.txt

- Neúmyslné blokování CSS/JS: zablokování zdrojů potřebných pro vykreslení způsobí, že vyhledávače stránku hůře interpretují.
- Používání robots.txt místo noindex: robots.txt zablokuje přístup crawlerů, takže meta noindex na stránce nebude načteno.
- Zapomenuté staging soubory v produkci: zůstalé dočasné blokace mohou skrýt obsah.
- Příliš složitá pravidla a chybějící testování: nevalidní syntaxe nebo konflikty v pravidlech mohou způsobit nepředvídatelné důsledky.

Robots.txt kontrola: technický checklist

**Robots.txt dostupnost** — kde ověřit — passes when soubor je dostupný na /robots.txt a vrací HTTP 200.

Syntax a kompatibilita — kde ověřit — status "passes" znamená, že soubor prošel základní kontrolou (bez chyb) a že pravidla jsou interpretovatelná pro hlavní crawlery.

Zabránění blokování zdrojů pro vykreslení — kde ověřit — test projde, pokud klíčové CSS/JS nejsou blokovány a stránky se správně vykreslí v Chrome DevTools a v Google Search Console URL Inspection.

Sitemap direktiva — kde ověřit — splněno, pokud robots.txt obsahuje platný řádek Sitemap: odkazující na přístupný soubor sitemap.xml.

Test pro konkrétní boty — kde ověřit — Test projde, pokud pravidla pro Googlebot/Bingbot odpovídají očekávanému chování (ověřte pomocí user-agent testů níže).

Jak ověřit a řešit problémy (nástroje a postupy)

Rychlé kontroly v prohlížeči a přes curl

Otevřete v prohlížeči adresu https://tvuj-web.cz/robots.txt nebo stáhněte hlavičky příkazem curl -I https://tvuj-web.cz/robots.txt — tím ověříte, že soubor vrací HTTP 200. Obsah souboru zobrazíte příkazem curl bez přepínače -I: curl https://tvuj-web.cz/robots.txt.

Testování chování vůči konkrétním botům

Chcete-li simulovat, jak konkrétní user-agent vidí soubor robots.txt, použijte curl s přepínačem -A, například: curl -A "Googlebot" https://tvuj-web.cz/robots.txt. Poté otestujte konkrétní URL vůči pravidlům — ručně nebo pomocí specializovaných validátorů.

Google Search Console a další nástroje

U stránek, které vlastníte, použijte Google Search Console: URL Inspection ukáže, zda Google stránku procházel a proč (pokud je přístup zablokován robots.txt, uvidíte to tam). Pro ověření výsledků použijte také Chrome DevTools (Network/Status a Elements) a Site Explorer v Bing Webmaster Tools pro záznamy o procházení od Bingu.

Časté dotazy

Zablokuje robots.txt indexaci stránky?

Soubor robots.txt zabrání crawlerům přístupu k obsahu, takže se tento obsah obvykle nedostane do indexu. Pokud však na danou URL vedou externí odkazy, vyhledávače mohou znát její existenci i bez obsahu. Chcete-li stránku explicitně vyloučit z indexu, použijte meta tag nebo hlavičku X-Robots-Tag (za předpokladu, že je stránka crawlerům přístupná).

Mohu používat robots.txt k ochraně citlivých dat?

Ne. Soubor robots.txt je veřejně přístupný, takže cesty v něm jsou viditelné pro každého. Pro ochranu použijte autentizaci, omezení přístupu na úrovni serveru nebo správné HTTP hlavičky odpovědi.

Co když chci blokovat jen některé boty?

V robots.txt vytvořte sekce pro konkrétní user-agenty (např. User-agent: BadBotName). Mějte na paměti, že nepoctivé nebo škodlivé boty mohou robots.txt ignorovat; pravidla jsou pouze doporučením, nikoli právním závazkem.

Lees de Technical SEO Guide

Technické SEO je klíčové pro bezproblémové procházení a správnou indexaci webu; robots.txt je jen jedním z nástrojů, které byste měli spravovat spolu s mapami stránek, canonical tagy a správným vykreslováním zdrojů.

Technická kontrola souboru robots.txt a pravidel pro procházení patří k pravidelné údržbě webu. Sledujte přístupové logy a Google Search Console; změny pravidelně testujte v testovacím prostředí před nasazením do produkce.

Technické SEO je jen jedna část organického růstu. K vybudování tematické autority potřebujete kvalitní odkazy a redakční obsah. Budujte autoritu pomocí kvalitních backlinks.

Související pojmy