Skip to content
Hledat

Jak používat soubor robots.txt pro SEO

Praktický návod k robots.txt: umístění souboru, základní direktivy, jak testovat a které chyby mohou poškodit indexaci a vykreslení stránek.

Jak používat soubor Robots.txt pro SEO

Co je robots.txt a jak funguje

Soubor robots.txt je jednoduchý textový soubor umístěný v kořenovém adresáři hostitele (např. https://www.domain.com/robots.txt). Slouží k poskytování instrukcí webovým robotům o tom, které části webu mohou nebo nemají procházet. Je důležité rozlišit tři kroky, které mají na SEO rozdílný vliv:

- Crawling (objevování a načítání URL)

- Indexing (rozhodnutí, co uložit do indexu)

- Ranking (pořadí v SERP, které závisí na mnoha signálech)

Robots.txt ovlivňuje především crawling. Když robot najde při první návštěvě kořenový robots.txt, použije instrukce v něm pro další procházení. Pozor: ne všichni roboti pravidla dodržují — škodlivé crawlery nebo spamboti může obsah souboru ignorovat. Soubor také nemá zabezpečovací funkci: veřejně zveřejněné cesty v robots.txt jsou viditelné komukoli.

Základní syntax a příklady

Robots.txt používá jednoduché direktivy. Níže je minimální, ale praktický příklad souboru:

User-agent: *
Disallow: /private/
Allow: /public/images/
Sitemap: https://www.domain.com/sitemap.xml
# komentáře začínají mřížkou

Vysvětlení direktiv:

User-agent: identifikuje, kterému robotovi se pravidla vztahují (např. Googlebot nebo * pro všechny).

Disallow: cesta, kterou robot nemá procházet. Hodnota "/" zakáže celý hostitel.

Allow: u přebíhajících pravidel (u některých crawlerů) explicitně povolí podcestu. Google zpracovává kombinaci Allow/Disallow podle nejpřesnější shody.

Pokročilejší vzory

Google i další hlavní vyhledávače podporují zástupné znaky jako "*" a ukončovací znak "$" v Disallow/Allow pravidlech. To umožňuje vytvářet přesnější soubory, ale syntaxi testujte před nasazením.

Co robots.txt neudělá a jak zabránit indexaci

Robots.txt zabraňuje převážně crawlování, nikoli nutně indexování URL. I když stránku zablokujete v robots.txt, vyhledávač může URL objevit z externích odkazů a zařadit ji do indexu bez obsahu. Aby stránka nebyla indexována, použijte meta tag "noindex" nebo hlavičku "X-Robots-Tag" a ponechte přitom přístup pro procházení, aby robot mohl meta direktivu nebo hlavičku číst. Pokud robot nemůže stránku načíst kvůli robots.txt, nebude moci vidět meta tag noindex.

Alternativy pro odstranění z indexu: vrátit 404/410, ochrana heslem (výsledek: neindexováno), nebo pro vlastník webu použít nástroj pro dočasné odstranění z Search Console. Poznámka: Google odstranil tradiční zobrazení cachovaných stránek v raných měsících roku 2024, takže očekávané chování cache se liší oproti dřívějšku.

Kontrola a ladění: praktické kroky

Před nasazením a po změnách robots.txt projděte tyto kroky:

  • Uložení v kořeni: ujistěte se, že soubor je dosažitelný na přesné adrese https://www.domain.com/robots.txt nebo na příslušném hostiteli (http/https, www vs non-www má samostatný robots.txt).
  • Rychlá kontrola přes curl: curl -I https://www.domain.com/robots.txt zkontroluje HTTP hlavičky; pro obsah použijte curl https://www.domain.com/robots.txt
  • Zkontrolujte chování pro Googlebot Smartphone: Google používá mobilní verzi jako primární základ pro crawling a indexování; od července 2024 Google pro Search standardně prochází s Googlebot Smartphone. Ujistěte se, že mobilní zdroje (CSS, JS, obrázky) nejsou zablokované.
  • Pro vlastní stránky: použijte URL Inspection v Google Search Console, abyste ověřili, zda je URL blokovaná robots.txt a jak Google stránku vidí. Pro externí stránky použijte curl, prohlížeč a kontroly v Bing Webmaster Tools Site Explorer.
  • Site: operátor (např. site:example.com "unikátní fráze") může indikovat, že Google zná stránku, ale není to definitivní ověření indexace; pro vlastněné stránky je URL Inspection autoritativní.

Kontrola serverových logů a user-agentů

Pro ověření, že robot skutečně navštívil váš obsah, sledujte serverové logy a hledejte záznamy s user-agentem Googlebot (smartphone a desktop) nebo s jinými relevantními user-agenty. Logy také pomohou odhalit nečekané 5xx/4xx odpovědi na robots.txt nebo na důležité zdroje.

Běžné chyby a doporučení

Seznam nejčastějších chyb, které vidíme u správců webů:

  • Blokování CSS/JS nebo obrázků používaných pro vykreslení stránky – to může zhoršit zobrazení a měření Core Web Vitals, protože Google nemusí mít přístup k těmto zdrojům.
  • Používání robots.txt k "skrývání" citlivých dat – robots.txt je veřejně dostupný a nechrání obsah.
  • Nesprávné umístění souboru (např. http://www.yoursite.com/robot.txt nebo v podadresáři) — platný soubor musí být v kořeni hostitele, např. http://www.yoursite.com/robots.txt.
  • Překlepy v cestách a chybné použití lomítek či velkých/malých písmen – cesty mohou být citlivé na velikost písmen v závislosti na serveru.

Nezapomeňte, že robots.txt je veřejný: neumisťujte do něj seznamy tajných adres (např. /private nebo odkazy na interní soubory). Pokud je potřeba skrýt obsah, použijte autentizaci nebo HTTP hlavičky/HTTP statusy.

Kontrolní seznam před nasazením

  • Umístění souboru v kořeni a přístupnost na správném protokolu a subdoméně (https vs http, www vs non-www).
  • Povolení zdrojů potřebných pro vykreslení (CSS, JS, obrázky) zvláště pro Googlebot Smartphone.
  • Přidání direktivy Sitemap, aby crawleři snadněji našli indexovatelné URL (např. Sitemap: https://www.domain.com/sitemap.xml).
  • Testování přes curl a URL Inspection v Search Console pro vlastní doménu; sledování serverových logů po nasazení.

Pokud potřebujete dočasně zamezit indexaci určité URL, použijte meta noindex a povolte crawlování té stránky, nebo použijte vhodný HTTP status. Nepoužívejte pouze Disallow, pokud chcete zajistit odstranění z indexu.

Ukázky: časté scenáře

Neviditelná administrace (příklad)

Pokud máte administrační rozhraní na adrese http://www.yoursite.com/private a nechcete, aby bylo crawlováno, přidejte do robots.txt řádek:

User-agent: *
Disallow: /private/

Povolení přístupu k obrázkům na samostatném místě

Chcete-li zablokovat většinu parametrických URL, ale povolit konkrétní adresáře s obrázky, použijte kombinaci Disallow a Allow:

User-agent: *
Disallow: /?*
Allow: /public/images/
Sitemap: https://www.domain.com/sitemap.xml

Časté otázky

Může robots.txt zabránit indexaci stránky?

Sám o sobě robots.txt primárně kontroluje crawling. Pokud stránku zablokujete, vyhledávač ji nemusí načíst a nemusí vidět meta noindex. Nicméně URL může být indexována na základě odkazů z jiných stránek. Pokud chcete spolehlivě zabránit indexaci, použijte meta noindex (a povolte crawlování), HTTP autentizaci nebo vraťte 404/410.

Je robots.txt bezpečný místo pro utajení citlivých dat?

Ne. Robots.txt je veřejný soubor. Uvedené cesty vidí kdokoli (včetně útočníků). K citlivým zdrojům používejte autentizaci, omezení přístupu na úrovni serveru nebo vhodné HTTP odpovědi.

Jak zjistím, že Google stránku zablokoval kvůli robots.txt?

Pro vlastní stránky použijte URL Inspection v Google Search Console; nástroj vám ukáže, zda je URL blokovaná robots.txt. Pro externí stránky zkontrolujte robots.txt přes curl a sledování serverových logů. Operátor site: může poskytnout indikaci indexace, ale není definitivní.

Více podrobností o technickém SEO a dobrých praktikách najdete v našem průvodci: Přečtěte si průvodce Technical SEO.

Související články