Skip to content

Jak používat soubor Robots.txt pro SEO

Zjisti, jak používat soubor robots.txt pro SEO. Ovládej procházení vyhledávači, zlepši indexaci a chraň soukromé stránky správným nastavením robots.txt.

How to Use Robots.txt File for SEO

Věděl jsi, že Robots.txt je jednou z klíčových věcí pro SEO tvého webu? Co přesně je Robots.txt a jak ho využiješ pro SEO? V tomto příspěvku si to vysvětlíme.

Co je Robots.txt?

V kořenovém adresáři webu jsou soubory, které říkají vyhledávačům a spiderům, které stránky a soubory by měly vidět a které ne. Weboví administrátoři často chtějí, aby jejich stránky byly nalezeny vyhledávači, ale někdy to není nutné. Pokud uchováváš soukromé informace nebo se snažíš ušetřit místo, můžeš zabránit vyhledávači v indexování tvých souborů (kromě velkých stránek s obrázky).

Standard vyloučení robotů, známý také jako protokol vyloučení robotů nebo jednoduše robots.txt, je standard používaný webyke komunikaci s webovými procházeči a dalšími webovými roboty.

Roboti jsou často používáni vyhledávači k zařazování webových stránek. Ne všichni roboti se standardem spolupracují; sběrači e-mailů, spamboti, malware a roboti, kteří skenují bezpečnostní zranitelnosti, mohou dokonce začít s částmi webu, kam jim bylo řečeno, aby nevstupovali. Standard lze použít ve spojení se Sitemaps, standardem pro zahrnutí robotů pro webové stránky. – Wikipedia

Vyhledávače, které používají klíčová slova a metadata k indexování webových stránek, zobrazují nejrelevantnější výsledky lidem, kteří něco hledají na internetu. Pro majitele online obchodů je důležitější dosáhnout dobrých výsledků ve vyhledávačích než pro jakýkoli jiný podnik. Lidé obvykle nepřekročí prvních několik stránek výsledků z návrhů vyhledávače .

Indexování se provádí pomocí spiderů nebo procházečů, kteří se pohybují. Takto vyhledávače získávají a organizují všechny informace na internetu. Tyto společnosti používají tyto boty.

How to Use Robots.txt File for SEO

robots.txt je soubor, který procházeči hledají, když poprvé navštíví web. Jakmile procházeč takový soubor najde, bude v něm hledat pokyny, jak indexovat web. Pro bota, který je nenajde, neexistují žádné pokyny, takže používá algoritmus svého fungování k jejich vyhledávání. To způsobuje, že mnoho lidí hledá věci na webu, ale také to snižuje efektivitu procesu indexování.

Aby soubor robots.txt fungoval, může být na webu pouze jeden. Doplňková doména musí mít soubor robots.txt v kořenovém adresáři své webové stránky. Například by měl být na https://www.domain.com/robots.txt a měl by robotům říkat, aby na tento web nechodili.

Robots.txt je také důležité, aby se tvůj soubor jmenoval robots.txt. Pokud název není správně napsán, nebude fungovat.

Získej kontrolu

Máš větší kontrolu nad SEO svého webu, než si myslíš.

Obecně to platí. Můžeš si vybrat, které procházeče a indexery mohou vidět a indexovat tvůj web na úrovni stránky. Existuje soubor robots.txt, který lze použít k tomu, aby se to už nestalo. V kořenovém adresáři tvého webu je jednoduchý textový soubor robots.txt. Tento soubor říká webovým robotům, aby tvůj web nečetli. Roboti mohou tyto informace použít k zlepšení svých výsledků vyhledávání, aby byly konkrétnější.

Protože to není všelék, zjistil jsi, že je to skvělý způsob, jak dostat tvůj web viditelný pro vyhledávače. Pokud chceš, aby se vyhledávačům tvůj web líbil, musíš udělat dobrý první dojem. Správným způsobem může použití robots.txt pomoci s SEO.

Takže, jak na to? K čemu to slouží? Co bys nikdy neměl dělat? Odpovědi na tyto otázky najdeš na další stránce.

Důvod k použití Robots.txt

Robots.txt je soubor, který vyhledávače používají k určení, které stránky na tvém webu indexovat a které vynechat z výsledků vyhledávání. Například, pokud v souboru Robots.txt uvedeš, že tvá děkovná stránka by neměla být dostupná pro vyhledávače, tato stránka se neobjeví ve výsledcích vyhledávání a nebude přístupná lidem, kteří ji hledají na webu. Některé stránky tvého webu musí být skryty před vyhledávači jak z důvodu soukromí, tak z důvodu rankingu. To je důležité pro obojí.

Kde najít soubor Robots?

Get in control

Pokud máš web, soubor robots.txt je v kořenovém adresáři tvého webu. Přihlas se do svého FTP cPanelu a hledej ho ve veřejné HTML oblasti tvého účtu. Tyto soubory nezabírají mnoho místa. Mohou mít jen několik stovek bytů. Pokud žádný nenajdeš, budeš si ho muset vytvořit.

Jak funguje Robots.txt

Když vyhledávače chtějí indexovat tvůj web, posílají malé programy zvané „spiders“ nebo „roboti“, které procházejí tvůj web a vracejí data vyhledávačům. Direktivy „Disallow“ v Robots.txt instruují vyhledávače a další programy, aby nehledaly určité stránky na tvém webu, které specifikuješ v příkazu. V souboru robots.txt lze nalézt následující příkazy:

zabraní všem robotům vyhledávačů v přístupu na následující stránku na tvém webu: http:://www.yoursite.com/thankyou

Před příkazem disallow je příkaz: „User-agent: * “. Část User-agent identifikuje, kterého robota si přeješ zakázat.

„User-agent: Googlebot“. Tento příkaz by zabránil v přístupu na web pouze robotům Google; ostatní by k němu stále měli přístup: http://www.yoursite.com/thankyou

Použitím znaku „*“ však určíš, že níže uvedené příkazy se vztahují na všechny roboty. Tvůj soubor robots.txt by se nacházel v hlavním adresáři tvého webu. Například: http://www.yoursite.com/robots.txt

Jak sestavit soubor Robots.txt

How to Put Together a Robots.txt File

Tento jednoduchý textový soubor může vytvořit kdokoli. K psaní textu potřebuješ textový editor jako Poznámkový blok. Otevři nový textový soubor a ulož ho jako „robots.txt“, poté do něj napiš. Když jsi ve svém cPanelu, přejdi do veřejné HTML složky a klikni na ni. Začni tím, že se ujistíš, že soubor již existuje.

Pokud vše vypadá dobře, máš hotovo. Pouze vlastník souboru by ho měl být schopen vidět a měnit. Aby soubor fungoval, musí mít oprávnění „0644“.

Pokud ne, klikni pravým tlačítkem na soubor a zvol „změnit oprávnění“. A je to! Existuje soubor robots.txt, který obsahuje instrukce pro roboty. Syntax Robots.txt. Soubor robots.txt má více sekcí „direktiv“ pro každého nastaveného uživatelského agenta. Každá začíná názvem uživatelského agenta. Každý procházecí bot je identifikován svým ID uživatelského agenta podle kódu.

Existují dva způsoby, jak to udělat: Pokud použiješ zástupný znak, můžeš cílit na všechny vyhledávače současně. Můžeš si vybrat, na které vyhledávače chceš cílit. Když spustíš procházeče, půjde do těch částí webu, které jsou pro něj nejméně vhodné. Půjde to takto:

Direktiva User-Agent

Prvních několik řádků každého bloku obsahuje user-agent, který identifikuje bota. Takže například: pokud chceš říct Googlebotu, co má dělat, začal bys s:

User-agent: Googlebot Zpravidla vyhledávače hledají nejrelevantnější informace.

Dokud máš nastavenou direktivu Googlebot-Video a Bingbot. User-agent ‚Bingbot‘ bude postupovat podle pokynů. Od Googlebot-Video můžeš očekávat přesnější instrukce.

Níže jsou uvedeni nejčastěji používaní roboti vyhledávačů.

Direktiva Disallow

Boti nebudou mít přístup k určitým částem tvého webu, pokud tuto funkci povolíš. Nic nebrání botům v cestování po internetu a přístupu k jakýmkoli webům, které se jim líbí.

Direktiva Sitemap (XML Sitemaps)

Tato meta tag říká vyhledávačům, kde je tvůj sitemap. Musíš je odeslat do Google Search Console vyhledávačů, aby byly nalezeny. Bylo by dobré, kdybys používal každý z těchto nástrojů, protože ti mohou hodně prozradit o tvém webu.

Když je důležitá rychlost, použij direktivu nazvanou „sitemap“.

Direktiva Crawl-Delay

Pokud chceš trochu zpomalit Yahoo, Bing a Yandex při procházení, můžeš vložit direktivu nazvanou „crawl-delay“. Následující se stane, když tuto řádku vložíš do svého bloku:

Crawl-Delay:10 Počkej deset sekund před procházením.

Když je vyhledávač nastaven, může být nastaven tak, aby čekal deset sekund před procházením webu nebo deset sekund před návratem na web po procházení. Efekt je téměř stejný, ale mírně se liší v závislosti na použitém vyhledávači. Po procházení Crawl-delay o hodnotě 1 znamená, že vyhledávače začnou web procházet okamžitě.

Použití Google Search Console k vytvoření Robots.txt

Vyber „přístup procházeče“ z nabídky pro rychlé vytvoření souboru robots.txt s bezplatným účtem Google Search Console. Pro vytvoření základního souboru Robots.txt zvol „generovat robots.txt“, když se dostaneš na web.

Pod „akcí“ zvol „blokovat“ a pod „User-agent“ zvol, které roboty nechceš vidět na svém webu. Zvol „adresáře a soubory“ a zadej názvy složek, které chceš udržet mimo dosah. „http://www.yoursite.com“ by nemělo být součástí této strategie v žádném případě. Například, pokud nechceš, aby lidé viděli níže uvedené stránky, můžeš:

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

V Google Search Console zadej následující do pole „adresáře a soubory“:/thank-you

  • /free-stuff
  • /private

Po zadání těchto údajů pro všechny roboty a kliknutí na „přidat pravidlo“ by konečný soubor Robots.txt vypadal takto.

Po zadání těchto údajů pro všechny roboty a kliknutí na „přidat pravidlo“ by konečný soubor Robots.txt vypadal takto.

Existuje výchozí příkaz „Allow“, pokud chceš udělat výjimku a povolit robotovi přístup na web, který jsi zablokoval příkazem.

Using Google Webmaster Tools to create Robots.txt

Googlebot se dostane do adresáře s fotkami tvého webu pouze v případě, že je příkaz zákazu umístěn vedle něj. Poté klikni na „stáhnout“ pro získání souboru Robots.txt. Klikni na „stáhnout“, když jsi vybral stránky a soubory, které chceš blokovat, klikni na „stáhnout“.

Nainstaluj soubor Robots.txt

Soubor nazvaný „Robots.txt“ lze nyní přidat do hlavního (www) adresáře oblasti CNC tvého webu. To znamená, že ho lze nyní najít. Filezilla je pro to dobrý FTP klient. Nech si vytvořit soubor robots.txt webovým programátorem poté, co mu dáš seznam URL, které by měly být blokovány před procházením. Toto je další možnost. V tomto případě zkušený webový vývojář dokončí práci za méně než hodinu.

Noindex vs. Disallow

Mnoho lidí neví, které pravidlo použít v souboru robots.txt tvého webu v navigační liště. Je to proto, že důvody uvedené v předchozí sekci způsobují, že pravidla Robots.txt no index již nefungují.

Tvůj web může mít „noindex“ meta tag, který můžeš použít k zabránění vyhledávačům v indexování jedné z tvých webových stránek. Zpravidla tento tag umožní webovým robotům navštívit tvůj web, ale také řekne vyhledávačům, aby tvou stránku neindexovaly.

Z dlouhodobého hlediska nemusí být tak účinný jako tag noindex. Pravidlo disallow nemusí být tak účinné jako tento tag. To je dobré, protože robots.txt zabraňuje vyhledávačům ve skenování tvé stránky. Nezabrání jim v indexování tvé stránky na základě informací z jiných stránek a webů, což je dobré.

Je důležité si pamatovat, že i když zakážeš a přidáš tag noindex na stránku, roboti o tagu nebudou vědět a mohou stránku indexovat dál, i když to uděláš.

Mistakes you will want to avoid

Chyby, kterým se budeš chtít vyhnout

Dozvěděl ses o mnoha věcech, které můžeš dělat se souborem robots.txt a jak ho můžeš používat. V této části si podrobněji probereme každý problém a ukážeme, jak by jeho nesprávné použití mohlo mít špatný vliv na SEO.

Nemůžeš použít soubor robots.txt nebo tag „noindex“ k zabránění lidem v přístupu k užitečným informacím, které chceš zveřejnit. V minulosti jsme viděli mnoho takových věcí, které se staly s SEO. Všechny měly špatný vliv na výsledky. Je důležité zajistit, aby všechny tvé webové stránky měly tagy a pravidla noindex a noblock, než půjdou do provozu.

Pokud používáš direktivy crawl-delay, neměl bys je používat příliš často. Je to proto, že omezují počet stránek, na které se boti mohou podívat. Na druhou stranu, velký web ti může ztížit získání vysokých rankingů a získání mnoha návštěvníků.

Aby se zajistilo, že soubor tvého robota je správně přečten, musíš použít správný formát Robots.txt pro svůj soubor. Všechna písmena by měla být malá, když je v souboru robota. Měl by se jmenovat „robots.txt“. Pokud ne, nemůže fungovat.

Závěr – Otestuj svůj Robots.TXT

Tvůj soubor by měl být nyní zkontrolován, aby se ujistil, že funguje správně. Existuje testovací pole robots.txt, které můžeš použít v Google Search Console, ale pouze pokud jsi používal starou Google Search Console, která se již nepoužívá. Tester robots.txt již nefunguje kvůli nejnovější GSC (Google usilovně pracuje na přidávání nových funkcí do GSC, takže možná v budoucnu budeme moci vidět tester Robots.txt v hlavní navigaci).

Pokud se chceš dozvědět více o tom, co dokáže tester Robots.txt, přejdi na stránku nápovědy Google. Existuje další užitečný nástroj:

Vyber projekt z rozbalovací nabídky vpravo. Například můžeš pracovat na webu pro svou společnost nebo na jiném projektu.

Chceš-li nahradit starý soubor robots.txt tím, který jsi právě vytvořil, musíš nejprve vše vyjmout z pole. Pro spuštění testu klikni na „Test“.

Hodnota „Test“ by měla být změněna na „Allowed“. Tím se zajistí, že tvůj soubor robots.txt funguje správně.

Zajištěním správnosti souboru robots.txt můžeš zlepšit výkon svého webu ve vyhledávačích a user experience svých návštěvníků zároveň. Je pro tebe snazší kontrolovat, co lidé vidí, když hledají věci na tvém webu, pokud roboti mohou trávit dny jeho prohlížením a indexováním.

Často kladené otázky

Související články

Jak používat soubor Robots.txt pro SEO · BlogDrip