Crawling a indexing: průvodce objevováním vyhledávači
Naučíte se rozdíl mezi crawlingem a indexingem, jak je ověřit, co je často špatně a jak postupovat krok po kroku.

Co je crawling a indexing?
Crawling a indexing jsou dvě oddělené fáze zpracování webu vyhledávači. Crawling je fáze objevování a načítání — crawler (např. Googlebot) najde URL přes interní odkazy, XML sitemaps, externí odkazy nebo jiné zdroje a stáhne obsah. Indexing je následující fáze rozhodování: vyhledávač posoudí načtený obsah, příslušné signály (canonicality, meta robots, strukturovaná data) a rozhodne, zda a jak stránku uloží do indexu, ze kterého se později generují výsledky vyhledávání.
Je důležité rozlišovat crawling, indexing a ranking: crawling je objevování a stahování, indexing je ukládání do indexu a ranking je pořadí v SERP, které závisí na mnoha indexovanými signálech.
Jak crawling funguje
Zdroje objevování
Crawler začíná ze známých bodů: interních odkazů, souborů XML sitemap, externích zpětných odkazů a historicky známých URL. Zejména pro nové nebo málo navštěvované stránky jsou XML sitemaps a kvalitní interní linking klíčové pro objevitelnost.
Crawl behaviour a omezení
Crawleři rozhodují, kolik stránek a jak často budou stahovat. Faktory, které ovlivňují frekvenci a hloubku crawlování, zahrnují dostupnost serveru, stavové kódy, výkon serveru, množství změn obsahu, interní linking a historickou hodnotu obsahu. Pokud server vrací pomalé odpovědi nebo chybové kódy, crawler může snížit rychlost nebo méně často navštěvovat stránky.
Poznámka k mobilnímu crawlování: Google používá mobilní verzi jako primární základ pro indexování; od července 2024 Google pro Search crawluje primárně s Googlebot Smartphone. To znamená, že obsah dostupný jen na desktopu může být při indexaci opomenut.
Jak indexing funguje
Co vyhledávače zvažují při indexaci
Po načtení stránky vyhledávač rozhodne, zda ji zařadí do indexu. Mezi klíčové signály patří: meta robots nebo X-Robots-Tag (noindex), kanonické tagy, duplicita obsahu, kvalita a relevance obsahu, HTTP stavový kód a indexovatelnost (např. odkazy, které vedou na stránku). Stránka může být crawlovaná, ale vynechaná z indexu pokud jí vyhledávač přisoudí nízkou hodnotu nebo je explicitně označena noindex.
Praktické příklady metadat
Meta robots v HTML pro noindex: <meta name="robots" content="noindex,follow"> — X-Robots-Tag v HTTP hlavičce pro noindex: X-Robots-Tag: noindex, follow
Pro označení kanonické URL použijte v HTML: <link rel="canonical" href="https://example.com/preferred">
Verifikace a kontrola (krok za krokem)
Kontrola vlastních stránek (autoritativní)
1) URL Inspection v Google Search Console — použijte pro kontrolu, zda Google vidí stránku, jakou verzi mobilní/desktop HTML použil a zda je stránka indexovaná nebo byla vynechána (index coverage důvody).
2) Live test v URL Inspection ukáže, co Googlebot aktuálně stáhne. 3) Rich Results Test a Schema Markup Validator ověří strukturovaná data a jejich platnost. 4) Prohlédněte serverové logy a hledejte Googlebot user-agenty; serverové logy ukážou, kdy, jak často a které URL Google skutečně stáhl.
5) Ověřte XML sitemap v Search Console a zkontrolujte, zda neobsahuje náhodně noindex nebo chybné URL. 6) Použijte curl pro rychlou kontrolu HTTP hlaviček: curl -I https://example.com/page (vrátí pouze hlavičky, např. X-Robots-Tag nebo stavový kód). Pokud chcete zobrazit HTML, použijte: curl -A "Googlebot" https://example.com/page — toto simuluje požadavek od zvoleného user-agenta.
Kontrola cizích/publikovaných stránek (bez přístupu k Search Console)
Když nemáte přístup ke Search Console pro externí doménu, ověřujte z vnější perspektivy: stáhněte stránku přes curl nebo otevřete její zdroj v prohlížeči a zkontrolujte přítomnost linku v HTML. V DevTools zkontrolujte renderovaný DOM, zda je link viditelný po vykreslení JavaScriptem. Pro indexační náznaky použijte vyhledávací operátor site: (např. site:example.com "unikátní text"), ale pamatujte, že site: není definitivní důkaz indexace — je to indikace, kterou je vhodné kombinovat s jinými kontrolami.
Běžné chyby a jak je opravit
• Nechtěné noindex nebo X-Robots-Tag v hlavičkách — ověřte pomocí curl -I a URL Inspection. • Chybné canonical tagy ukazující na jiný obsah nebo na home page. • Blokování v robots.txt nebo v serverových pravidlech, které brání důležitým stránkám v crawlování. • Slabé interní prolinkování: hluboko zahnízděné stránky bez interních odkazů jsou obtížně objevitelné. • Přesměrovací smyčky a chybné 3xx/4xx/5xx odpovědi. • Závislost pouze na JavaScriptu bez server-side renderingu nebo dynamického rendering řešení — pokud je obsah důležitý pro indexaci, ověřte, že Googlebot jej skutečně renderuje a vidí.
Praktické scénáře a doporučené postupy
Nový obsah: jak ho rychle dostat do indexu
1) Zajistěte, aby stránka byla přístupná a nebyla noindex. 2) Ujistěte se, že je stránka zahrnutá v XML sitemap. 3) Použijte silné interní odkazy z relevantních stránek. 4) Pokud je stránka součástí aktualizovaného obsahu, aktualizujte nadřazené stránky a sitemapu, aby spustily přístup crawlu. 5) V Search Console použijte URL Inspection a v případě potřeby požádejte o zaindexování (praktický nástroj; není to záruka, ale může urychlit proces).
Migrace domény nebo změna struktury URL
Při migraci proveďte 301 přesměrování ze starých URL na nové, aktualizujte XML sitemap a ověřte obě domény ve Search Console. Monitorujte index coverage report a serverové logy pro neočekávané chyby. Pokud měníte kanoniky, zkontrolujte, že jasně ukazují preferovanou verzi.
JavaScriptové stránky
Pokud je obsah vykreslován klientsky, ověřte, že crawler skutečně provede render a uvidí výsledný obsah. Použijte URL Inspection 'Live test', nebo nástroje jako Chrome DevTools > Network/Rendering, případně automatizované headless prohlížeče pro kontrolu. Tam, kde je to vhodné, zvažte server-side rendering nebo předgenerování (SSG) pro důležité indexovatelné stránky.
Přečtěte si průvodce Technical SEO pro širší kontext optimální architektury a sitemap strategie.
Závěrem: co byste měli zkontrolovat pravidelně
• Stavové kódy a přesměrování (curl -I). • Náhodné noindex/X-Robots-Tag. • XML sitemap a její shoda s kanonickými URL. • Interní prolinkování a hloubka stránek v architektuře. • Serverové logy pro reálné chování crawlerů. • URL Inspection a index coverage v Google Search Console pro autoritativní diagnostiku. • Kontrola renderingu pro stránky s JS.
FAQ
Jak zjistím, jestli je moje stránka indexovaná?
Nejspolehlivěji pro vlastní stránky pomocí URL Inspection v Google Search Console. Pro veřejnou kontrolu můžete použít site: operátor nebo hledat unikátní text z dané stránky, ale tyto metody jsou indikativní, nikoli definitivní.
Proč Google stránky crawluje, ale neindexuje je?
Důvody mohou být: explicitní noindex, kanonika odkazující jinam, nízká hodnotič obsahová duplicita, nebo dočasné rozhodnutí vyhledávače kvůli kvalitě obsahu. URL Inspection v Search Console obvykle poskytne konkrétní důvod pro vynechání z indexu.
Mění se crawlování kvůli AI Overviews a jiným SERP experimentům?
Search Generative Experience a podobné funkce mění, jak výsledky vypadají, ale základní procesy crawlování a indexování zůstávají. Obsah, který je dobře strukturovaný, indexovatelný a relevantní, má lepší šanci být použit v přehledech založených na generativní AI.
Je site: dotaz spolehlivý pro kontrolu indexace externích stránek?
site: poskytuje veřejný náznak, zda Google stránku zná a zobrazuje ji. Není to definitivní důkaz indexace; Google může stránku znát, aniž by ji zobrazuje v site: výsledcích, nebo naopak. Pro vlastní stránky je URL Inspection v Search Console autoritativní.
Související články

Jak používat soubor robots.txt pro SEO
Praktický návod k robots.txt: umístění souboru, základní direktivy, jak testovat a které chyby mohou poškodit indexaci a vykreslení stránek.

Nejlepší SEO služby pro optimalizaci vyhledávačů
Praktický průvodce výběrem a ověřením SEO služeb: služby, technické kontroly, on‑page, link building a měření výsledků.

On-page SEO checklist pro lepší pozice a UX
Komplexní on-page SEO checklist s konkrétními kroky pro rychlost, obsah, strukturovaná data a ověření toho, co Google vidí.
