Crawler: mi ez és miért fontos a SEO számára
A crawler egy automatizált bot, amely weboldalakat lekér, követi a linkeket és erőforrásokat a keresőmotorok számára történő tartalomfelismeréshez; a feltérképezett oldalak indexelésre jelölt jelöltek lesznek (Google alapértelmezettként Googlebot Smartphone-ot használ since July 2024).

Mi az a crawler?
A crawler (más néven spider vagy bot) automatizált szoftver, amely weboldalakat lekér, követi a linkeket és letölti az erőforrásokat, hogy egy keresőmotor értékelni és eltárolni tudja az oldalakról származó információkat. A crawling a felfedezés szakasza: ez lehetővé teszi, hogy keresőmotorok találjanak olyan tartalmat, amely indexelhető és később megjelenhet a keresési találatok között.
A crawling különbözik az indexeléstől és a rangsorolástól: a crawling a tartalom lekérését jelenti, az indexelés a tárolásról dönt, a rangsorolás pedig a SERP-ben való sorrendet határozza meg. Az, hogy egy oldalt feltérképeznek, nem garantálja, hogy indexelik vagy jól rangsorolják.
Miért fontos a crawler a SEO számára
Ha egy keresőmotor nem tud feltérképezni egy oldalát, nem lesz lehetősége azt indexelni vagy értékelni a találatokhoz. A jó feltérképezhetőség növeli annak esélyét, hogy tartalma felfedezhető és indexelésre alkalmas legyen; a gyenge feltérképezhetőség hasznos oldalakat tarthat ki az indexből még akkor is, ha jól meg vannak írva.
A feltérképezhetőség gyakorlati SEO-hatásai közé tartozik az új tartalom időbeni felfedezése, a canonicalok pontos értelmezése és a strukturált adatok helyes értékelése. Ugyanakkor mag a crawling nem határozza meg a rangsorolási sorrendet — az indexelés és a rangsorolás különálló fázisok, amelyeket sok jel befolyásol.
Hogyan működik a crawler
A crawlerek seed URL-ekből (ismert domainek, sitemaps, korábban felfedezett linkek) indulnak, lekérik a HTML-t, és követik a linkeket további URL-ek feltárásához. Betartják a robots.txt szabályokat, és tiszteletben tartják a crawl-delay vagy host-korlátozásokat. A lekérés után egyes crawlerek renderelik a JavaScript hogy felfedezzék azokat a tartalmakat, amelyek nem szerepelnek a kezdeti HTML-ben.
Fontos jelek és vezérlők, amelyeket a crawlerek figyelembe vesznek: robots.txt, meta robots tagek, X-Robots-Tag HTTP fejléc, rel="canonical", sitemaps és a linkstruktúra. A keresőmotorok számára a sitemaps felgyorsítják a felfedezést, de nem garantálják az indexelést.
Renderelés és JavaScript
A modern kereső crawler-ek gyakran renderelik az oldalakat (végrehajtják a JavaScriptet), hogy felépítsék a végső DOM-ot, mielőtt döntenek az indexelendő tartalomról. Ha lényeges tartalom vagy linkek csak kliensoldali renderelés után kerülnek be, győződjön meg róla, hogy a crawler eléri és renderelni tudja ezeket az erőforrásokat (gyors szerverválaszok és elérhető JS/CSS).
A crawler típusai
Gyakori crawler típusok:
- Keresőmotor crawler-ek — pl. Googlebot, Bingbot: tartalmat fedeznek fel és kérnek le indexeléshez.
- Site-auditing crawler-ek — olyan eszközök, amelyeket Ön futtat (Screaming Frog, Sitebulb stb.), hogy feltérképezze a belső linkeket, státuszkódokat és az oldalon lévő elemeket.
- Archiválási vagy kutatási crawler-ek — archívumok és kutatási projektek használják webpillanatképek rögzítésére.
- Specializált crawler-ek — link-checkerek, áraggregátorok, API-k és monitoring botok, amelyek specifikus erőforrásokat vagy végpontokat kérnek le.
Hogyan kezdjen hozzá a crawlerekhez
Gyakorlati kezdő feltérképezési lépések:
1) Ellenőrizze a robots.txt-et — látogasson el a https://example.com/robots.txt oldalra, hogy megbizonyosodjon arról, hogy véletlenül nem tiltotta le a fontos útvonalakat. 2) Használjon site-auditing crawler-t a 404-ek, átirányítások és a rel=canonical használatának feltérképezéséhez. 3) Vizsgálja meg a szerverlogokat, hogy lássa, mely user-agentek kérik le az oldalait és milyen státuszkódokat kapnak. 4) Használja a Google Search Console URL Inspection-t a saját oldalakhoz a feltérképezési és indexállapot megtekintéséhez.
Amikor teszteli, hogyan lát egy adott user-agent egy oldalt, használja a curl-t a megfelelő kapcsolókkal: a csak fejléc lekéréséhez Googlebotként: curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page. A teljes HTML lekéréséhez Googlebotként (hogy megtekinthesse a forrást): curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page
Crawler ellenőrzések: technikai ellenőrzőlista
**robots.txt** — ellenőrzés helye — megfelelő, ha elérhető /robots.txt és nem tilt le fontos oldalakat azoknak a crawlereknek, amelyeket indexelni szeretne.
**HTTP status codes** — ellenőrzés helye — szerverlogok vagy curl -I; megfelelő, ha az oldalak 200-at adnak vissza (vagy 3xx a várt átirányításoknál) és nem véletlen 4xx/5xx fontos tartalmaknál.
**Meta robots / X-Robots-Tag** — ellenőrzés helye — curl -I vagy view-source; megfelelő, ha a noindex nincs jelen azoknál az oldalaknál, amelyeket indexelni szeretne, és az X-Robots-Tag fejléc nem blokkolja az indexelést.
**Rendering check** — ellenőrzés helye — Chrome DevTools (Elements) vagy egy headless renderer; megfelelő, ha a renderelt DOM-ban látható tartalom és linkek megegyeznek azzal, amit a crawlereknek szán.
**Sitemap coverage** — ellenőrzés helye — a sitemap.xml és a szerverlogok; megfelelő, ha a sitemap canonical URL-eket sorol fel, és ezek az URL-ek elérhetők (200/3xx) a crawlerek számára.
Gyakori crawler hibák
Gyakori problémák, amelyek csökkentik a crawl hatékonyságát:
- Véletlenül történő crawlerek letiltása a robots.txt-ben vagy X-Robots-Tag meta fejléc révén.
- Erős támaszkodás kliensoldali renderelésre anélkül, hogy biztosítaná, hogy a crawlerek renderelni tudják a szükséges JS erőforrásokat, ami hiányzó tartalomhoz vezet a renderelt DOM-ban.
- Crawl trap-ek (végtelen URL-es naptárak, faceted navigáció paraméterkezelés nélkül), amelyek pazarlják a crawl budget-et és duplikált URL-eket generálnak.
- Hibásan alkalmazott canonical tagek vagy következetlen átirányítási láncok, amelyek miatt a crawlerek a rossz verziót indexelik egy oldalból.
Gyakran ismételt kérdések
Honnan tudhatja, hogy a Google feltérképezte-e az oldalát?
Saját tulajdonú webhelyeknél használja a Google Search Console URL Inspection-t az utolsó feltérképezés megtekintéséhez és indexelés kéréséhez. Harmadik fél webhelyeknél a szerverlogok, amelyek Googlebot user-agenteket mutatnak, vagy egy külső curl teszt Googlebot user-agenttel bizonyítékot adhatnak. A site: operátor nyilvános jel lehet, de nem végleges bizonyítéka az indexálásnak.
Milyen user-agentet használnak a crawlerek?
A keresőmotorok közzéteszik a tipikus user-agent stringeket (Googlebot esetén egy gyakori string: "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"). Használja a curl -A-t user-agent utánzására teszteléskor, de a szerverlogokra támaszkodjon a crawler-tevékenység hiteles bizonyításához.
Egyenlő a crawling és a rangsorolás?
Nem. A crawling felfedezhetővé teszi a tartalmat; az indexelés alkalmassá teszi a megjelenést a keresésben; a rangsorolás határozza meg a sorrendet. Egy feltérképezett és indexált oldal még mindig rosszul szerepelhet, ha a többi rangsorolási jel gyenge.
Olvassa el a Technical SEO Guide-ot
Ha crawl problémákat kell hibaelhárítani, kezdje a szerverlogokkal és egy célzott curl teszttel (fejlécek és teljes HTML), majd ellenőrizze a renderelt DOM-ot a Chrome DevTools-ban. Használja a Google Search Console URL Inspection-t a saját oldalakhoz és Bing Webmaster Tools Site Explorer-t, hogy összehasonlíthassa, hogyan lépnek interakcióba különböző keresőmotorok az Ön webhelyével.
Építsen tekintélyt minőségi backlinks-szel. A Technical SEO és a feltérképezhetőség felfedezhetővé teszik az Ön tartalmát; a témába vágó autoritás építése releváns backlinks-szel segíti a keresőmotorokat a relevancia és a bizalom értékelésében.
Related terms

On-page SEO: definition, checklist and verification
On-page SEO is optimizing a page's content, HTML and UX so it is relevant, indexable and useful to users and modern search engines — covering mobile-first rendering, structured data, canonicals and page performance.

Search engine rankings: definition and how they work
Search engine rankings are the order in which search engines present indexed pages for a specific query; rankings reflect many signals—relevance, backlinks, content quality, page experience and user intent—and interact with AI overviews in 2026.

Meta tags: types, uses, and SEO best practices
Meta tags are HTML elements that provide metadata about a page (title, description, robots directives, social preview tags and others). Search engines and platforms read them to influence indexing, SERP snippets and presentation.

Search engines: how they work and SEO basics
Search engines are software systems that discover, crawl, index, and retrieve web content to answer user queries; modern SERPs also surface AI Overviews, rich results, and ranked listings determined by many signals.

Search algorithm: definition, how it works & SEO impact
A search algorithm is the set of software rules search engines use to discover, crawl, index and rank web pages for queries by combining relevance signals, content quality, link signals and AI-derived intent models to order results.

Keywords in SEO: definition, value and checklist
Keywords in SEO are the words and phrases users type into search engines; they guide topic selection, on-page signals, targeting for organic visibility, and measurement of search performance across devices and SERP features.
