Crawler: mi ez és miért fontos a SEO számára
A crawler egy automatizált bot, amely weboldalakat lekér, követi a linkeket és erőforrásokat a keresőmotorok számára történő tartalomfelismeréshez; a feltérképezett oldalak indexelésre jelölt jelöltek lesznek (Google alapértelmezettként Googlebot Smartphone-ot használ since July 2024).

Mi az a crawler?
A crawler (más néven spider vagy bot) automatizált szoftver, amely weboldalakat lekér, követi a linkeket és letölti az erőforrásokat, hogy egy keresőmotor értékelni és eltárolni tudja az oldalakról származó információkat. A crawling a felfedezés szakasza: ez lehetővé teszi, hogy keresőmotorok találjanak olyan tartalmat, amely indexelhető és később megjelenhet a keresési találatok között.
A crawling különbözik az indexeléstől és a rangsorolástól: a crawling a tartalom lekérését jelenti, az indexelés a tárolásról dönt, a rangsorolás pedig a SERP-ben való sorrendet határozza meg. Az, hogy egy oldalt feltérképeznek, nem garantálja, hogy indexelik vagy jól rangsorolják.
Miért fontos a crawler a SEO számára
Ha egy keresőmotor nem tud feltérképezni egy oldalát, nem lesz lehetősége azt indexelni vagy értékelni a találatokhoz. A jó feltérképezhetőség növeli annak esélyét, hogy tartalma felfedezhető és indexelésre alkalmas legyen; a gyenge feltérképezhetőség hasznos oldalakat tarthat ki az indexből még akkor is, ha jól meg vannak írva.
A feltérképezhetőség gyakorlati SEO-hatásai közé tartozik az új tartalom időbeni felfedezése, a canonicalok pontos értelmezése és a strukturált adatok helyes értékelése. Ugyanakkor mag a crawling nem határozza meg a rangsorolási sorrendet — az indexelés és a rangsorolás különálló fázisok, amelyeket sok jel befolyásol.
Hogyan működik a crawler
A crawlerek seed URL-ekből (ismert domainek, sitemaps, korábban felfedezett linkek) indulnak, lekérik a HTML-t, és követik a linkeket további URL-ek feltárásához. Betartják a robots.txt szabályokat, és tiszteletben tartják a crawl-delay vagy host-korlátozásokat. A lekérés után egyes crawlerek renderelik a JavaScript hogy felfedezzék azokat a tartalmakat, amelyek nem szerepelnek a kezdeti HTML-ben.
Fontos jelek és vezérlők, amelyeket a crawlerek figyelembe vesznek: robots.txt, meta robots tagek, X-Robots-Tag HTTP fejléc, rel="canonical", sitemaps és a linkstruktúra. A keresőmotorok számára a sitemaps felgyorsítják a felfedezést, de nem garantálják az indexelést.
Renderelés és JavaScript
A modern kereső crawler-ek gyakran renderelik az oldalakat (végrehajtják a JavaScriptet), hogy felépítsék a végső DOM-ot, mielőtt döntenek az indexelendő tartalomról. Ha lényeges tartalom vagy linkek csak kliensoldali renderelés után kerülnek be, győződjön meg róla, hogy a crawler eléri és renderelni tudja ezeket az erőforrásokat (gyors szerverválaszok és elérhető JS/CSS).
A crawler típusai
Gyakori crawler típusok:
- Keresőmotor crawler-ek — pl. Googlebot, Bingbot: tartalmat fedeznek fel és kérnek le indexeléshez.
- Site-auditing crawler-ek — olyan eszközök, amelyeket Ön futtat (Screaming Frog, Sitebulb stb.), hogy feltérképezze a belső linkeket, státuszkódokat és az oldalon lévő elemeket.
- Archiválási vagy kutatási crawler-ek — archívumok és kutatási projektek használják webpillanatképek rögzítésére.
- Specializált crawler-ek — link-checkerek, áraggregátorok, API-k és monitoring botok, amelyek specifikus erőforrásokat vagy végpontokat kérnek le.
Hogyan kezdjen hozzá a crawlerekhez
Gyakorlati kezdő feltérképezési lépések:
1) Ellenőrizze a robots.txt-et — látogasson el a https://example.com/robots.txt oldalra, hogy megbizonyosodjon arról, hogy véletlenül nem tiltotta le a fontos útvonalakat. 2) Használjon site-auditing crawler-t a 404-ek, átirányítások és a rel=canonical használatának feltérképezéséhez. 3) Vizsgálja meg a szerverlogokat, hogy lássa, mely user-agentek kérik le az oldalait és milyen státuszkódokat kapnak. 4) Használja a Google Search Console URL Inspection-t a saját oldalakhoz a feltérképezési és indexállapot megtekintéséhez.
Amikor teszteli, hogyan lát egy adott user-agent egy oldalt, használja a curl-t a megfelelő kapcsolókkal: a csak fejléc lekéréséhez Googlebotként: curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page. A teljes HTML lekéréséhez Googlebotként (hogy megtekinthesse a forrást): curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page
Crawler ellenőrzések: technikai ellenőrzőlista
**robots.txt** — ellenőrzés helye — megfelelő, ha elérhető /robots.txt és nem tilt le fontos oldalakat azoknak a crawlereknek, amelyeket indexelni szeretne.
**HTTP status codes** — ellenőrzés helye — szerverlogok vagy curl -I; megfelelő, ha az oldalak 200-at adnak vissza (vagy 3xx a várt átirányításoknál) és nem véletlen 4xx/5xx fontos tartalmaknál.
**Meta robots / X-Robots-Tag** — ellenőrzés helye — curl -I vagy view-source; megfelelő, ha a noindex nincs jelen azoknál az oldalaknál, amelyeket indexelni szeretne, és az X-Robots-Tag fejléc nem blokkolja az indexelést.
**Rendering check** — ellenőrzés helye — Chrome DevTools (Elements) vagy egy headless renderer; megfelelő, ha a renderelt DOM-ban látható tartalom és linkek megegyeznek azzal, amit a crawlereknek szán.
**Sitemap coverage** — ellenőrzés helye — a sitemap.xml és a szerverlogok; megfelelő, ha a sitemap canonical URL-eket sorol fel, és ezek az URL-ek elérhetők (200/3xx) a crawlerek számára.
Gyakori crawler hibák
Gyakori problémák, amelyek csökkentik a crawl hatékonyságát:
- Véletlenül történő crawlerek letiltása a robots.txt-ben vagy X-Robots-Tag meta fejléc révén.
- Erős támaszkodás kliensoldali renderelésre anélkül, hogy biztosítaná, hogy a crawlerek renderelni tudják a szükséges JS erőforrásokat, ami hiányzó tartalomhoz vezet a renderelt DOM-ban.
- Crawl trap-ek (végtelen URL-es naptárak, faceted navigáció paraméterkezelés nélkül), amelyek pazarlják a crawl budget-et és duplikált URL-eket generálnak.
- Hibásan alkalmazott canonical tagek vagy következetlen átirányítási láncok, amelyek miatt a crawlerek a rossz verziót indexelik egy oldalból.
Gyakran ismételt kérdések
Honnan tudhatja, hogy a Google feltérképezte-e az oldalát?
Saját tulajdonú webhelyeknél használja a Google Search Console URL Inspection-t az utolsó feltérképezés megtekintéséhez és indexelés kéréséhez. Harmadik fél webhelyeknél a szerverlogok, amelyek Googlebot user-agenteket mutatnak, vagy egy külső curl teszt Googlebot user-agenttel bizonyítékot adhatnak. A site: operátor nyilvános jel lehet, de nem végleges bizonyítéka az indexálásnak.
Milyen user-agentet használnak a crawlerek?
A keresőmotorok közzéteszik a tipikus user-agent stringeket (Googlebot esetén egy gyakori string: "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"). Használja a curl -A-t user-agent utánzására teszteléskor, de a szerverlogokra támaszkodjon a crawler-tevékenység hiteles bizonyításához.
Egyenlő a crawling és a rangsorolás?
Nem. A crawling felfedezhetővé teszi a tartalmat; az indexelés alkalmassá teszi a megjelenést a keresésben; a rangsorolás határozza meg a sorrendet. Egy feltérképezett és indexált oldal még mindig rosszul szerepelhet, ha a többi rangsorolási jel gyenge.
Olvassa el a Technical SEO Guide-ot
Ha crawl problémákat kell hibaelhárítani, kezdje a szerverlogokkal és egy célzott curl teszttel (fejlécek és teljes HTML), majd ellenőrizze a renderelt DOM-ot a Chrome DevTools-ban. Használja a Google Search Console URL Inspection-t a saját oldalakhoz és Bing Webmaster Tools Site Explorer-t, hogy összehasonlíthassa, hogyan lépnek interakcióba különböző keresőmotorok az Ön webhelyével.
Építsen tekintélyt minőségi backlinks-szel. A Technical SEO és a feltérképezhetőség felfedezhetővé teszik az Ön tartalmát; a témába vágó autoritás építése releváns backlinks-szel segíti a keresőmotorokat a relevancia és a bizalom értékelésében.
Related terms

On-page SEO: definíció, ellenőrzőlista és ellenőrzés
On-page SEO az oldal tartalmának, HTML-jének és UX-ének optimalizálása úgy, hogy releváns, indexelhető és hasznos legyen a felhasználók és a modern keresőmotorok számára — lefedi a mobile-first renderinget, a structured data-t, a canonicals-t és az oldal teljesítményét.

Keresési rangsorok: meghatározás és működésük
A keresési rangsorok azt az sorrendet jelentik, ahogyan a keresők egy adott lekérdezésre indexelt oldalakat mutatnak; a rangsorok sok jel alapján alakulnak — relevancia, backlinkek, tartalomminőség, oldalélmény és felhasználói szándék —, és 2026-ban az AI-overview jellegű megjelenések is befolyásolják őket.

Meta tagek: típusok és SEO legjobb gyakorlatok
A meta tagek olyan HTML-elemek, amelyek egy oldalról adnak metaadatot (cím, leírás, robots-utasítások, közösségi előnézet-címkék és mások). A keresőmotorok és platformok ezeket olvassák, hogy befolyásolják az indexelést, a SERP-kivonatokat és a megjelenítést.

Keresőmotorok: működésük és SEO alapok
A keresőmotorok olyan szoftveres rendszerek, amelyek felfedezik, feltérképezik, indexelik és lekérik a webtartalmakat a felhasználói lekérdezések megválaszolására; a modern SERPs-ben AI Overviews, rich results és rangsorolt találatok is megjelennek, amelyeket sok jel határoz meg.

Keresési algoritmus: meghatározás, működés és SEO hatása
A keresési algoritmus az a szoftverlogika, amelyet a keresőmotorok használnak az oldalak felderítésére, feltérképezésére, indexelésére és rangsorolására: relevancia-jelek, tartalomminőség, linkjelek és MI-alapú szándékmodellek kombinálásával rendezik az eredményeket.

Keywords in SEO: meghatározás, érték és ellenőrzőlista
A Keywords a SEO-ban azok a szavak és kifejezések, amelyeket a felhasználók beírnak a keresőmotorokba; ezek irányítják a témaválasztást, az on-page jeleket, az organic láthatóság célzását és a keresési teljesítmény mérését eszközökön és SERP features-eken át.
