Skip to content
Search

Crawler: mi ez és miért fontos a SEO számára

A crawler egy automatizált bot, amely weboldalakat lekér, követi a linkeket és erőforrásokat a keresőmotorok számára történő tartalomfelismeréshez; a feltérképezett oldalak indexelésre jelölt jelöltek lesznek (Google alapértelmezettként Googlebot Smartphone-ot használ since July 2024).

Crawler: How It Affects Your Website SEO

Mi az a crawler?

A crawler (más néven spider vagy bot) automatizált szoftver, amely weboldalakat lekér, követi a linkeket és letölti az erőforrásokat, hogy egy keresőmotor értékelni és eltárolni tudja az oldalakról származó információkat. A crawling a felfedezés szakasza: ez lehetővé teszi, hogy keresőmotorok találjanak olyan tartalmat, amely indexelhető és később megjelenhet a keresési találatok között.

A crawling különbözik az indexeléstől és a rangsorolástól: a crawling a tartalom lekérését jelenti, az indexelés a tárolásról dönt, a rangsorolás pedig a SERP-ben való sorrendet határozza meg. Az, hogy egy oldalt feltérképeznek, nem garantálja, hogy indexelik vagy jól rangsorolják.

Miért fontos a crawler a SEO számára

Ha egy keresőmotor nem tud feltérképezni egy oldalát, nem lesz lehetősége azt indexelni vagy értékelni a találatokhoz. A jó feltérképezhetőség növeli annak esélyét, hogy tartalma felfedezhető és indexelésre alkalmas legyen; a gyenge feltérképezhetőség hasznos oldalakat tarthat ki az indexből még akkor is, ha jól meg vannak írva.

A feltérképezhetőség gyakorlati SEO-hatásai közé tartozik az új tartalom időbeni felfedezése, a canonicalok pontos értelmezése és a strukturált adatok helyes értékelése. Ugyanakkor mag a crawling nem határozza meg a rangsorolási sorrendet — az indexelés és a rangsorolás különálló fázisok, amelyeket sok jel befolyásol.

Hogyan működik a crawler

A crawlerek seed URL-ekből (ismert domainek, sitemaps, korábban felfedezett linkek) indulnak, lekérik a HTML-t, és követik a linkeket további URL-ek feltárásához. Betartják a robots.txt szabályokat, és tiszteletben tartják a crawl-delay vagy host-korlátozásokat. A lekérés után egyes crawlerek renderelik a JavaScript hogy felfedezzék azokat a tartalmakat, amelyek nem szerepelnek a kezdeti HTML-ben.

Fontos jelek és vezérlők, amelyeket a crawlerek figyelembe vesznek: robots.txt, meta robots tagek, X-Robots-Tag HTTP fejléc, rel="canonical", sitemaps és a linkstruktúra. A keresőmotorok számára a sitemaps felgyorsítják a felfedezést, de nem garantálják az indexelést.

Renderelés és JavaScript

A modern kereső crawler-ek gyakran renderelik az oldalakat (végrehajtják a JavaScriptet), hogy felépítsék a végső DOM-ot, mielőtt döntenek az indexelendő tartalomról. Ha lényeges tartalom vagy linkek csak kliensoldali renderelés után kerülnek be, győződjön meg róla, hogy a crawler eléri és renderelni tudja ezeket az erőforrásokat (gyors szerverválaszok és elérhető JS/CSS).

A crawler típusai

Gyakori crawler típusok:

- Keresőmotor crawler-ek — pl. Googlebot, Bingbot: tartalmat fedeznek fel és kérnek le indexeléshez.

- Site-auditing crawler-ek — olyan eszközök, amelyeket Ön futtat (Screaming Frog, Sitebulb stb.), hogy feltérképezze a belső linkeket, státuszkódokat és az oldalon lévő elemeket.

- Archiválási vagy kutatási crawler-ek — archívumok és kutatási projektek használják webpillanatképek rögzítésére.

- Specializált crawler-ek — link-checkerek, áraggregátorok, API-k és monitoring botok, amelyek specifikus erőforrásokat vagy végpontokat kérnek le.

Hogyan kezdjen hozzá a crawlerekhez

Gyakorlati kezdő feltérképezési lépések:

1) Ellenőrizze a robots.txt-et — látogasson el a https://example.com/robots.txt oldalra, hogy megbizonyosodjon arról, hogy véletlenül nem tiltotta le a fontos útvonalakat. 2) Használjon site-auditing crawler-t a 404-ek, átirányítások és a rel=canonical használatának feltérképezéséhez. 3) Vizsgálja meg a szerverlogokat, hogy lássa, mely user-agentek kérik le az oldalait és milyen státuszkódokat kapnak. 4) Használja a Google Search Console URL Inspection-t a saját oldalakhoz a feltérképezési és indexállapot megtekintéséhez.

Amikor teszteli, hogyan lát egy adott user-agent egy oldalt, használja a curl-t a megfelelő kapcsolókkal: a csak fejléc lekéréséhez Googlebotként: curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page. A teljes HTML lekéréséhez Googlebotként (hogy megtekinthesse a forrást): curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.com/page

Crawler ellenőrzések: technikai ellenőrzőlista

**robots.txt** — ellenőrzés helye — megfelelő, ha elérhető /robots.txt és nem tilt le fontos oldalakat azoknak a crawlereknek, amelyeket indexelni szeretne.

**HTTP status codes** — ellenőrzés helye — szerverlogok vagy curl -I; megfelelő, ha az oldalak 200-at adnak vissza (vagy 3xx a várt átirányításoknál) és nem véletlen 4xx/5xx fontos tartalmaknál.

**Meta robots / X-Robots-Tag** — ellenőrzés helye — curl -I vagy view-source; megfelelő, ha a noindex nincs jelen azoknál az oldalaknál, amelyeket indexelni szeretne, és az X-Robots-Tag fejléc nem blokkolja az indexelést.

**Rendering check** — ellenőrzés helye — Chrome DevTools (Elements) vagy egy headless renderer; megfelelő, ha a renderelt DOM-ban látható tartalom és linkek megegyeznek azzal, amit a crawlereknek szán.

**Sitemap coverage** — ellenőrzés helye — a sitemap.xml és a szerverlogok; megfelelő, ha a sitemap canonical URL-eket sorol fel, és ezek az URL-ek elérhetők (200/3xx) a crawlerek számára.

Gyakori crawler hibák

Gyakori problémák, amelyek csökkentik a crawl hatékonyságát:

- Véletlenül történő crawlerek letiltása a robots.txt-ben vagy X-Robots-Tag meta fejléc révén.

- Erős támaszkodás kliensoldali renderelésre anélkül, hogy biztosítaná, hogy a crawlerek renderelni tudják a szükséges JS erőforrásokat, ami hiányzó tartalomhoz vezet a renderelt DOM-ban.

- Crawl trap-ek (végtelen URL-es naptárak, faceted navigáció paraméterkezelés nélkül), amelyek pazarlják a crawl budget-et és duplikált URL-eket generálnak.

- Hibásan alkalmazott canonical tagek vagy következetlen átirányítási láncok, amelyek miatt a crawlerek a rossz verziót indexelik egy oldalból.

Gyakran ismételt kérdések

Honnan tudhatja, hogy a Google feltérképezte-e az oldalát?

Saját tulajdonú webhelyeknél használja a Google Search Console URL Inspection-t az utolsó feltérképezés megtekintéséhez és indexelés kéréséhez. Harmadik fél webhelyeknél a szerverlogok, amelyek Googlebot user-agenteket mutatnak, vagy egy külső curl teszt Googlebot user-agenttel bizonyítékot adhatnak. A site: operátor nyilvános jel lehet, de nem végleges bizonyítéka az indexálásnak.

Milyen user-agentet használnak a crawlerek?

A keresőmotorok közzéteszik a tipikus user-agent stringeket (Googlebot esetén egy gyakori string: "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"). Használja a curl -A-t user-agent utánzására teszteléskor, de a szerverlogokra támaszkodjon a crawler-tevékenység hiteles bizonyításához.

Egyenlő a crawling és a rangsorolás?

Nem. A crawling felfedezhetővé teszi a tartalmat; az indexelés alkalmassá teszi a megjelenést a keresésben; a rangsorolás határozza meg a sorrendet. Egy feltérképezett és indexált oldal még mindig rosszul szerepelhet, ha a többi rangsorolási jel gyenge.

Olvassa el a Technical SEO Guide-ot

Ha crawl problémákat kell hibaelhárítani, kezdje a szerverlogokkal és egy célzott curl teszttel (fejlécek és teljes HTML), majd ellenőrizze a renderelt DOM-ot a Chrome DevTools-ban. Használja a Google Search Console URL Inspection-t a saját oldalakhoz és Bing Webmaster Tools Site Explorer-t, hogy összehasonlíthassa, hogyan lépnek interakcióba különböző keresőmotorok az Ön webhelyével.

Építsen tekintélyt minőségi backlinks-szel. A Technical SEO és a feltérképezhetőség felfedezhetővé teszik az Ön tartalmát; a témába vágó autoritás építése releváns backlinks-szel segíti a keresőmotorokat a relevancia és a bizalom értékelésében.

Related terms