Skip to content
Keresés

Robots.txt: mi ez és hogyan működik

A robots.txt egy egyszerű szövegfájl, amelyet a webhely gyökerébe helyeznek, és feltérképezési szabályokat határoz meg a webfeltérképezők számára (User-agent, Disallow, Allow, Sitemap). Szabályozza a feltérképezés viselkedését, és közvetetten befolyásolhatja az indexelést, de nem határozza meg közvetlenül a rangsorolást.

Robots.txt: What It Is and How It Works

Mi az a robots.txt?

A robots.txt (a Robots Exclusion Protocol) egy egyszerű szövegfájl, amely a hoszt gyökérkönyvtárában található — pl. https://example.com/robots.txt — és egyszerű feltérképezési utasításokat ad a User-agenteknek (web crawlers). Nyilvános és géppel olvasható; nem hitelesít, és nem rejti el a tartalmat. A feltérképezők elolvassák a robots.txt-et, hogy megtudják, mely útvonalakat szeretné a webhely tulajdonosa, hogy elkerüljék vagy előnyben részesítsék.

Miért fontos a robots.txt az SEO szempontjából

A robots.txt szabályozza a feltérképezést. A feltérképezés a felfedezés és a letöltés szakasza annak, ahogyankeresőmotorok lépnek kölcsönhatásba a webhelyével; ha egyfeltérképezőnem fér hozzá egy URL lekéréséhez, előfordulhat, hogy nem látja az oldalon lévő utasításokat (például a meta robots-ot) vagy az indexeléshez szükséges tartalmat. Ez azt jelenti, hogy a robots.txt közvetetten befolyásolhatja az indexelést. Nem határozza meg közvetlenül a rangsorolást — a ranking az indexelést követően sok jel alapján dől el. Használja a robots.txt-et szervererőforrások védelmére, hogy elkerülje az ismétlődő vagy belső eszközoldalak feltérképezését, és győződjön meg róla, hogy a feltérképezők hozzáférnek a helyes rendereléshez szükséges assetekhez.

Hogyan működik a robots.txt

Egy feltérképező lekéri a /robots.txt-et, mielőtt más oldalakat kérne le ugyanarról a hosztról, és alkalmazza az első, egyező User-agent szakaszt és az abban foglalt direktívákat. A nagyobb feltérképezők általában támogatott direktívái közé tartozik a User-agent, Disallow, Allow és Sitemap. A mintázatillesztés és további direktívák támogatása feltérképezőnként változik — a Google olyan mintákat ismer el, mint a * és a $, és dokumentációja szerint követi az Allow/Disallow precedencia szabályait.

Tipikus direktívák és példák

Egy minimális robots.txt példa:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Megjegyzés: helyezze a robots.txt-et a webhely gyökérkönyvtárába. Ha a robots.txt HTTP 404-et ad vissza, a legtöbb feltérképező 'nincs korlátozásként' kezeli; ha nem érhető el vagy szerverhibát ad vissza, a feltérképezők viselkedése eltérő lehet — tesztelje és figyelje, hogy elkerülje a véletlen, széles körű blokkolást. Google-specifikus viselkedéshez és példákhoz tekintse meg a Google robots.txt dokumentációját.

A robots.txt típusai

Különböző minták használatosak a cél alapján. Az alábbiakban gyakori megközelítések rövid előnyökkel és hátrányokkal.

- Site-wide block (Disallow: /)
Előnyök: azonnal megakadályozza a feltérképezők hozzáférését az egész hoszthoz.
Hátrányok: megakadályozza, hogy a feltérképezők lekérjék a tartalmat és az asseteket; megállíthatja a nyilvános oldalak indexelését.

- Path-specific rules (Disallow: /private/)
Előnyök: egyszerű kizárni belső vagy admin útvonalakat.
Hátrányok: a robots.txt nyilvános; ne sorolja fel azokat az érzékeny útvonalakat, amelyeket titokban akar tartani.

- User-agent specific rules (User-agent: Googlebot)
Előnyök: testreszabhatja a viselkedést adott feltérképezőknek.
Hátrányok: karbantartási igény növekszik; egyes feltérképezők figyelmen kívül hagyhatják a nem szabványos direktívákat.

Hogyan kezdjen hozzá a robots.txt-hez

1) Döntse el, mit kell védeni a feltérképezéstől (szerverterheléses területek, staging útvonalak), és mi maradjon elérhető a feltérképezők számára (nyilvános oldalak, CSS/JS szükséges a rendereléshez).
2) Hozzon létre egy egyszerű szövegfájlt robots.txt néven a webhely gyökérkönyvtárában. Tesztelje helyben és staging környezetben, mielőtt élesbe viszi.
3) Telepítse és ellenőrizze a műszaki ellenőrzőlistával lent. Tartsa egyszerűen a fájlt, és dokumentálja az User-agent-specifikus szabályokat, hogy a jövőbeni karbantartók megértsék a szándékot.

Gyakori robots.txt hibák

• A robots.txt-re támaszkodás érzékeny adatok elrejtésére — a robots.txt nyilvános, és nem alkalmas biztonsági célokra. Használjon hitelesítést vagy távolítsa el az erőforrást.
• A rendereléshez szükséges CSS/JS blokkolása — ez ronthatja, hogyan érti meg a keresőmotor az oldal elrendezését és tartalmát.
• Olyan oldalak blokkolása, amelyek meta noindex-et tartalmaznak — ha a Googlebot nincs engedélyezve az oldal lekérésére, nem látja a meta noindex direktívát.
• A robots.txt alútvonal alá helyezése (pl. /blog/robots.txt) — a feltérképezők csak a gyökérszintű fájlt keresik.
• Szintaxis hibák és helytelen HTTP státuszkódok — győződjön meg róla, hogy a fájl megfelelő 200-as választ ad.

Robots.txt ellenőrzése: műszaki ellenőrzőlista

Használja az alábbi ellenőrzéseket a robots.txt telepítése vagy frissítése után. Minden tételnél meg van adva, hol ellenőrizze és mi a világos elfogadási feltétel.

**File reachable** — ellenőrzés helye: curl -I https://example.com/robots.txt — sikeres, ha a kérés HTTP 200-at ad vissza és a fájl a várt tartalmú.
**Correct directives** — ellenőrzés helye: curl https://example.com/robots.txt vagy view-source a böngészőben — sikeres, ha a User-agent/Disallow/Allow sorok megfelelnek a szabályzatának.
**Not blocking rendering assets** — ellenőrzés helye: Chrome DevTools Network és Coverage vagy lekérés egy crawler szimulátorral — sikeres, ha a rendereléshez szükséges CSS/JS nincs letiltva.
**Google-block check (own site)** — ellenőrzés helye: Google Search Console URL Inspection — sikeres, ha az Inspection azt mutatja, hogy az URL feltérképezhető és nincs "Blocked by robots.txt" jelölés.
**External crawl check** — ellenőrzés helye: használjon curl-t vagy harmadik fél feltérképezőt a blokkolt URL lekéréséhez és győződjön meg róla, hogy maga az oldal 200-at ad vissza, de a feltérképező hozzáférését megtagadták — sikeres, ha a viselkedés megfelel az elvárásoknak.
**Sitemap presence** — ellenőrzés helye: a robots.txt tartalma és a Google Search Console Sitemaps jelentése — sikeres, ha a sitemap URL szerepel a robots.txt-ben vagy be lett küldve a Search Console-ban és elfogadták.

Eszközök és parancsok a robots.txt ellenőrzéséhez

curl (csak fejléc): curl -I https://example.com/robots.txt — visszaadja az HTTP státuszt és a válasz fejléceit. curl (teljes fájl): curl https://example.com/robots.txt — kiírja a tartalmat ellenőrzésre. Chrome DevTools: nyissa meg a fájl URL-jét vagy nézze a hálózati kéréseket az oldalon, hogy megerősítse, az assetek engedélyezettek-e. Google Search Console URL Inspection: egy Ön által tulajdonolt URL esetén az eszköz megmutatja, látja-e a Google az oldalt és le van-e tiltva robots.txt által.Bing Webmaster ToolsA Site Explorer megmutathatja, hogyan kezelte a Bing a fájlt a verifikált webhelyeken. Használja a szerverlogokat annak megerősítésére, mely user-agentek kérték le a robots.txt-et és milyen gyakran.

A támogatott direktívákra és precedencia részletekre vonatkozó hivatalos információkért tekintse meg a következő dokumentációt: https://developers.google.com/search/docs/advanced/robots/intro

Olvassa el a Technical SEO Guide-ot

Gyakran ismételt kérdések

K: Ha egy oldalt blokkolok robots.txt-sel, eltűnik a találatok közül?
V: A robots.txt-sel történő blokkolás megakadályozza, hogy a feltérképezők lekérjék az oldalt, ami általában megakadályozza, hogy lássák az oldalon lévő jeleket. Egy blokkolt oldal továbbra is megjelenhet a keresési találatok között külső jelek alapján (csak URL-megjelenés), de nem lesz cache-elt kivonata vagy renderelt tartalma. Eltávolításhoz használja az index eltávolítási eszközöket az Ön által tulajdonolt URL-ekhez; az indexelés metadata általi szabályozásához győződjön meg róla, hogy az oldal feltérképezhető, hogy a feltérképező láthassa a meta robots:noindex direktívát.

K: Használhatom-e a robots.txt-et bizonyos botok blokkolására?
V: Hozzáadhat User-agent-specifikus szakaszokat ismert feltérképezők célzásához. Ugyanakkor a robots.txt egy becsületkódex: a jól viselkedő feltérképezők betartják, a rosszindulatú botok figyelmen kívül hagyhatják. Erősebb védelemhez használjon hitelesítést, IP-szűrést vagy tűzfalat.

K: Fel kell-e tüntetnem a sitemapet a robots.txt-ben?
V: A Sitemap: https://example.com/sitemap.xml feltüntetése a robots.txt-ben kényelmes mód a sitemap megmutatására a feltérképezőknek; emellett küldje be a sitemapet közvetlenül a Google Search Console-ba az Ön által kezelt webhelyekhez.

K: A robots.txt protokollonként és hosztonként alkalmazandó?
V: Igen. A robots.txt-et hosztonként és protokollonként kérik le: a https://example.com/robots.txt különálló az http://example.com/robots.txt-től vagy https://sub.example.com/robots.txt. Helyezze a fájlt ugyanarra a séma és hoszt kombinációra, amelyet a webhely használ.

K: Hogyan befolyásolja a mobile-first indexing a robots.txt-et?
V: A Google a mobil verziót használja elsődleges alapként a feltérképezés és indexelés. 2024 júliusa óta a Google alapértelmezés szerint a Googlebot Smartphone-tal térképezi fel a webhelyeket a Search-hoz. Győződjön meg róla, hogy a robots.txt esetlegesen nem blokkolja véletlenül a mobil verzión szolgáltatott oldalakhoz szükséges erőforrásokat, amelyek a helyes rendereléshez és indexeléshez szükségesek.

K: Hol találok hivatalos útmutatót?
V: Hivatkozzon a Google robots.txt dokumentációjára itt: https://developers.google.com/search/docs/advanced/robots/intro és a Schema.org valamint a W3C erőforrásaira a kapcsolódó feltérképezési és indexelési gyakorlatok tekintetében.

Építsen tekintélyt minőségi backlinkekkel

Kapcsolódó