Robots.txt SEO: hatékony crawling-vezérlés
Tanulja meg, hogyan használja a robots.txt-et a feltérképezők biztonságos irányítására, indexelési hibák elkerülésére, viselkedés ellenőrzésére curl-lel és logokkal, és alkalmazzon gyakorlati példákat éles oldalakra.

Mit tesz a robots.txt — és mit nem
Robots.txt egy egyszerű szöveges fájl, amely a webhely gyökérkönyvtárába kerül (https://example.com/robots.txt). Szerepe szűkre szabott: utasításokat ad a jól viselkedő feltérképező robotoknak. Használja arra, hogy csökkentse a felesleges lekéréseket az alacsony értékű területeken és javítsa a feltérképezési hatékonyságot; ne támaszkodjon rá az indexelés szabályozásához vagy érzékeny tartalom elrejtéséhez.
Feltérképezést szabályoz, nem az indexelést
A Disallow direktíva megakadályozza, hogy a szabálykövető feltérképezők lekérjék egy URL útvonalát. Ha egy oldalt blokkolnak a feltérképezéstől,keresőmotorok továbbra is indexálhatják az URL-t külső jelek (például hivatkozások) alapján, de nem látják az oldal HTML-jét vagy a meta robots címkéket. Az indexelés megbízható megakadályozásához engedélyezze a feltérképezést, hogy afeltérképező el tudja olvasni a meta robots noindex címkét, vagy használhat egy X-Robots-Tag válaszfejlécet noindex értékkel magán az erőforráson.
Nyilvános, tanácsadó jellegű és nem biztonsági kontroll
A robots.txt nyilvánosan elérhető és tanácsadó jellegű: bárki elolvashatja a /robots.txt alatt, és rosszindulatú feltérképezők figyelmen kívül hagyhatják az utasításait. Ne sorolja fel titkokat vagy privát útvonalakat a robots.txt-ben; kezelje azt feltérképezés-szabályozó dokumentumként, ne hozzáférés-szabályozó mechanizmusként.
Alapszintaxis és gyakori direktívák
A legtöbb webhely csak néhány direktívát használ. A specifikáció és a főbb keresőmotorok gyakorlatában alkalmazott kiterjesztések támogatják az alapmintákat, a wildcardokat és a sitemap mutatókat. Tartsa a szabályokat egyszerűen, és ahol lehet, dokumentálja a szándékot megjegyzésekben.
Kulcsdirektívák (példák literálisan megjelenítve):
- User-agent: <bot-name> — célozzon meg egy adott feltérképezőt; az összeshez használja a User-agent: *-et.
- Disallow: /path/ — megakadályozza, hogy a /path/ alatti útvonalakat lekérjék.
- Allow: /path/file.js — kifejezetten engedélyez egy útvonalat egy letiltott szülő alatt (a főbb motorok támogatják).
- Sitemap: https://example.com/sitemap.xml — mutatja a feltérképezőknek az ÖnXML sitemap(ek).
- Wildcardok: * (bármely karakterlánc egyezése) és $ (sor vége) gyakorlatban támogatottak a főbb motorok által; használja őket óvatosan a lekérdezés-paraméter mintákhoz.
- Nem szabványos direktívák: Crawl-delay és Host bizonyos feltérképezők által ismertek, de nem részei az eredeti szabványnak — tesztelje a viselkedést azokkal a user-agentekkel, amelyek Önnek fontosak.
Hogyan hat a robots.txt az indexelésre és a rangsorolásra
Válassza szét a feltérképezést, az indexelést és a rangsorolást: a robots.txt a feltérképezési fázist befolyásolja (hogy egy feltérképező lekéri-e egy URL-t). Az indexeléshez szükséges, hogy a feltérképező elolvassa az oldal tartalmát vagy egy meta/X-Robots-Tag-et. A rangsorolás egy későbbi folyamat, amely jelzésekre támaszkodik, egy része pedig az oldal tartalmából származik; ha a feltérképező nem tud lekérni egy oldalt, ezek a tartalomalapú jelzések nem állnak rendelkezésre.
Gyakorlati következmények:
- Ha egy oldalt blokkolnak a robots.txt-ben, a keresőmotor nem tudja lekérni az oldalt, hogy elolvassa a meta robots noindex címkéket vagy a strukturált adatokat.
- Ha egy fontos erőforrás (CSS/JS) le van tiltva,mobile-first indexing és a renderelés nem fogja helyesen látni az oldalt; mivel a Google a mobil verziót használja elsődleges alapként acrawling and indexing, és mivel a Googlebot Smartphone 2024. júliusa óta az alapértelmezett crawler, engedélyezze a mobil rendereléshez szükséges erőforrásokat.
Ellenőrzés: hogyan tesztelje, mit látnak valójában a feltérképezők
Ellenőrizze a robots.txt elérhetőségét és tartalmát külső nézetből, és győződjön meg arról, hogyan válaszol a webhelye a valós feltérképező kérésekre. Használjon szerverlogokat, közvetlen lekéréseket és a Search Console eszközeit az Ön által kezelt oldalakhoz.
Gyors ellenőrzések curl-lel
A robots.txt HTTP válaszfejléceinek lekéréséhez (csak fejlécek):
- curl -I https://example.com/robots.txt — csak a válaszfejléceket adja vissza; ellenőrizze a státuszkódot és a Content-Type-ot.
A teljes fájl lekéréséhez egy adott user-agentként (a fájl tartalma és direktívák):
- curl -A "Googlebot" https://example.com/robots.txt — visszaadja a fájl törzsét a megadott user-agent string használatával.
Szerverlogok és valós feltérképezési bizonyítékok
Vizsgálja meg a szerverlogokat a /robots.txt-re érkező kérések és olyan crawler user-agentek, mint a Googlebot vagy Bingbot esetében. A logok megmutatják a lekérések gyakoriságát, a válaszkódokat, és hogy a feltérképezők megkíséreltek-e letiltott URL-eket. Az Ön által tulajdonolt oldalaknál használja a Search Console URL Inspection funkcióját a feltérképezési és indexelési jelek megtekintéséhez; harmadik fél oldalainál egy site: lekérdezés adhat indikációt, de nem döntő.
Gyakori hibák és javításuk
Kerülje ezeket a gyakori hibákat a robots.txt kezelésekor.
- A rendereléshez szükséges CSS/JS blokkolása: javítás — engedélyezze a mobil renderelési pipeline által igényelt assetek útvonalait, hogy a Googlebot Smartphone pontosan renderelhessen.
- A robots.txt-tól várni az URL-ek noindexelését: javítás — távolítsa el az oldal Disallow-ját és használjon meta robots noindex-et vagy X-Robots-Tag fejlécet, hogy a keresőmotorok láthassák az utasítást.
- Érzékeny URL-ek felsorolása a robots.txt-ben: javítás — ne tegye közzé a privát útvonalakat a robots.txt-ben; védje őket hitelesítéssel és megfelelő szerveroldali hozzáférés-szabályozással.
- Túl komplex wildcard szabályok, amelyek akaratlanul érvényes oldalakat egyeznek: javítás — tesztelje minden mintát mintául szolgáló URL-ekkel és dokumentálja a szándékot megjegyzésekben, tartsa a szabályokat a lehető leghatározottabbnak.
Ajánlott robots.txt stratégiák
Alkalmazzon konzervatív, tesztelhető megközelítést: tartsa minimálisnak a robots.txt-et, mutassa meg a feltérképezőknek a sitemapokat, és részesítse előnyben az oldal szintű meta/X-Robots-Tag vezérlést az indexkezeléshez.
Gyakorlati minták:
- Alapértelmezett engedély + sitemap: tartalmazzon User-agent: *-et és egy Sitemap direktívát, hogy a feltérképezők gyorsan felfedezhessék a struktúrát.
- Tiltsa le az alacsony értékű lekérdezéses oldalakat vagy a belső keresési eredményeket, de kerülje az olyan paraméterminták blokkolását, amelyek a kanonikus tartalommal is egyeznek; részesítse előnyben a paraméterkezelést a sitemapban vagy kanonikus tagek használatát.
- Staging vagy fejlesztés: blokkolja a feltérképezőket, amíg a staging nyilvános, de távolítsa el vagy módosítsa a blokkolást az élesítés előtt; ne támaszkodjon a robots.txt-re mint az egyetlen védelemre az előtermelési erőforrásoknál.
Példák, amelyeket adaptálhat
Egyszerű oldal sitemap-tel
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Gyakori CMS (admin-ajax engedélyezése)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
Staging blokkolás (nyilvános szerver, de még nem éles)
User-agent: *
Disallow: /
Figyelem: a staging blokkokat el kell távolítani az élesítés előtt; továbbá biztosítsa a staginget hitelesítéssel, hogy a keresőmotorok és harmadik felek ne indexelhessék véletlenül, ha a robots fájl megváltozik.
Robots.txt karbantartása nagy léptékben
Nagy webhelyeknél kezelje a robots.txt-et konfigurációs állományként: tartsa forrásvezérlés alatt, tekintse át a változtatásokat pull requestekben, és telepítse együtt az oldallal, hogy a staging és a production megfelelő, környezetspecifikus fájlokat kapjon. Automatizáljon teszteket, amelyek lekérik a telepített robots.txt-et és érvényesítik a szabálysintaxist reprezentatív URL-ek ellen.
Ha több aldomainen üzemeltet, ne feledje, hogy a robots.txt hosztonként specifikus: az example.com/robots.txt szabályai nem vonatkoznak a sub.example.com-ra.
GYIK
Megszerzi-e a robots.txt, hogy egy oldal megjelenjen a keresési találatok között?
Nem megbízhatóan. A robots.txt megakadályozhatja, hogy egy feltérképező lekérjen egy oldalt, de a keresőmotorok továbbra is indexálhatják az URL-t külső hivatkozások vagy egyéb jelek alapján. Az indexelés megelőzéséhez engedélyezze a feltérképezést, és használjon meta robots noindex címkét az oldalon vagy X-Robots-Tag: noindex válaszfejlécet, hogy a feltérképező elolvashassa az utasítást.
Hogyan ellenőrizheti, hogy a Google betartja-e az Ön robots.txt-ét?
Külsőleg töltse le a https://example.com/robots.txt curl segítségével a fájl és a státuszkódok ellenőrzéséhez; vizsgálja meg a szerverlogokat a Googlebot kéréseihez a fájlhoz és az Ön által feltérképezni várt oldalakhoz, és használja a Search Console URL Inspection funkcióját az Ön oldalain a feltérképezési kísérletek és az indexálási állapot megtekintéséhez. Egy site: lekérdezés nyilvános jelzést adhat, de nem döntő.
Le kell-e tiltani URL-paramétereket a robots.txt-ben?
Legyen óvatos. A paraméteres URL-ek blokkolása csökkentheti a crawl költségét, de kockáztatja, hogy elrejti a kanonizált vagy már indexelt tartalmat, ha a minták túl tágak. Részesítse előnyben a kanonikus tageket, a paraméterkezelést a sitemapokban, vagy a szerveroldali átirányításokat, ahol megfelelő; minden mintát alaposan teszteljen élesítés előtt.
Megbízható-e a Crawl-delay?
A Crawl-delay nem szabványos direktíva, és támogatása crawlerenként változik. Olyan webhelyeknél, amelyeknek szükségük van a crawl-sebesség szabályozására, részesítse előnyben a szerveroldali rate limitinget, a robots meta tags szelektív oldalakhoz, vagy olyan crawler-specifikus beállításokat, amelyek elérhetők például a Bing Webmaster Tools. Mindig tesztelje a viselkedést az adott user-agentekkel, amelyeket céloz.
Related articles

Hogyan használja a robots.txt fájlt a SEO-hoz
Tudja meg, mit szabályoz a robots.txt, hogyan írjon helyes szabályokat, hogyan ellenőrizze a viselkedést curl-lel és DevTools-szal, és hogyan kerülje el a gyakori SEO-hibákat.

Legjobb SEO szolgáltatások
Ismerje meg, mit kell tartalmaznia egy teljes körű SEO megbízásnak, hogyan ellenőrizze a szolgáltatókat, milyen technikai ellenőrzéseket végezzen el és milyen biztonságos linkgyakorlatokat alkalmazzon.

Gyakorlati SEO tippek a jobb keresési helyezésekhez
Végrehajtható, időtálló SEO stratégiák: kulcsszavak, on-page alapok, technikai javítások, link building iránymutatás és ellenőrzési lépések, amelyeket ma alkalmazhat.
