Skip to content
Search

Robots.txt SEO: hatékony crawling-vezérlés

Tanulja meg, hogyan használja a robots.txt-et a feltérképezők biztonságos irányítására, indexelési hibák elkerülésére, viselkedés ellenőrzésére curl-lel és logokkal, és alkalmazzon gyakorlati példákat éles oldalakra.

Robots.txt SEO: Control Crawling Efficiently

Mit tesz a robots.txt — és mit nem

Robots.txt egy egyszerű szöveges fájl, amely a webhely gyökérkönyvtárába kerül (https://example.com/robots.txt). Szerepe szűkre szabott: utasításokat ad a jól viselkedő feltérképező robotoknak. Használja arra, hogy csökkentse a felesleges lekéréseket az alacsony értékű területeken és javítsa a feltérképezési hatékonyságot; ne támaszkodjon rá az indexelés szabályozásához vagy érzékeny tartalom elrejtéséhez.

Feltérképezést szabályoz, nem az indexelést

A Disallow direktíva megakadályozza, hogy a szabálykövető feltérképezők lekérjék egy URL útvonalát. Ha egy oldalt blokkolnak a feltérképezéstől,keresőmotorok továbbra is indexálhatják az URL-t külső jelek (például hivatkozások) alapján, de nem látják az oldal HTML-jét vagy a meta robots címkéket. Az indexelés megbízható megakadályozásához engedélyezze a feltérképezést, hogy afeltérképező el tudja olvasni a meta robots noindex címkét, vagy használhat egy X-Robots-Tag válaszfejlécet noindex értékkel magán az erőforráson.

Nyilvános, tanácsadó jellegű és nem biztonsági kontroll

A robots.txt nyilvánosan elérhető és tanácsadó jellegű: bárki elolvashatja a /robots.txt alatt, és rosszindulatú feltérképezők figyelmen kívül hagyhatják az utasításait. Ne sorolja fel titkokat vagy privát útvonalakat a robots.txt-ben; kezelje azt feltérképezés-szabályozó dokumentumként, ne hozzáférés-szabályozó mechanizmusként.

Alapszintaxis és gyakori direktívák

A legtöbb webhely csak néhány direktívát használ. A specifikáció és a főbb keresőmotorok gyakorlatában alkalmazott kiterjesztések támogatják az alapmintákat, a wildcardokat és a sitemap mutatókat. Tartsa a szabályokat egyszerűen, és ahol lehet, dokumentálja a szándékot megjegyzésekben.

Kulcsdirektívák (példák literálisan megjelenítve):

  • User-agent: <bot-name> — célozzon meg egy adott feltérképezőt; az összeshez használja a User-agent: *-et.
  • Disallow: /path/ — megakadályozza, hogy a /path/ alatti útvonalakat lekérjék.
  • Allow: /path/file.js — kifejezetten engedélyez egy útvonalat egy letiltott szülő alatt (a főbb motorok támogatják).
  • Sitemap: https://example.com/sitemap.xml — mutatja a feltérképezőknek az ÖnXML sitemap(ek).
  • Wildcardok: * (bármely karakterlánc egyezése) és $ (sor vége) gyakorlatban támogatottak a főbb motorok által; használja őket óvatosan a lekérdezés-paraméter mintákhoz.
  • Nem szabványos direktívák: Crawl-delay és Host bizonyos feltérképezők által ismertek, de nem részei az eredeti szabványnak — tesztelje a viselkedést azokkal a user-agentekkel, amelyek Önnek fontosak.

Hogyan hat a robots.txt az indexelésre és a rangsorolásra

Válassza szét a feltérképezést, az indexelést és a rangsorolást: a robots.txt a feltérképezési fázist befolyásolja (hogy egy feltérképező lekéri-e egy URL-t). Az indexeléshez szükséges, hogy a feltérképező elolvassa az oldal tartalmát vagy egy meta/X-Robots-Tag-et. A rangsorolás egy későbbi folyamat, amely jelzésekre támaszkodik, egy része pedig az oldal tartalmából származik; ha a feltérképező nem tud lekérni egy oldalt, ezek a tartalomalapú jelzések nem állnak rendelkezésre.

Gyakorlati következmények:

  • Ha egy oldalt blokkolnak a robots.txt-ben, a keresőmotor nem tudja lekérni az oldalt, hogy elolvassa a meta robots noindex címkéket vagy a strukturált adatokat.
  • Ha egy fontos erőforrás (CSS/JS) le van tiltva,mobile-first indexing és a renderelés nem fogja helyesen látni az oldalt; mivel a Google a mobil verziót használja elsődleges alapként acrawling and indexing, és mivel a Googlebot Smartphone 2024. júliusa óta az alapértelmezett crawler, engedélyezze a mobil rendereléshez szükséges erőforrásokat.

Ellenőrzés: hogyan tesztelje, mit látnak valójában a feltérképezők

Ellenőrizze a robots.txt elérhetőségét és tartalmát külső nézetből, és győződjön meg arról, hogyan válaszol a webhelye a valós feltérképező kérésekre. Használjon szerverlogokat, közvetlen lekéréseket és a Search Console eszközeit az Ön által kezelt oldalakhoz.

Gyors ellenőrzések curl-lel

A robots.txt HTTP válaszfejléceinek lekéréséhez (csak fejlécek):

  • curl -I https://example.com/robots.txt — csak a válaszfejléceket adja vissza; ellenőrizze a státuszkódot és a Content-Type-ot.

A teljes fájl lekéréséhez egy adott user-agentként (a fájl tartalma és direktívák):

  • curl -A "Googlebot" https://example.com/robots.txt — visszaadja a fájl törzsét a megadott user-agent string használatával.

Szerverlogok és valós feltérképezési bizonyítékok

Vizsgálja meg a szerverlogokat a /robots.txt-re érkező kérések és olyan crawler user-agentek, mint a Googlebot vagy Bingbot esetében. A logok megmutatják a lekérések gyakoriságát, a válaszkódokat, és hogy a feltérképezők megkíséreltek-e letiltott URL-eket. Az Ön által tulajdonolt oldalaknál használja a Search Console URL Inspection funkcióját a feltérképezési és indexelési jelek megtekintéséhez; harmadik fél oldalainál egy site: lekérdezés adhat indikációt, de nem döntő.

Gyakori hibák és javításuk

Kerülje ezeket a gyakori hibákat a robots.txt kezelésekor.

  • A rendereléshez szükséges CSS/JS blokkolása: javítás — engedélyezze a mobil renderelési pipeline által igényelt assetek útvonalait, hogy a Googlebot Smartphone pontosan renderelhessen.
  • A robots.txt-tól várni az URL-ek noindexelését: javítás — távolítsa el az oldal Disallow-ját és használjon meta robots noindex-et vagy X-Robots-Tag fejlécet, hogy a keresőmotorok láthassák az utasítást.
  • Érzékeny URL-ek felsorolása a robots.txt-ben: javítás — ne tegye közzé a privát útvonalakat a robots.txt-ben; védje őket hitelesítéssel és megfelelő szerveroldali hozzáférés-szabályozással.
  • Túl komplex wildcard szabályok, amelyek akaratlanul érvényes oldalakat egyeznek: javítás — tesztelje minden mintát mintául szolgáló URL-ekkel és dokumentálja a szándékot megjegyzésekben, tartsa a szabályokat a lehető leghatározottabbnak.

Ajánlott robots.txt stratégiák

Alkalmazzon konzervatív, tesztelhető megközelítést: tartsa minimálisnak a robots.txt-et, mutassa meg a feltérképezőknek a sitemapokat, és részesítse előnyben az oldal szintű meta/X-Robots-Tag vezérlést az indexkezeléshez.

Gyakorlati minták:

  • Alapértelmezett engedély + sitemap: tartalmazzon User-agent: *-et és egy Sitemap direktívát, hogy a feltérképezők gyorsan felfedezhessék a struktúrát.
  • Tiltsa le az alacsony értékű lekérdezéses oldalakat vagy a belső keresési eredményeket, de kerülje az olyan paraméterminták blokkolását, amelyek a kanonikus tartalommal is egyeznek; részesítse előnyben a paraméterkezelést a sitemapban vagy kanonikus tagek használatát.
  • Staging vagy fejlesztés: blokkolja a feltérképezőket, amíg a staging nyilvános, de távolítsa el vagy módosítsa a blokkolást az élesítés előtt; ne támaszkodjon a robots.txt-re mint az egyetlen védelemre az előtermelési erőforrásoknál.

Példák, amelyeket adaptálhat

Egyszerű oldal sitemap-tel

User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml

Gyakori CMS (admin-ajax engedélyezése)

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml

Staging blokkolás (nyilvános szerver, de még nem éles)

User-agent: *
Disallow: /

Figyelem: a staging blokkokat el kell távolítani az élesítés előtt; továbbá biztosítsa a staginget hitelesítéssel, hogy a keresőmotorok és harmadik felek ne indexelhessék véletlenül, ha a robots fájl megváltozik.

Robots.txt karbantartása nagy léptékben

Nagy webhelyeknél kezelje a robots.txt-et konfigurációs állományként: tartsa forrásvezérlés alatt, tekintse át a változtatásokat pull requestekben, és telepítse együtt az oldallal, hogy a staging és a production megfelelő, környezetspecifikus fájlokat kapjon. Automatizáljon teszteket, amelyek lekérik a telepített robots.txt-et és érvényesítik a szabálysintaxist reprezentatív URL-ek ellen.

Ha több aldomainen üzemeltet, ne feledje, hogy a robots.txt hosztonként specifikus: az example.com/robots.txt szabályai nem vonatkoznak a sub.example.com-ra.

GYIK

Megszerzi-e a robots.txt, hogy egy oldal megjelenjen a keresési találatok között?

Nem megbízhatóan. A robots.txt megakadályozhatja, hogy egy feltérképező lekérjen egy oldalt, de a keresőmotorok továbbra is indexálhatják az URL-t külső hivatkozások vagy egyéb jelek alapján. Az indexelés megelőzéséhez engedélyezze a feltérképezést, és használjon meta robots noindex címkét az oldalon vagy X-Robots-Tag: noindex válaszfejlécet, hogy a feltérképező elolvashassa az utasítást.

Hogyan ellenőrizheti, hogy a Google betartja-e az Ön robots.txt-ét?

Külsőleg töltse le a https://example.com/robots.txt curl segítségével a fájl és a státuszkódok ellenőrzéséhez; vizsgálja meg a szerverlogokat a Googlebot kéréseihez a fájlhoz és az Ön által feltérképezni várt oldalakhoz, és használja a Search Console URL Inspection funkcióját az Ön oldalain a feltérképezési kísérletek és az indexálási állapot megtekintéséhez. Egy site: lekérdezés nyilvános jelzést adhat, de nem döntő.

Le kell-e tiltani URL-paramétereket a robots.txt-ben?

Legyen óvatos. A paraméteres URL-ek blokkolása csökkentheti a crawl költségét, de kockáztatja, hogy elrejti a kanonizált vagy már indexelt tartalmat, ha a minták túl tágak. Részesítse előnyben a kanonikus tageket, a paraméterkezelést a sitemapokban, vagy a szerveroldali átirányításokat, ahol megfelelő; minden mintát alaposan teszteljen élesítés előtt.

Megbízható-e a Crawl-delay?

A Crawl-delay nem szabványos direktíva, és támogatása crawlerenként változik. Olyan webhelyeknél, amelyeknek szükségük van a crawl-sebesség szabályozására, részesítse előnyben a szerveroldali rate limitinget, a robots meta tags szelektív oldalakhoz, vagy olyan crawler-specifikus beállításokat, amelyek elérhetők például a Bing Webmaster Tools. Mindig tesztelje a viselkedést az adott user-agentekkel, amelyeket céloz.

Related articles