Skip to content
Search

Hogyan használja a robots.txt fájlt a SEO-hoz

Tudja meg, mit szabályoz a robots.txt, hogyan írjon helyes szabályokat, hogyan ellenőrizze a viselkedést curl-lel és DevTools-szal, és hogyan kerülje el a gyakori SEO-hibákat.

How to Use Robots.txt File for SEO

Mit tartalmaz ez az útmutató

Ez a bejegyzés elmagyarázza, mit szabályoz és mit nem a robots.txt, bemutatja a helyes szintaxist és gyakorlati példákat, parancssori ellenőrzéseket ad, amelyeket futtathat, és felsorolja a hibajavítás lépéseit a gyakori problémák helyreállításához. Emellett ellenőrzési tippeket is kap, amelyek 2026 keresési környezetekben működnek (mobile-first indexing a Google alapértelmezettje 2024 júliusa óta, és a Google 2024 elején eltávolította a hagyományos gyorsítótárazott oldalakat).

Mi a robots.txt és mit szabályoz

robots.txt egy egyszerű szövegfájl a webhely gyökerében, amely feltérképezési utasításokat közöl a szabályosan viselkedő webrobotokkal. A Robots Exclusion Standard része. A fájl segítségével megmondhatja a crawler-eknek, mely útvonalakat tölthetik le; ez a crawlingot szabályozza, nem az indexinget vagy a rangsorolást.

Fontos különbségek, amelyeket tartson észben:

Crawling vs indexing vs ranking — a robots.txt a crawlingot befolyásolja (mit tölt le egy ügynök). Egy olyan URL, amelyet a crawlingból kizártak, még indexelhető lehet, ha más oldalak hivatkoznak rá és a kereső úgy dönt, hogy indexeli az URL-t anélkül, hogy lekérné a tartalmát.

A robots.txt ajánlás jellegű — csak a szabálykövető crawler-ek tartják be. Rosszindulatú botok, spamgyűjtők és egyes szkennerek figyelmen kívül hagyhatják.

A robots.txt nem helyettesíti a hozzáférés-vezérlést. Privát tartalom védelmére használjon HTTP-hitelesítést, jelszóval védést vagy szerveroldali szabályokat.

Hol kell elhelyezni a robots.txt-t és alapvető szabályok

A robots.txt-et a webhely gyökeréről kell kiszolgálni azon az pontos hoston és protokollon, amelyre a szabályok vonatkoznak. Elkülönült példalokalások: https://example.com/robots.txt és https://sub.example.com/robots.txt. Nem helyezhet el robots.txt-et egy alkönyvtárban azzal a várakozással, hogy az az egész domainre érvényes lesz.

Kényelem és példák céljából az útmutató kanonikus tesztútvonala:http://www.yoursite.com/robots.txt.

A robots.txt szintaxisa és gyakori direktívák

Egy minimális robots.txt user-agent szerint csoportosított direktívákat használ. A direktíva nevek nem érzékenyek a kis- és nagybetűkre. Az alábbi példák a legtöbb nagyobb crawler által támogatott szabványos tokeneket használják:

Minden crawler letiltása egy könyvtárból:

User-agent: *

Disallow: /private/

Egy konkrét fájl engedélyezése miközben a könyvtárát tiltjuk (hasznos Googlebot-szerű feldolgozáshoz):

User-agent: *

Disallow: /images/

Allow: /images/logo.png

A sitemaps bejegyezhetők a robots.txt-ben, hogy a crawler-eket az Ön XML sitemap felé irányítsák:

Sitemap: http://www.yoursite.com/sitemap.xml

Mintázatillesztés: a jelentősebb keresőmotorok támogatják az asterisk (*) wildcardot és az end-of-string dollárt ($) a robots.txt mintákban. A nem szabványos Crawl-delay direktívát néhány motor figyelmen kívül hagyja (a Google nem támogatja a Crawl-delay-t).

Gyakorlati példák

1) Engedélyezze minden crawler számára, hogy mindent lekérjen (alapértelmezett, biztonságos opció):

User-agent: *

Disallow:

2) Tiltson le egyetlen crawler (pl. egy konkrét ügynök teljes tiltása minden tartalomról):

User-agent: BadBot

Disallow: /

3) Megakadályozni, hogy a crawler-ek lekérjék a rendereléshez szükséges erőforrásokat (gyakori hiba — lásd a hibakeresést):

Disallow: /static/js/

A CSS/JS blokkolása megakadályozhatja, hogy a Google az Ön oldalát úgy lássa, ahogy a felhasználók. Mivel a Google a mobil verziót használja elsődleges alapként a feltérképezés és indexelés és a renderelt oldal alapján értékeli a Core Web Vitals mutatókat, ne blokkoljon olyan erőforrásokat, amelyek a rendereléshez szükségesek.

Hogyan ellenőrizze és hibaelhárítsa a robots.txt-et

Alapvető ellenőrzések, amelyeket a webhelyen kívülről futtathat:

A fájl tartalmának lekérése: curl http://www.yoursite.com/robots.txt — ez visszaadja a fájl tartalmát, amit egy crawler látna.

Csak a fejléc ellenőrzése: curl -I http://www.yoursite.com/robots.txt — ellenőrzi a HTTP státuszt (200 vs 4xx/5xx) és a Content-Type-ot. A -I csak a válasz fejlécét adja vissza.

Nézze meg, hogyan kapják meg a böngészők: nyissa meg https://www.yoursite.com/robots.txt egy böngészőben, és győződjön meg róla, hogy ugyanaz a tartalom jelenik meg, mint a curl esetén.

Vizsgálja meg a szerverlogokat a valós crawler-kérésekre a /robots.txt felé, valamint a Googlebot vagy más ügynökök próbálkozásaira a blokkolt oldalak lekérésére — a logok a legmegbízhatóbb harmadik féltől származó jelzők a crawler-viselkedésre.

Ellenőrzések, amelyeket futtasson, ha Ön a tulajdonos:

Használja a Google Search Console URL Inspection eszközét egyes oldalakhoz, hogy lássa, lekérte-e vagy indexelte-e a Google az adott URL-t. Az URL Inspection hiteles információt ad a tulajdonolt property-k esetén.

A robots.txt megváltoztatása után figyelje a szerverlogokat és a Search Console Performance jelentését, hogy megerősítse a crawling viselkedését a fontos oldalak esetén.

Gyakori problémajelzők és teendők

Véletlenül blokkolta a CSS/JS-t — tünet: az oldalak másképp renderelődnek a crawler-ek számára; Megoldás: távolítsa el az erőforrásútvonalakat a Disallow-ból, hogy a crawler-ek lekérhessék azokat.

A robots.txt 404/5xx-et ad vissza — tünet: egyes crawler-ek a webhelyet teljesen feltérképezhetőnek tekinthetik, vagy ideiglenesen felfüggeszthetik a crawlingot; Megoldás: állítsa vissza az érvényes robots.txt-et, amely 200-at és megfelelő Content-Type-ot ad vissza.

Egy teljes hostot vagy protokollt blokkolt azzal, hogy a robots.txt-et a rossz aldomainre helyezte — tünet: az oldalak eltűnnek a crawl-logokból; Megoldás: adja hozzá a robots.txt-et a megfelelő hosthoz (és ellenőrizze az átirányításokat).

Ha egy oldal a crawlingból ki van zárva, de mégis megjelenik a keresési találatok között snippet nélkül, akkor az azt jelzi, hogy az URL külső jelek alapján indexelve lett, még akkor is, ha a tartalmat nem töltötték le. Az ilyen URL-ek eltávolításához használjon megfelelő HTTP-hitelesítést, távolítsa el az oldalt, vagy szolgáljon ki a oldalon belül noindex direktívát (a noindex megköveteli, hogy a crawler lekérje az oldalt, tehát ne blokkolja azt a robots.txt-ben, ha a noindexet tervezi használni).

Ellenőrzőlista: robots.txt biztonságos telepítése és felülvizsgálata

Helyezze el a robots.txt-et a webhely gyökerében az adott host és protokoll számára.

Tesztelje a fájlt curl-lel (törzs és fejléc) és egy böngészőben.

Kerülje a CSS, JavaScript vagy más, a rendereléshez használt erőforrások blokkolását, kivéve, ha szándékosan meg akarja akadályozni a crawler-ek általi renderelést.

Jelölje meg a sitemap-eket a robots.txt-ben, hogy a crawler-ek felfedezhessék az indexálható URL-jeit.

Figyelje a szerverlogokat és a Search Console-t a crawling viselkedésének változásai után.

Ha részletes, lépésről lépésre útmutatóra van szüksége, olvassa el a Read the Technical SEO Guide a feltérképezhetőség és a Core Web Vitals szélesebb kontextusához.

További szempontok 2026-ban

Mivel a Google a mobil verziót használja elsődleges alapként a feltérképezéshez és indexeléshez, és mivel a hagyományos gyorsítótárazott oldalakat 2024 elején eltávolították, a robots.txt-szel szándékosan a crawler-ek elől elrejtett tartalom kevésbé valószínű, hogy megjelenik a modern AI-vezérelt áttekintésekben és a Search Generative Experience funkciókban. Ha azt szeretné, hogy a tartalom elérhető legyen AI-áttekintésekhez vagy gazdag SERP-funkciókhoz, engedélyezze a crawler-eknek az oldal lekérését és indexelését, és alkalmazzon strukturált adatokat, ahol indokolt.

Gyakran ismételt kérdések

Hol kell elhelyezni a robots.txt-et?

A robots.txt-nek elérhetőnek kell lennie az adott host és protokoll gyökerén, amelyet szabályozni kíván, például https://www.example.com/robots.txt. A szabályok nem öröklődnek a felsőbb domainről az aldomainre.

Eltávolíthat-e egy oldal a robots.txt-ben való blokkolása a keresési találatokból?

Egy oldal crawlingból való kizárása nem mindig akadályozza meg az URL megjelenését a keresési eredményekben, ha más oldalak hivatkoznak rá. Az indexelés megakadályozásához engedje meg az oldal feltérképezését és adjon vissza noindex direktívát, vagy használjon szerveroldali hozzáférés-vezérlést.

Milyen gyorsan lépnek érvénybe a robots.txt változtatások?

A crawler-ek időszakosan lekérik a robots.txt-et; nincs univerzális, rögzített időkeret. A változás megerősítéséhez ellenőrizze a szerverlogokat az új /robots.txt kérésekre, és figyelje a Search Console-t és a crawl-logokat a viselkedésváltozásokért.

Használjam-e a robots.txt-et privát tartalom elrejtésére?

Nem. A robots.txt nyilvános fájl, és nem szabad érzékeny adatok védelmére hagyatkozni. Használjon hitelesítést, távolítsa el a tartalmat a nyilvános útvonalakról, vagy szolgáltasson megfelelő HTTP-válaszkódokat a hozzáférés megakadályozására.

Hogyan engedhetem meg, hogy csak egy crawler (pl. Googlebot) férjen hozzá az oldalamhoz?

Be lehet illeszteni egy user-agent csoportot egy adott crawler számára, és szigorúbb csoportokat a többieknek, például:

User-agent: Googlebot

Disallow:

User-agent: *

Disallow: /

Ne feledje, hogy ez user-agent stringeken és a szabálykövető crawler-eken alapul; ez nem biztonságos hozzáférés-vezérlés.

Related articles