Robots.txt: mi ez és hogyan működik
A robots.txt egy egyszerű szövegfájl, amelyet a webhely gyökerébe helyeznek, és feltérképezési szabályokat határoz meg a webfeltérképezők számára (User-agent, Disallow, Allow, Sitemap). Szabályozza a feltérképezés viselkedését, és közvetetten befolyásolhatja az indexelést, de nem határozza meg közvetlenül a rangsorolást.

Mi az a robots.txt?
A robots.txt (a Robots Exclusion Protocol) egy egyszerű szövegfájl, amely a hoszt gyökérkönyvtárában található — pl. https://example.com/robots.txt — és egyszerű feltérképezési utasításokat ad a User-agenteknek (web crawlers). Nyilvános és géppel olvasható; nem hitelesít, és nem rejti el a tartalmat. A feltérképezők elolvassák a robots.txt-et, hogy megtudják, mely útvonalakat szeretné a webhely tulajdonosa, hogy elkerüljék vagy előnyben részesítsék.
Miért fontos a robots.txt az SEO szempontjából
A robots.txt szabályozza a feltérképezést. A feltérképezés a felfedezés és a letöltés szakasza annak, ahogyankeresőmotorok lépnek kölcsönhatásba a webhelyével; ha egyfeltérképezőnem fér hozzá egy URL lekéréséhez, előfordulhat, hogy nem látja az oldalon lévő utasításokat (például a meta robots-ot) vagy az indexeléshez szükséges tartalmat. Ez azt jelenti, hogy a robots.txt közvetetten befolyásolhatja az indexelést. Nem határozza meg közvetlenül a rangsorolást — a ranking az indexelést követően sok jel alapján dől el. Használja a robots.txt-et szervererőforrások védelmére, hogy elkerülje az ismétlődő vagy belső eszközoldalak feltérképezését, és győződjön meg róla, hogy a feltérképezők hozzáférnek a helyes rendereléshez szükséges assetekhez.
Hogyan működik a robots.txt
Egy feltérképező lekéri a /robots.txt-et, mielőtt más oldalakat kérne le ugyanarról a hosztról, és alkalmazza az első, egyező User-agent szakaszt és az abban foglalt direktívákat. A nagyobb feltérképezők általában támogatott direktívái közé tartozik a User-agent, Disallow, Allow és Sitemap. A mintázatillesztés és további direktívák támogatása feltérképezőnként változik — a Google olyan mintákat ismer el, mint a * és a $, és dokumentációja szerint követi az Allow/Disallow precedencia szabályait.
Tipikus direktívák és példák
Egy minimális robots.txt példa:
User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml
Megjegyzés: helyezze a robots.txt-et a webhely gyökérkönyvtárába. Ha a robots.txt HTTP 404-et ad vissza, a legtöbb feltérképező 'nincs korlátozásként' kezeli; ha nem érhető el vagy szerverhibát ad vissza, a feltérképezők viselkedése eltérő lehet — tesztelje és figyelje, hogy elkerülje a véletlen, széles körű blokkolást. Google-specifikus viselkedéshez és példákhoz tekintse meg a Google robots.txt dokumentációját.
A robots.txt típusai
Különböző minták használatosak a cél alapján. Az alábbiakban gyakori megközelítések rövid előnyökkel és hátrányokkal.
- Site-wide block (Disallow: /)
Előnyök: azonnal megakadályozza a feltérképezők hozzáférését az egész hoszthoz.
Hátrányok: megakadályozza, hogy a feltérképezők lekérjék a tartalmat és az asseteket; megállíthatja a nyilvános oldalak indexelését.
- Path-specific rules (Disallow: /private/)
Előnyök: egyszerű kizárni belső vagy admin útvonalakat.
Hátrányok: a robots.txt nyilvános; ne sorolja fel azokat az érzékeny útvonalakat, amelyeket titokban akar tartani.
- User-agent specific rules (User-agent: Googlebot)
Előnyök: testreszabhatja a viselkedést adott feltérképezőknek.
Hátrányok: karbantartási igény növekszik; egyes feltérképezők figyelmen kívül hagyhatják a nem szabványos direktívákat.
Hogyan kezdjen hozzá a robots.txt-hez
1) Döntse el, mit kell védeni a feltérképezéstől (szerverterheléses területek, staging útvonalak), és mi maradjon elérhető a feltérképezők számára (nyilvános oldalak, CSS/JS szükséges a rendereléshez).
2) Hozzon létre egy egyszerű szövegfájlt robots.txt néven a webhely gyökérkönyvtárában. Tesztelje helyben és staging környezetben, mielőtt élesbe viszi.
3) Telepítse és ellenőrizze a műszaki ellenőrzőlistával lent. Tartsa egyszerűen a fájlt, és dokumentálja az User-agent-specifikus szabályokat, hogy a jövőbeni karbantartók megértsék a szándékot.
Gyakori robots.txt hibák
• A robots.txt-re támaszkodás érzékeny adatok elrejtésére — a robots.txt nyilvános, és nem alkalmas biztonsági célokra. Használjon hitelesítést vagy távolítsa el az erőforrást.
• A rendereléshez szükséges CSS/JS blokkolása — ez ronthatja, hogyan érti meg a keresőmotor az oldal elrendezését és tartalmát.
• Olyan oldalak blokkolása, amelyek meta noindex-et tartalmaznak — ha a Googlebot nincs engedélyezve az oldal lekérésére, nem látja a meta noindex direktívát.
• A robots.txt alútvonal alá helyezése (pl. /blog/robots.txt) — a feltérképezők csak a gyökérszintű fájlt keresik.
• Szintaxis hibák és helytelen HTTP státuszkódok — győződjön meg róla, hogy a fájl megfelelő 200-as választ ad.
Robots.txt ellenőrzése: műszaki ellenőrzőlista
Használja az alábbi ellenőrzéseket a robots.txt telepítése vagy frissítése után. Minden tételnél meg van adva, hol ellenőrizze és mi a világos elfogadási feltétel.
**File reachable** — ellenőrzés helye: curl -I https://example.com/robots.txt — sikeres, ha a kérés HTTP 200-at ad vissza és a fájl a várt tartalmú.
**Correct directives** — ellenőrzés helye: curl https://example.com/robots.txt vagy view-source a böngészőben — sikeres, ha a User-agent/Disallow/Allow sorok megfelelnek a szabályzatának.
**Not blocking rendering assets** — ellenőrzés helye: Chrome DevTools Network és Coverage vagy lekérés egy crawler szimulátorral — sikeres, ha a rendereléshez szükséges CSS/JS nincs letiltva.
**Google-block check (own site)** — ellenőrzés helye: Google Search Console URL Inspection — sikeres, ha az Inspection azt mutatja, hogy az URL feltérképezhető és nincs "Blocked by robots.txt" jelölés.
**External crawl check** — ellenőrzés helye: használjon curl-t vagy harmadik fél feltérképezőt a blokkolt URL lekéréséhez és győződjön meg róla, hogy maga az oldal 200-at ad vissza, de a feltérképező hozzáférését megtagadták — sikeres, ha a viselkedés megfelel az elvárásoknak.
**Sitemap presence** — ellenőrzés helye: a robots.txt tartalma és a Google Search Console Sitemaps jelentése — sikeres, ha a sitemap URL szerepel a robots.txt-ben vagy be lett küldve a Search Console-ban és elfogadták.
Eszközök és parancsok a robots.txt ellenőrzéséhez
curl (csak fejléc): curl -I https://example.com/robots.txt — visszaadja az HTTP státuszt és a válasz fejléceit. curl (teljes fájl): curl https://example.com/robots.txt — kiírja a tartalmat ellenőrzésre. Chrome DevTools: nyissa meg a fájl URL-jét vagy nézze a hálózati kéréseket az oldalon, hogy megerősítse, az assetek engedélyezettek-e. Google Search Console URL Inspection: egy Ön által tulajdonolt URL esetén az eszköz megmutatja, látja-e a Google az oldalt és le van-e tiltva robots.txt által.Bing Webmaster ToolsA Site Explorer megmutathatja, hogyan kezelte a Bing a fájlt a verifikált webhelyeken. Használja a szerverlogokat annak megerősítésére, mely user-agentek kérték le a robots.txt-et és milyen gyakran.
A támogatott direktívákra és precedencia részletekre vonatkozó hivatalos információkért tekintse meg a következő dokumentációt: https://developers.google.com/search/docs/advanced/robots/intro
Olvassa el a Technical SEO Guide-ot
Gyakran ismételt kérdések
K: Ha egy oldalt blokkolok robots.txt-sel, eltűnik a találatok közül?
V: A robots.txt-sel történő blokkolás megakadályozza, hogy a feltérképezők lekérjék az oldalt, ami általában megakadályozza, hogy lássák az oldalon lévő jeleket. Egy blokkolt oldal továbbra is megjelenhet a keresési találatok között külső jelek alapján (csak URL-megjelenés), de nem lesz cache-elt kivonata vagy renderelt tartalma. Eltávolításhoz használja az index eltávolítási eszközöket az Ön által tulajdonolt URL-ekhez; az indexelés metadata általi szabályozásához győződjön meg róla, hogy az oldal feltérképezhető, hogy a feltérképező láthassa a meta robots:noindex direktívát.
K: Használhatom-e a robots.txt-et bizonyos botok blokkolására?
V: Hozzáadhat User-agent-specifikus szakaszokat ismert feltérképezők célzásához. Ugyanakkor a robots.txt egy becsületkódex: a jól viselkedő feltérképezők betartják, a rosszindulatú botok figyelmen kívül hagyhatják. Erősebb védelemhez használjon hitelesítést, IP-szűrést vagy tűzfalat.
K: Fel kell-e tüntetnem a sitemapet a robots.txt-ben?
V: A Sitemap: https://example.com/sitemap.xml feltüntetése a robots.txt-ben kényelmes mód a sitemap megmutatására a feltérképezőknek; emellett küldje be a sitemapet közvetlenül a Google Search Console-ba az Ön által kezelt webhelyekhez.
K: A robots.txt protokollonként és hosztonként alkalmazandó?
V: Igen. A robots.txt-et hosztonként és protokollonként kérik le: a https://example.com/robots.txt különálló az http://example.com/robots.txt-től vagy https://sub.example.com/robots.txt. Helyezze a fájlt ugyanarra a séma és hoszt kombinációra, amelyet a webhely használ.
K: Hogyan befolyásolja a mobile-first indexing a robots.txt-et?
V: A Google a mobil verziót használja elsődleges alapként a feltérképezés és indexelés. 2024 júliusa óta a Google alapértelmezés szerint a Googlebot Smartphone-tal térképezi fel a webhelyeket a Search-hoz. Győződjön meg róla, hogy a robots.txt esetlegesen nem blokkolja véletlenül a mobil verzión szolgáltatott oldalakhoz szükséges erőforrásokat, amelyek a helyes rendereléshez és indexeléshez szükségesek.
K: Hol találok hivatalos útmutatót?
V: Hivatkozzon a Google robots.txt dokumentációjára itt: https://developers.google.com/search/docs/advanced/robots/intro és a Schema.org valamint a W3C erőforrásaira a kapcsolódó feltérképezési és indexelési gyakorlatok tekintetében.
Kapcsolódó

Crawler: mi ez és miért fontos a SEO számára
A crawler egy automatizált bot, amely weboldalakat lekér, követi a linkeket és erőforrásokat a keresőmotorok számára történő tartalomfelismeréshez; a feltérképezett oldalak indexelésre jelölt jelöltek lesznek (Google alapértelmezettként Googlebot Smartphone-ot használ since July 2024).

Keresőmotorok: működésük és SEO alapok
A keresőmotorok olyan szoftveres rendszerek, amelyek felfedezik, feltérképezik, indexelik és lekérik a webtartalmakat a felhasználói lekérdezések megválaszolására; a modern SERPs-ben AI Overviews, rich results és rangsorolt találatok is megjelennek, amelyeket sok jel határoz meg.

Keresési algoritmus: meghatározás, működés és SEO hatása
A keresési algoritmus az a szoftverlogika, amelyet a keresőmotorok használnak az oldalak felderítésére, feltérképezésére, indexelésére és rangsorolására: relevancia-jelek, tartalomminőség, linkjelek és MI-alapú szándékmodellek kombinálásával rendezik az eredményeket.

Keresési rangsorok: meghatározás és működésük
A keresési rangsorok azt az sorrendet jelentik, ahogyan a keresők egy adott lekérdezésre indexelt oldalakat mutatnak; a rangsorok sok jel alapján alakulnak — relevancia, backlinkek, tartalomminőség, oldalélmény és felhasználói szándék —, és 2026-ban az AI-overview jellegű megjelenések is befolyásolják őket.

Meta tagek: típusok és SEO legjobb gyakorlatok
A meta tagek olyan HTML-elemek, amelyek egy oldalról adnak metaadatot (cím, leírás, robots-utasítások, közösségi előnézet-címkék és mások). A keresőmotorok és platformok ezeket olvassák, hogy befolyásolják az indexelést, a SERP-kivonatokat és a megjelenítést.

On-page SEO: definíció, ellenőrzőlista és ellenőrzés
On-page SEO az oldal tartalmának, HTML-jének és UX-ének optimalizálása úgy, hogy releváns, indexelhető és hasznos legyen a felhasználók és a modern keresőmotorok számára — lefedi a mobile-first renderinget, a structured data-t, a canonicals-t és az oldal teljesítményét.
