Robots.txt SEO: učinkovito nadzirajte crawling
Naučite se, kako uporabiti robots.txt za varno usmerjanje crawlerjev, preprečevanje napak pri indeksiranju, preverjanje z curl in dnevniki ter primere za produkcijo.

Kaj robots.txt počne — in česa ne
Robots.txt je navadna besedilna datoteka, postavljena v koren spletnega mesta (https://example.com/robots.txt). Njena vloga je ozko opredeljena: daje navodila crawlerjem, ki se obnašajo odgovorno. Uporabite jo za zmanjšanje nepotrebnih zahtevkov na nizko vrednih področjih in za izboljšanje učinkovitosti crawlanja; ne zanašajte se nanjo za nadzor indeksiranja ali za skrivanje občutljivih vsebin.
Nadzoruje crawling, ne indeksiranja
Direktiva Disallow prepreči, da skladni crawlerji pridobijo URL pot. Če je stran blokirana za crawling, iskalniki lahko še vedno indeksirajo njen URL na podlagi zunanjih signalov (na primer povezav), vendar ne bodo videli HTML kode strani ali meta robots oznak. Če želite zanesljivo preprečiti indeksiranje, dovolite crawling, da se crawler lahko prebere meta robots noindex oznako ali uporabi X-Robots-Tag odzivno zaglavje z noindex na sami vsebini.
Javno, informativno in ni varnostni mehanizem
Robots.txt je javno dostopen in ima svetovalni značaj: vsak uporabnik ga lahko prebere na /robots.txt, zlonamerni crawlerji pa lahko prezrejo njegove direktive. Ne navajajte skrivnosti ali zasebnih poti v robots.txt; obravnavajte ga kot dokument za nadzor crawlinga, ne kot mehanizem za nadzor dostopa.
Osnovna sintaksa in pogoste direktive
Večina strani bo uporabila majhen nabor direktiv. Specifikacija in praktične razširitve, ki jih uporabljajo glavni iskalniki, podpirajo osnovne vzorce, wildcards in kazalce na sitemap. Pravila ohranite enostavna in, kjer je mogoče, zapišite namen v komentarjih.
Ključne direktive (primeri prikazani kot dobesedne vrstice):
- User-agent: <bot-name> — ciljate enega crawlerja; uporabite User-agent: * za vse crawlerje.
- Disallow: /path/ — prepreči pridobivanje poti pod /path/.
- Allow: /path/file.js — izrecno dovoli pot pod prepovedanim nadrejencem (podprto pri glavnih iskalnikih).
- Sitemap: https://example.com/sitemap.xml — usmeri crawlerje na vaš XML sitemap(e).
- Wildcards: * (ujema katerokoli zaporedje) in $ (konec niza) so v praksi podprti pri glavnih iskalnikih; uporabljajte jih previdno pri vzorcih parametrov poizvedbe.
- Nestandardne direktive: Crawl-delay in Host jih priznavajo nekateri crawlerji, vendar niso del izvirnega standarda — testirajte vedenje za user-agente, ki so vam pomembni.
Kako robots.txt sodeluje z indeksiranjem in rangiranjem
Ločite crawling, indeksiranje in rangiranje: robots.txt vpliva na fazo crawlanja (ali crawler pridobi URL). Indeksiranje zahteva, da crawler prebere vsebino strani ali meta/X-Robots-Tag. Rangiranje je kasnejši proces, ki se zanese na signale, nekateri izhajajo iz vsebine strani; če crawler ne more pridobiti strani, so ti iz vsebine izpeljani signali nedosegljivi.
Praktične posledice:
- Blokiranje strani v robots.txt pomeni, da iskalnik ne more pridobiti strani, da bi prebral meta robots noindex oznake ali strukturirane podatke.
- Če je pomemben vir (CSS/JS) blokiran, mobile-first indexing in upodabljanje lahko ne vidita strani pravilno; ker Google uporablja mobilno različico kot glavno osnovo za crawling and indexing, and since Googlebot Smartphone is the default crawler as of July 2024, allow resources required for rendering on mobile.
Preverjanje: kako testirati, kaj crawlerji dejansko vidijo
Preverite dostopnost in vsebino robots.txt od zunaj ter potrdite, kako vaša stran odgovarja na dejanske zahteve crawlerjev. Uporabite strežniške dnevnike, neposredne pridobitve in orodja Search Console za strani, ki jih nadzorujete.
Hitri pregledi s curl
Če želite pridobiti HTTP odzivne glave za robots.txt (samo glave):
- curl -I https://example.com/robots.txt — vrne samo odzivne glave; preverite statusno kodo in Content-Type.
Če želite pridobiti celotno datoteko kot določen user-agent (HTML in direktive):
- curl -A "Googlebot" https://example.com/robots.txt — vrne telo datoteke z uporabo navedenega user-agent niza.
Strežniški dnevniki in dokazi dejanskega crawlanja
Preverite strežniške dnevnike za zahteve na /robots.txt in za user-agente crawlerjev, kot so Googlebot ali Bingbot. Dnevniki pokažejo frekvenco pridobitev, odzivne kode in ali so crawlerji poskušali dostopati do prepovedanih URL-jev. Za strani, ki jih imate v lasti, uporabite URL Inspection v Search Console, da vidite signale o crawlu in indeksiranju; za strani tretjih oseb pa poizvedba site: daje indikacijo, vendar ni dokončna.
Pogoste napake in kako jih popraviti
Izogibajte se tem pogostim napakam pri upravljanju robots.txt.
- Blokiranje CSS/JS, potrebnih za upodabljanje: popravki — dovolite poti do virov, potrebnih za mobilni upodabljalni pipeline, da bo Googlebot Smartphone lahko pravilno upodobil strani.
- Pričakovati, da bo robots.txt postavil URL-je v noindex: popravki — odstranite Disallow za stran in uporabite meta robots noindex ali X-Robots-Tag zaglavje, da bodo iskalniki videli navodilo.
- Navajanje občutljivih URL-jev v robots.txt: popravki — ne izpostavljajte zasebnih poti v robots.txt; zaščitite jih z avtentikacijo in ustreznimi strežniškimi mehanizmi nadzora dostopa.
- Preveč zapletene wildcard-rege, ki nenamerno ujemajo veljavne strani: popravki — preizkusite vsak vzorec s primeri URL-jev in dokumentirajte namen v komentarjih ter ohranite pravila čim bolj specifična.
Priporočene strategije za robots.txt
Sprejmite konzervativen, preizkušljiv pristop: ohranite robots.txt minimalen, usmerite crawlerje na sitemape in raje uporabite meta/X-Robots-Tag na ravni strani za upravljanje indeksiranja.
Praktični vzorci:
- Privzeta dovolitev z dodatkom sitemap: vključite User-agent: * in Sitemap direktivo, da crawlerji hitro odkrijejo vašo strukturo.
- Onemogočite strani nizke vrednosti z parametri poizvedb ali notranje rezultate iskanja, vendar se izogibajte blokiranju vzorcev parametrov, ki se ujemajo tudi s kanonično vsebino; raje upravljajte parametre v sitemapu ali prek kanoničnih oznak.
- Staging ali razvoj: blokirajte crawlerje, ko je staging javen, vendar pred lansiranjem odstranite ali spremenite blokado; ne zanašajte se na robots.txt kot edini varnostni ukrep za preprodukturne vire.
Primeri, ki jih lahko prilagodite
Preprosta stran s sitemap
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Pogost CMS (dovoli admin-ajax)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
Staging blok (javen strežnik, vendar še ni v živo)
User-agent: *
Disallow: /
Opozorilo: staging blokade je treba odstraniti pred lansiranjem; prav tako zaščitite staging z avtentikacijo, da iskalniki in tretje strani ne morejo po naključju indeksirati, če se datoteka robots spremeni.
Vzdrževanje robots.txt v obsegu
Za velike strani obravnavajte robots.txt kot konfiguracijski artefakt: hranite ga v source control, pregledujte spremembe v pull requestih in ga nameščajte skupaj s stranjo, tako da imata staging in produkcija pravilne datoteke, specifične za okolje. Avtomatizirajte teste, ki pridobivajo nameščeni robots.txt in preverjajo sintakso pravil proti reprezentativnim URL-jem.
Če upravljate več poddomen, imejte v mislih, da je robots.txt specifičen za gostitelja: pravila na example.com/robots.txt ne veljajo za sub.example.com.
Pogosta vprašanja
Ali lahko robots.txt prepreči, da se stran prikaže v iskalnih rezultatih?
Ne zanesljivo. Robots.txt lahko prepreči, da crawler pridobi stran, vendar lahko iskalniki še vedno indeksirajo URL na podlagi zunanjih povezav ali drugih signalov. Če želite preprečiti indeksiranje, dovolite crawling in uporabite meta robots noindex oznako na strani ali X-Robots-Tag: noindex odzivno zaglavje, da lahko crawler prebere navodilo.
Kako preverim, da Google upošteva moj robots.txt?
Od zunaj pridobite https://example.com/robots.txt z curl, da potrdite datoteko in statusne kode, preglejte strežniške dnevnike za Googlebot zahtevke do datoteke in do strani, za katere pričakujete, da bodo crawlanja, in uporabite URL Inspection v Search Console za strani, ki jih imate v lasti, da vidite poskuse crawlanja in status indeksiranja. Poizvedba site: lahko daje javno indikacijo, vendar ni dokončna.
Ali naj blokiram parametre URL v robots.txt?
Bodite previdni. Blokiranje parametriziranih URL-jev lahko prihrani crawl budget, vendar tvegajo skrivanje kanonizirane ali indeksirane vsebine, če so vzorci preširoki. Raje uporabite kanonične oznake, upravljanje parametrov v sitemapih ali strežniške preusmeritve, kjer je primerno; temeljito preizkusite vsak vzorec pred uvedbo.
Je Crawl-delay varen za zanašanje?
Crawl-delay je nestandardna direktiva in njena podpora se razlikuje glede na crawler. Za strani, ki potrebujejo nadzor hitrosti crawlanja, raje uporabite strežniško omejevanje hitrosti, robots meta tags za izbrane strani, ali nastavitve specifične za crawlerje, ki so na voljo v storitvah, kot je Bing Webmaster Tools. Vedno testirajte vedenje za specifične user-agente, ki jih ciljate.
Related articles

kako uporabiti datoteko robots.txt za SEO
Naučite se, kaj robots.txt nadzoruje, kako napisati pravilna pravila, preveriti vedenje z curl in DevTools ter se izogniti pogostim SEO napakam.

Najboljše SEO storitve (Search Engine Optimization)
Izvedi, kaj naj vključuje celovito SEO sodelovanje, kako oceniti ponudnike, tehnične preveritvene korake in varne prakse za linke.

Praktični SEO nasveti za izboljšanje uvrstitev v iskalnikih
Praktične, trajne SEO strategije: ključne besede, on-page osnove, tehnični popravki, smernice za link building in koraki preverjanja, ki jih lahko uporabite že danes.
