Robots.txt SEO: efikasna kontrola crawlinga
Saznajte kako koristiti robots.txt za sigurno usmjeravanje crawlera, izbjegavanje pogrešaka pri indeksiranju, provjeru ponašanja s curlom i logovima te primjenu praktičnih primjera za produkcijske stranice.

Što robots.txt radi — i što ne radi
Robots.txt je obična tekstualna datoteka smještena u korijenu web-mjesta (https://example.com/robots.txt). Njegova je uloga usko definirana: daje upute za crawling dobroćudnim crawlerima. Koristite ga za smanjenje nepotrebnih dohvaćanja u područjima niske vrijednosti i za poboljšanje učinkovitosti crawlinga; ne oslanjajte se na njega za kontrolu indeksiranja ili za skrivanje osjetljivog sadržaja.
Kontrolira crawling, ne indeksiranje
Direktiva Disallow sprječava usklađene crawlere da dohvaćaju URL put. Ako je stranica blokirana za crawling, tražilice mogu i dalje indeksirati njegov URL na temelju vanjskih signala (na primjer, linkova), ali neće vidjeti HTML stranice ili meta robots oznake. Da biste pouzdano spriječili indeksiranje, dopustite crawling kako bi crawler mogao pročitati meta robots noindex oznaku ili upotrijebiti X-Robots-Tag zaglavlje s noindex na samom resursu.
Javno, informativno i nije sigurnosni mehanizam
Robots.txt je javno dostupan i savjetodavan: svatko ga može pročitati na /robots.txt, a zlonamjerni crawleri mogu ignorirati njegove direktive. Nemojte navoditi tajne ili privatne putanje u robots.txt; tretirajte ga kao dokument za kontrolu crawlinga, a ne kao mehanizam za kontrolu pristupa.
Osnovna sintaksa i uobičajene direktive
Većina web-mjesta koristi mali skup direktiva. Specifikacija i praktična proširenja koje koriste glavne tražilice podržavaju osnovne uzorke, wildcard-e i pokazivače na sitemap. Držite pravila jednostavnima i po mogućnosti dokumentirajte namjeru u komentarima.
Ključne direktive (primjeri prikazani doslovno):
- User-agent: <bot-name> — ciljate jednog crawlера; koristite User-agent: * za sve crawlere.
- Disallow: /path/ — sprječava dohvaćanje putanja ispod /path/.
- Allow: /path/file.js — izričito dozvoljava putanju ispod roditelja koji je Disallow (podržano od strane glavnih tražilica).
- Sitemap: https://example.com/sitemap.xml — upućuje crawlere na vaš XML sitemap(i).
- Wildcardi: * (poklapa bilo koji niz) i $ (kraj niza) su u praksi podržani od strane glavnih tražilica; koristite ih pažljivo za obrasce s parametrima upita.
- Nestandardne direktive: Crawl-delay i Host prepoznaju neki crawleri, ali nisu dio originalnog standarda — testirajte ponašanje za user-agente koji su vam važni.
Kako robots.txt utječe na indeksiranje i rangiranje
Odvojite crawling, indeksiranje i rangiranje: robots.txt utječe na fazu crawlinga (hoće li crawler dohvatiti URL). Za indeksiranje je potrebno da crawler pročita sadržaj stranice ili meta/X-Robots-Tag. Rangiranje je naknadni proces koji se oslanja na signale, od kojih neki dolaze iz sadržaja stranice; ako crawler ne može dohvatiti stranicu, ti signali iz sadržaja nisu dostupni.
Praktične posljedice:
- Blokiranje stranice u robots.txt znači da tražilica ne može dohvatiti stranicu da bi pročitala meta robots noindex oznake ili strukturirane podatke.
- Ako je važan resurs (CSS/JS) blokiran, mobile-first indexing i renderiranje može ne prikazati stranicu ispravno; budući da Google koristi mobilnu verziju kao svoju primarnu osnovu za crawling and indexing, i budući da je Googlebot Smartphone zadani crawler od July 2024, dopustite resurse potrebne za renderiranje na mobilnim uređajima.
Verifikacija: kako testirati što crawleri zapravo vide
Provjerite dostupnost i sadržaj robots.txt izvana te potvrdite kako vaše web-mjesto odgovara na stvarne zahtjeve crawlera. Koristite server logove, izravna dohvaćanja i alate Search Console za stranice koje kontrolirate.
Brze provjere s curl
Za dohvaćanje HTTP zaglavlja odgovora za robots.txt (samo zaglavlja):
- curl -I https://example.com/robots.txt — vraća samo zaglavlja odgovora; provjerite status code i Content-Type.
Za dohvat cijele datoteke kao specifičan user-agent (HTML i direktive):
- curl -A "Googlebot" https://example.com/robots.txt — vraća tijelo datoteke koristeći navedeni user-agent string.
Server logovi i stvarni dokazi iz crawlova
Pregledajte server logove za zahtjeve na /robots.txt i za user-agente crawlera poput Googlebot ili Bingbot. Logovi pokazuju učestalost dohvaćanja, response code-ove i je li crawler pokušao dohvatiti zabranjene URL-ove. Za stranice koje posjedujete, upotrijebite URL Inspection u Search Console da vidite signale crawlanja i indeksiranja; za tuđe stranice, upit site: daje naznaku, ali nije konačan.
Uobičajene pogreške i kako ih ispraviti
Izbjegavajte ove česte pogreške pri upravljanju robots.txt.
- Blokiranje CSS/JS potrebnog za renderiranje: rješenja — dopustite putanje za assete potrebne mobilnom renderiranju kako bi Googlebot Smartphone mogao točno renderirati stranice.
- Očekivanje da robots.txt noindexira URL-ove: rješenja — uklonite Disallow za tu stranicu i koristite meta robots noindex ili X-Robots-Tag zaglavlje tako da tražilice mogu vidjeti uputu.
- Navođenje osjetljivih URL-ova u robots.txt: rješenja — ne izlažite privatne putanje u robots.txt; zaštitite ih autentikacijom i ispravnom kontrolom pristupa na poslužiteljskoj strani.
- Previše složena wildcard pravila koja nenamjerno poklapaju valjane stranice: rješenja — testirajte svaki uzorak s primjerima URL-ova i dokumentirajte namjeru u komentarima, te držite pravila što specifičnijima.
Preporučene strategije za robots.txt
Usvojite konzervativan, testabilan pristup: držite robots.txt minimalnim, uputite crawlere na sitemape i preferirajte kontrolu indeksiranja na razini stranice putem meta/X-Robots-Tag.
Praktični obrasci:
- Zadano dopuštenje plus sitemap: uključite User-agent: * i Sitemap direktivu kako bi crawleri brzo otkrili vašu strukturu.
- Disallow stranica s parametrima niske vrijednosti ili rezultata interne pretrage, ali izbjegavajte blokiranje obrazaca parametara koji također poklapaju kanonijski sadržaj; preferirajte rukovanje parametrima u vašem sitemapu ili putem canonical oznaka.
- Staging ili razvoj: blokirajte crawlere dok je staging javno dostupan, ali uklonite ili promijenite blok prije lansiranja; ne oslanjajte se na robots.txt kao jedino sredstvo zaštite preprodukcijskih resursa.
Primjeri koje možete prilagoditi
Jednostavno web-mjesto sa sitemapom
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Uobičajeni CMS (dozvoli admin-ajax)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
Staging blok (javni server, ali još nije uživo)
User-agent: *
Disallow: /
Upozorenje: staging blokove treba ukloniti prije lansiranja; također osigurajte staging autentikacijom kako tražilice i treće strane ne bi slučajno indeksirale sadržaj ako se robots datoteka promijeni.
Održavanje robots.txt u velikim sustavima
Za velike web-stranice tretirajte robots.txt kao konfiguracijski artefakt: držite ga u source controlu, pregledavajte promjene u pull requestovima i deployajte s web-mjestom kako bi staging i produkcija imali ispravne, specifične datoteke za okruženje. Automatizirajte testove koji dohvaćaju deployanu robots.txt i provjeravaju sintaksu pravila na reprezentativnim URL-ovima.
Ako upravljate više subdomena, zapamtite da je robots.txt specifičan za host: pravila na example.com/robots.txt ne primjenjuju se na sub.example.com.
FAQ
Može li robots.txt spriječiti da se stranica pojavi u rezultatima pretraživanja?
Ne pouzdano. Robots.txt može spriječiti crawler da dohvatiti stranicu, ali tražilice mogu i dalje indeksirati URL na temelju vanjskih linkova ili drugih signala. Da biste spriječili indeksiranje, dopustite crawling i upotrijebite meta robots noindex oznaku na stranici ili X-Robots-Tag: noindex zaglavlje odgovora tako da crawler može pročitati uputu.
Kako provjeriti da Google poštuje moj robots.txt?
Iz izvana, dohvatite https://example.com/robots.txt s curlom kako biste potvrdili datoteku i statusne kodove, pregledajte server logove za Googlebot zahtjeve za datotekom i za stranice koje očekujete da budu crawlane, i koristite URL Inspection u Search Console za stranice koje posjedujete kako biste vidjeli pokušaje crawlanja i status indeksiranja. Upit site: može pružiti javnu naznaku, ali nije konačan.
Trebam li blokirati URL parametre u robots.txt?
Budite oprezni. Blokiranje parametriziranih URL-ova može uštedjeti crawl budget, ali riskira skrivanje kanoniziranog ili indeksiranog sadržaja ako su obrasci preširoki. Preferirajte canonical oznake, rukovanje parametrima u sitemapima ili preusmjeravanja na poslužiteljskoj strani gdje je prikladno; testirajte svaki obrazac temeljito prije deploya.
Je li Crawl-delay siguran za oslanjanje?
Crawl-delay je nestandardna direktiva i njezina podrška varira ovisno o crawleru. Za stranice kojima treba kontrola brzine crawlanja, preferirajte ograničavanje stope na strani servera, robots meta tags za selektivne stranice, ili postavke specifične za crawlere dostupne u servisima poput Bing Webmaster Tools. Uvijek testirajte ponašanje za konkretne user-agente koje ciljate.
Related articles

kako koristiti robots.txt datoteku za SEO
Saznaj što robots.txt kontrolira, kako napisati ispravna pravila, provjeriti ponašanje s curl i DevTools te izbjeći uobičajene SEO pogreške.

Najbolje SEO usluge
Saznaj što jedna sveobuhvatna SEO suradnja treba uključivati, kako provjeriti pružatelje, tehničke korake provjere i sigurne prakse za linkove.

Praktični SEO savjeti za bolje rangiranje
Provedive, trajne SEO strategije: ključne riječi, on-page osnove, tehnička rješenja, smjernice za link-building i koraci provjere koje možeš primijeniti danas.
