Skip to content
Search

kako koristiti robots.txt datoteku za SEO

Saznaj što robots.txt kontrolira, kako napisati ispravna pravila, provjeriti ponašanje s curl i DevTools te izbjeći uobičajene SEO pogreške.

How to Use Robots.txt File for SEO

Što ovaj vodič obuhvaća

Ovaj post objašnjava što robots.txt kontrolira i što ne kontrolira, pokazuje ispravnu sintaksu i praktične primjere, daje provjere iz naredbenog retka koje možeš pokrenuti i navodi korake za otklanjanje uobičajenih pogrešaka. Dobit ćeš i savjete za verifikaciju koji rade u 2026 search environments (mobile-first indexing je Googleov zadani način od July 2024 i Google je uklonio tradicionalne keširane stranice u early 2024).

Što je robots.txt i što kontrolira

robots.txt je obična tekstualna datoteka u korijenu web-stranice koja komunicira upute za crawling pristojnim web robotima. Dio je Robots Exclusion Standard. Upotrijebi datoteku da kažeš crawlerima koje putanje smiju dohvatiti; kontrolira crawling, ne indexing ili ranking.

Ključne razlike koje treba imati na umu:

Crawling vs indexing vs ranking — robots.txt utječe na crawling (što agent dohvaća). URL blokiran za crawling može se i dalje indeksirati ako ga druge stranice linkaju i tražilica odluči indeksirati URL bez dohvaćanja njegovog sadržaja.

robots.txt je preporuka — samo crawleri koji poštuju standard će ga slijediti. Zlonamjerni botovi, harvesteri spama i neki skeneri mogu ga ignorirati.

robots.txt ne zamjenjuje kontrolu pristupa. Koristi HTTP authentication, zaštitu lozinkom ili kontrole na strani servera za privatni sadržaj.

Gdje robots.txt mora biti i osnovna pravila

robots.txt mora biti poslužen iz korijena stranice za točan host i protokol na koje se pravila odnose. Primjer lokacija koje su različite: https://example.com/robots.txt i https://sub.example.com/robots.txt. Ne možete staviti robots.txt u podmapu i očekivati da kontrolira cijelu domenu.

Radi praktičnosti i primjera u ovom vodiču, kanonska testna putanja je http://www.yoursite.com/robots.txt.

Sintaksa robots.txt i uobičajene direktive

Minimalni robots.txt koristi direktive grupirane po user-agent. Imena direktiva nisu osjetljiva na velika/mala slova. Primjeri u nastavku koriste standardne tokene koje podržava većina glavnih crawlera:

Blokiraj sve crawlere iz direktorija:

User-agent: *

Disallow: /private/

Dozvoli određenu datoteku dok zabranjuješ cijeli direktorij (korisno za parsiranje u Googlebot stilu):

User-agent: *

Disallow: /images/

Allow: /images/logo.png

Sitemaps se mogu deklarirati u robots.txt da usmjere crawlere na vaš XML sitemap:

Sitemap: http://www.yoursite.com/sitemap.xml

Usporedba obrazaca: glavne search engines podržavaju asterisk (*) wildcard i znak dolara ($) za kraj niza u robots.txt obrascima. Nestandardna direktiva Crawl-delay se ignorira od strane nekih enginea (Google ne podržava Crawl-delay).

Praktični primjeri

1) Dopusti svim crawlerima da dohvaćaju sve (zadana sigurna opcija):

User-agent: *

Disallow:

2) Blokiraj jednog crawler (npr., zabraniti specifičnom agentu sav sadržaj):

User-agent: BadBot

Disallow: /

3) Spriječiti crawlere da dohvaćaju resurse potrebne za renderiranje (uobičajena pogreška — vidi rješavanje problema):

Disallow: /static/js/

Blokiranje CSS/JS može spriječiti Google da vidi vašu stranicu onako kako je korisnici vide. Budući da Google koristi mobilnu verziju kao primarnu osnovu za crawling and indexing i procjenjuje Core Web Vitals s renderirane stranice, ne blokirajte resurse potrebne za renderiranje.

Kako provjeriti i otkloniti probleme s robots.txt

Osnovne provjere koje možeš pokrenuti izvana stranice:

Dohvati tijelo datoteke: curl http://www.yoursite.com/robots.txt — ovo vraća sadržaj datoteke koji bi crawler vidio.

Provjeri samo zaglavlja: curl -I http://www.yoursite.com/robots.txt — provjerava HTTP status (200 vs 4xx/5xx) i Content-Type. -I vraća samo response zaglavlja.

Pogledaj kako ga preglednici primaju: otvorite https://www.yoursite.com/robots.txt u pregledniku i potvrdi isti sadržaj kao curl.

Pregledaj server logove za stvarne zahtjeve crawlera na /robots.txt i za Googlebot ili druge agente koji pokušavaju dohvatiti blokirane stranice — logovi su najpouzdaniji signal treće strane o ponašanju crawlera.

Provjere koje trebaš pokrenuti kada posjeduješ vlasništvo:

Upotrijebi Google Search Console’s URL Inspection za pojedinačne stranice kako bi vidio je li Google dohvatila ili indeksirala URL. URL Inspection je autoritativan za propertyje koje posjeduješ.

Nakon promjene robots.txt, prati server logove i Performance izvještaj u Search Consoleu kako bi potvrdio ponašanje crawlanja za važne stranice.

Uobičajeni znakovi problema i što učiniti

Slučajno si blokirao CSS/JS — simptom: stranice se renderiraju drugačije za crawlere; Rješenje: ukloni putanje resursa iz Disallow tako da crawlеri mogu dohvatiti te datoteke.

robots.txt vraća 404/5xx — simptom: neki crawleri mogu tretirati stranicu kao potpuno crawlable ili privremeno obustaviti crawling; Rješenje: povrati valjan robots.txt koji vraća 200 i ispravan Content-Type.

Blokirao si cijeli host ili protokol postavljanjem robots.txt na pogrešan poddomen — simptom: stranice nestaju iz crawl logova; Rješenje: dodaj robots.txt na točan host (i provjeri redirectove).

Ako je stranica blokirana za crawling, ali se i dalje pojavljuje u rezultatima pretraživanja bez isječka, to ukazuje da je URL indeksiran iz izvansignalnih izvora iako sadržaj nije dohvaćen. Da ukloniš takve URL-ove iz rezultata, upotrijebi ispravnu HTTP authentication, ukloni stranicu ili posluži noindex direktivu na samoj stranici (noindex zahtijeva da crawler dohvati stranicu, zato je nemoj blokirati u robots.txt ako planiraš koristiti noindex).

Kontrolna lista: sigurno implementiraj i pregledaj robots.txt

Postavi robots.txt u korijen stranice za točan host i protokol.

Testiraj datoteku s curlom (tijelo i zaglavlja) i u pregledniku.

Izbjegavaj blokiranje CSS-a, JavaScript, ili drugih resursa koji se koriste za renderiranje osim ako namjerno ne želiš spriječiti renderiranje za crawlere.

Objavi sitemaps u robots.txt da pomogneš crawlerima otkriti tvoje indexable URL-ove.

Prati server logove i Search Console za ponašanje crawlanja nakon promjena.

Ako trebaš korak-po-korak referencu, pročitaj Read the Technical SEO Guide za širi kontekst o crawlability i Core Web Vitals.

Dodatna razmatranja u 2026.

Budući da Google koristi mobilnu verziju kao primarnu osnovu za crawling i indexing i jer su tradicionalne keširane stranice uklonjene u early 2024, sadržaj namjerno skriven od crawlera putem robots.txt može biti manje vjerojatno da će se pojaviti u modernim AI-driven pregledima i Search Generative Experience značajkama. Ako želiš da sadržaj bude dostupan AI pregledima ili da se koristi za bogate SERP značajke, dopusti crawlerima da dohvaćaju i indexiraju stranicu i koristi strukturirane podatke gdje je primjenjivo.

FAQ

Gdje mora biti smješten robots.txt?

robots.txt mora biti dostupan u korijenu točnog hosta i protokola koji želiš kontrolirati, na primjer https://www.example.com/robots.txt. Pravila se ne prenose s roditeljskog domena na poddomene.

Može li blokiranje stranice u robots.txt ukloniti stranicu iz rezultata pretraživanja?

Blokiranje stranice za crawling ne uvijek sprječava da se URL pojavi u rezultatima pretraživanja ako ga druge stranice linkaju. Da spriječiš indexing, dopusti da se stranica crawla i vrati noindex direktivu ili upotrijebi kontrole pristupa na strani servera.

Koliko brzo promjene u robots.txt stupe na snagu?

Crawleri periodično dohvaćaju robots.txt; nema univerzalnog fiksnog vremenskog okvira. Da potvrdiš promjenu, provjeri server logove za nove zahtjeve na /robots.txt i prati Search Console i crawl logove za promjene u ponašanju.

Trebam li koristiti robots.txt za skrivanje privatnog sadržaja?

Ne. robots.txt je javna datoteka i ne bi se trebala koristiti za zaštitu osjetljivih podataka. Upotrijebi autentikaciju, ukloni sadržaj s javnih putanja ili posluži odgovarajuće HTTP response kodove da spriječiš pristup.

Kako dopustiti pristup samo jednom crawleru (npr., Googlebot) na moju stranicu?

Možeš uključiti user-agent grupu za specifični crawler i restriktivnije grupe za ostale, na primjer:

User-agent: Googlebot

Disallow:

User-agent: *

Disallow: /

Zapamti da se ovo oslanja na user-agent stringove i crawlere koji se pridržavaju pravila; nije to sigurna kontrola pristupa.

Related articles