Robots.txt SEO: efikasna kontrola crawlanja
Naučite kako koristiti robots.txt da bezbedno usmeravate crawlere, izbegnete greške pri indeksiranju, verifikujete ponašanje pomoću curl i logova, i primenite praktične primere na produkcijskim sajtovima.

Šta robots.txt radi — i šta ne radi
robots.txt je tekstualni fajl smešten u root direktorijumu sajta (https://example.com/robots.txt). Njegova uloga je ograničena: daje instrukcije za crawling dobro ponašajućim crawlerima. Koristite ga da smanjite nepotrebna preuzimanja na niskovrednim delovima i da poboljšate efikasnost crawlanja; ne oslanjajte se na njega da kontrolišete indeksiranje ili da sakrijete osetljiv sadržaj.
Kontroliše crawling, ne indeksiranje
Direktiva Disallow sprečava pridržavajuće se crawlere da preuzmu URL putanju. Ako je stranica blokirana za crawling, search engines i dalje mogu indeksirati njen URL na osnovu eksternih signala (na primer, linkova), ali neće videti HTML stranice niti meta robots tagove. Da biste pouzdano sprečili indeksiranje, dozvolite crawling kako bi crawler mogao pročitati meta robots noindex tag ili iskoristiti X-Robots-Tag response header sa noindex na samom resursu.
Javno, savetodavno i nije bezbednosna kontrola
Robots.txt je javno dostupan i savetodavan: bilo ko može da ga pročita na /robots.txt, a maliciozni crawleri mogu ignorisati njegove direktive. Ne navodite tajne ili privatne putanje u robots.txt; tretirajte ga kao dokument za kontrolu crawlanja, a ne kao mehanizam za kontrolu pristupa.
Osnovna sintaksa i česte direktive
Većina sajtova koristi mali skup direktiva. Specifikacija i praktična proširenja koje koriste glavni search engines podržavaju osnovne šablone, wildcards i pokazivače na sitemap. Držite pravila jednostavnim i, kad je moguće, dokumentujte nameru u komentarima.
Ključne direktive (primeri prikazani kao literalne linije):
- User-agent: <bot-name> — cilja jednog crawlera; koristite User-agent: * za sve crawlere.
- Disallow: /path/ — sprečava preuzimanje putanja ispod /path/.
- Allow: /path/file.js — eksplicitno dozvoljava putanju unutar zabranjenog roditeljskog direktorijuma (podržano od strane glavnih engines).
- Sitemap: https://example.com/sitemap.xml — upućuje crawlere na vaš XML sitemap(s).
- Wildcards: * (poklapa bilo koju sekvencu) i $ (kraj niza) su u praksi podržani od strane glavnih engines; koristite ih pažljivo za pattern-e sa query parametrima.
- Ne-standardne direktive: Crawl-delay i Host su prepoznate od strane nekih crawlера ali nisu deo originalnog standarda — testirajte ponašanje za user-agente koji su vam bitni.
Kako robots.txt utiče na indexing i ranking
Odvojite crawling, indexing i ranking: robots.txt utiče na fazu crawlinga (da li crawler preuzima URL). Indexing zahteva da crawler pročita sadržaj stranice ili meta/X-Robots-Tag. Ranking je naknadni proces koji se oslanja na signale, od kojih neki dolaze iz sadržaja stranice; ako crawler ne može da preuzme stranicu, ti signali izvedeni iz sadržaja nisu dostupni.
Praktične posledice:
- Blokiranje stranice u robots.txt znači da search engine ne može da preuzme stranicu da bi pročitao meta robots noindex tagove ili strukturirane podatke.
- Ako je važan resurs (CSS/JS) blokiran, mobile-first indexing i rendering može pogrešno prikazati stranicu; pošto Google koristi mobilnu verziju kao primarnu osnovu za crawling and indexing, i pošto je Googlebot Smartphone podrazumevani crawler od jula 2024, dozvolite resurse potrebne za rendering na mobilnom.
Verifikacija: kako testirati šta crawleri zaista vide
Proverite dostupnost i sadržaj robots.txt spolja i potvrdite kako vaš sajt odgovara na stvarne zahteve crawlера. Koristite server logove, direktna preuzimanja i Search Console alate za stranice koje posedujete.
Brze provere sa curl
Da biste dohvatili HTTP response headers za robots.txt (samo headers):
- curl -I https://example.com/robots.txt — vraća samo response headers; proverite status code i Content-Type.
Da biste preuzeli ceo fajl kao određeni user-agent (HTML i direktive):
- curl -A "Googlebot" https://example.com/robots.txt — vraća telo fajla koristeći navedeni user-agent string.
Server logovi i dokazi iz stvarnog crawlanja
Pregledajte server logove za zahteve ka /robots.txt i za crawler user-agente poput Googlebot ili Bingbot. Logovi pokazuju učestalost preuzimanja, response codes i da li su crawleri pokušali zabranjene URL-ove. Za stranice koje posedujete, koristite Search Console’s URL Inspection da vidite crawl i index signale; za stranice trećih strana, site: upit daje naznaku ali nije odlučujući.
Uobičajene greške i kako ih popraviti
Izbegavajte ove česte greške pri upravljanju robots.txt.
- Blokiranje CSS/JS potrebnog za rendering: popravke — dozvolite putanje za asset-e koje su potrebne za mobile rendering pipeline kako bi Googlebot Smartphone mogao tačno da renderuje stranice.
- Očekivanje da robots.txt postavi noindex za URL-ove: popravke — uklonite Disallow za tu stranicu i koristite meta robots noindex ili X-Robots-Tag header tako da search engines mogu da vide instrukciju.
- Navođenje osetljivih URL-ova u robots.txt: popravke — ne izlažite privatne putanje u robots.txt; zaštitite ih autentifikacijom i odgovarajućim server-side kontrolama pristupa.
- Previše složena wildcard pravila koja nenamerno poklapaju validne stranice: popravke — testirajte svaki pattern sa uzorcima URL-ova i dokumentujte nameru u komentarima, držeći pravila što specifičnijim.
Preporučene robots.txt strategije
Usvojite konzervativan, testabilan pristup: držite robots.txt minimalnim, usmerite crawlere na sitemaps i preferirajte kontrolu indeksiranja na nivou stranice putem meta/X-Robots-Tag.
Praktični obrasci:
- Podrazumevano dozvoljavanje plus sitemap: uključite User-agent: * i Sitemap direktivu kako bi crawleri brzo otkrili vašu strukturu.
- Blokirajte query stranice niske vrednosti ili interne rezultate pretrage, ali izbegavajte blokiranje pattern-a parametara koji takođe odgovaraju kanonskom sadržaju; preferirajte upravljanje parametrima u vašem sitemap-u ili putem canonical tagova.
- Staging ili development: blokirajte crawlere dok je staging javan, ali uklonite ili promenite blok pre lansiranja; ne oslanjajte se na robots.txt kao jedino rešenje za pre-produkcione asset-e.
Primeri koje možete prilagoditi
Jednostavan sajt sa sitemap-om
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Uobičajeni CMS (dozvoli admin-ajax)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
Staging blok (javni server ali još nije live)
User-agent: *
Disallow: /
Upozorenje: staging blokovi moraju biti uklonjeni pre lansiranja; takođe osigurajte staging autentifikacijom kako search engines i treće strane ne bi slučajno indeksirali sadržaj ako se robots fajl promeni.
Održavanje robots.txt na velikoj skali
Za velike sajtove tretirajte robots.txt kao konfiguracioni artefakt: držite ga u source control-u, pregledajte promene u pull request-ovima i deploy-ujte zajedno sa sajtom tako da staging i production imaju ispravne fajlove specifične za okruženje. Automatizujte testove koji dohvataju deploy-ovani robots.txt i validiraju sintaksu pravila na reprezentativnim URL-ovima.
Ako operišete više subdomena, zapamtite da je robots.txt specifičan za host: pravila na example.com/robots.txt ne važe za sub.example.com.
FAQ
Može li robots.txt sprečiti da se stranica pojavi u search results?
Ne pouzdano. Robots.txt može sprečiti crawlera da preuzme stranicu, ali search engines i dalje mogu indeksirati URL na osnovu eksternih linkova ili drugih signala. Da biste sprečili indeksiranje, dozvolite crawling i koristite meta robots noindex tag na stranici ili X-Robots-Tag: noindex response header kako bi crawler mogao pročitati instrukciju.
Kako da proverite da li Google poštuje moj robots.txt?
Iz spoljašnjosti, dohvatite https://example.com/robots.txt sa curl-om da potvrdite fajl i status codes, pregledajte server logove za Googlebot zahteve prema fajlu i prema stranicama koje očekujete da budu crawlovane, i koristite Search Console’s URL Inspection za stranice koje posedujete da vidite pokušaje crawlanja i status indeksa. site: upit može dati javnu naznaku ali nije definitivno.
Da li treba da blokiram URL parametre u robots.txt?
Budite oprezni. Blokiranje parametrizovanih URL-ova može uštedeti crawl budget ali rizikuje sakrivanje kanonizovanog ili indeksiranog sadržaja ako su pattern-i preširoki. Preferirajte canonical tagove, upravljanje parametrima u sitemap-ovima ili server-side redirect-e gde je prikladno; testirajte svaki pattern temeljno pre deploy-ja.
Da li je Crawl-delay bezbedno oslanjati se na njega?
Crawl-delay je ne-standardna direktiva i njena podrška varira po crawlerima. Za sajtove kojima je potrebna kontrola brzine crawlanja, preferirajte server-side rate limiting, robots meta tags za selektivne stranice, ili crawler-specific podešavanja dostupna u servisima kao što su Bing Webmaster Tools. Uvek testirajte ponašanje za specifične user-agente koje ciljate.
Related articles

Kako koristiti robots.txt za SEO
Saznajte šta robots.txt kontroliše, kako napisati ispravna pravila, verifikovati ponašanje pomoću curl i DevTools, i izbeći uobičajene SEO greške.

Najbolje SEO usluge
Saznajte šta angažman pune SEO usluge treba da obuhvati, kako proveriti provajdere, tehničke provere i bezbedne prakse za linkove.

Praktični SEO saveti za bolje rangiranje
Praktične, evergreen SEO strategije: ključne reči, on-page osnove, tehničke popravke, link-building smernice i koraci verifikacije koje možete primeniti danas.
