Skip to content
Tražite

Robots.txt: što je i kako radi

robots.txt je plain-text datoteka smještena u korijenu web-mjesta koja deklarira pravila crawlanja za web crawlere (User-agent, Disallow, Allow, Sitemap). Kontrolira ponašanje crawlanja i može posredno utjecati na indeksiranje, ali ne izravno na ranking.

Robots.txt: What It Is and How It Works

Što je robots.txt?

robots.txt (Robots Exclusion Protocol) je plain-text datoteka smještena u korijenu hosta — npr. https://example.com/robots.txt — koja daje jednostavne instrukcije za crawl user-agents (web crawlers). Javni je i strojno čitljiv; ne služi za autentikaciju niti skrivanje sadržaja. Crawleri čitaju robots.txt da bi saznali koje putanje vlasnik stranice preferira da izbjegnu ili prioritiziraju.

Zašto je robots.txt važan za SEO

Robots.txt kontrolira crawling. Crawling je faza otkrivanja i dohvaćanja u kojoj tražilice komuniciraju s tvojom stranicom; ako je crawler blokiran da dohvaća URL, možda neće vidjeti on-page direktive (kao meta robots) ili sadržaj stranice potreban za indeksiranje. To znači da robots.txt može neizravno utjecati na indeksiranje. Ne postavlja izravno redoslijed u ranking-u — ranking se određuje nizom signala nakon indeksiranja. Koristi robots.txt za zaštitu server resursa, izbjegavanje crawlanja dupliciranih ili internih alatnih stranica i osiguraj da crawleri imaju pristup resursima potrebnim za korektno renderiranje.

Kako robots.txt radi

Crawler dohvaća /robots.txt prije nego što zatraži druge stranice na istom hostu i primjenjuje prvo odgovarajuće User-agent stanzu i njezine direktive. Uobičajene direktive koje većina glavnih crawl-ova podržava uključuju User-agent, Disallow, Allow i Sitemap. Podrška za pattern matching i dodatne direktive varira ovisno o crawleru — Google prepoznaje obrasce poput * i $ i poštuje pravila o prioritetu Allow/Disallow prema svojoj dokumentaciji.

Tipične direktive i primjeri

Minimalan primjer robots.txt:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Bilješke: postavi robots.txt u korijen stranice. Ako robots.txt vraća HTTP 404, većina crawlera to tretira kao 'bez ograničenja'; ako se ne može dohvatiti ili vraća server greške, ponašanje crawl-ova može varirati — testiraj i nadgledaj kako bi izbjegao nenamjerno široko blokiranje. Za Google-specifično ponašanje i primjere, konzultiraj Googleovu dokumentaciju o robots.txt.

Vrste robots.txt

Različiti obrasci robots.txt koriste se ovisno o cilju. Ispod su uobičajeni pristupi s kratkim prednostima i manama.

- Site-wide block (Disallow: /)
Pros: odmah sprječava pristup crawlera cijelom hostu.
Cons: sprječava crawlere da dohvaćaju sadržaj i resurse; može zaustaviti indeksiranje javnih stranica.

- Path-specific rules (Disallow: /private/)
Pros: lako isključiti interne ili admin putanje.
Cons: robots.txt je javan; nemoj navoditi osjetljive putanje koje očekuješ držati tajnima.

- User-agent specific rules (User-agent: Googlebot)
Pros: prilagodi ponašanje za specifične crawlere.
Cons: veće održavanje; neki crawleri ignoriraju nestandardne direktive.

Kako početi s robots.txt

1) Odluči što treba zaštititi od crawlanja (server-intenzivne sekcije, staging putanje) i što mora ostati dostupno crawlerima (javne stranice, CSS/JS potrebni za renderiranje).
2) Kreiraj plain-text datoteku naziva robots.txt u korijenu sajta. Testiraj lokalno i na staging hostu prije deploya u produkciju.
3) Deployaj i verificiraj koristeći tehničku kontrolnu listu niže. Drži datoteku jednostavnom i dokumentiraj bilo koja pravila specifična za User-agent, kako bi budući održavatelji razumjeli namjeru.

Uobičajene pogreške s robots.txt

• Oslanjanje na robots.txt da bi se sakrili osjetljivi podaci — robots.txt je javan i ne služi za sigurnost. Koristi autentikaciju ili ukloni resurs.
• Blokiranje CSS/JS potrebnih za renderiranje — to može narušiti kako tražilice razumiju raspored i sadržaj stranice.
• Blokiranje stranica koje sadrže meta noindex — ako Googlebot ne može dohvatiti stranicu, neće vidjeti meta noindex direktivu.
• Postavljanje robots.txt u podputanju (npr. /blog/robots.txt) — crawleri traže samo datoteku na root razini.
• Sintaksne greške i pogrešni HTTP status kodovi — osiguraj da se datoteka poslužuje s odgovarajućim HTTP 200 odgovorom.

Verifikacija robots.txt: tehnička kontrolna lista

Koristi provjere niže nakon deploya ili ažuriranja robots.txt. Svaka stavka navodi gdje verificirati i jasan uvjet prolaska.

**File reachable** — mjesto provjere: curl -I https://example.com/robots.txt — prolaz je kada zahtjev vrati HTTP 200 i datoteka sadrži očekivani sadržaj.
**Correct directives** — mjesto provjere: curl https://example.com/robots.txt ili view-source u pregledniku — prolaz je kada se linije User-agent/Disallow/Allow podudaraju s politikom.
**Not blocking rendering assets** — mjesto provjere: Chrome DevTools Network and Coverage ili dohvat putem crawler simulatora — prolaz je kada CSS/JS potrebni za renderiranje nisu zabranjeni.
**Google-block check (own site)** — mjesto provjere: Google Search Console URL Inspection — prolaz je kada Inspection pokaže da je URL crawlable i nije "Blocked by robots.txt".
**External crawl check** — mjesto provjere: koristi curl ili third-party crawler da zatraži blokirani URL i potvrdi da stranica vraća 200, ali crawleru je pristup odbijen — prolaz je kada ponašanje odgovara očekivanjima.
**Sitemap presence** — mjesto provjere: sadržaj robots.txt i Google Search Console Sitemaps izvještaj — prolaz je kada je URL sitemap naveden u robots.txt ili poslan u Search Console i prihvaćen.

Alati i naredbe za provjeru robots.txt

curl (headers only): curl -I https://example.com/robots.txt — vraća HTTP status i response headers. curl (full file): curl https://example.com/robots.txt — ispisuje sadržaj za inspekciju. Chrome DevTools: otvori URL datoteke ili pogledaj network zahtjeve stranice da potvrdiš da su asseti dozvoljeni. Google Search Console URL Inspection: za URL koji posjeduješ, alat izvještava vidi li Google stranicu i je li bila blokirana robots.txt.Bing Webmaster Tools Site Explorer može pokazati kako je Bing obradio datoteku za sajtove koje verificiraš. Koristi server logove da potvrdiš koji su user-agents tražili robots.txt i koliko često.

Za autoritativne detalje o podržanim direktivama i pravilima prioriteta, konzultiraj službenu dokumentaciju na https://developers.google.com/search/docs/advanced/robots/intro

Pročitaj Technical SEO Guide

Često postavljana pitanja

Q: Ako blokiram stranicu s robots.txt, hoće li nestati iz rezultata pretraživanja?
A: Blokiranje preko robots.txt sprječava crawlere da dohvaćaju stranicu, što obično sprječava da vide on-page signale. Blokirana stranica i dalje se može pojaviti u rezultatima na temelju vanjskih signala (unos samo URL-a), ali neće imati cacheirani isječak ili renderirani sadržaj. Za zahtjev za uklanjanje koristi alate za uklanjanje indeksa za URL-ove koje posjeduješ; za kontrolu indeksiranja putem meta podataka, osiguraj da je stranica crawlable kako bi crawleri vidjeli meta robots:noindex direktivu.

Q: Mogu li koristiti robots.txt za blokiranje specifičnih botova?
A: Možeš dodati User-agent-specifične stanze kako bi ciljao poznate crawlere. Međutim, robots.txt je sustav povjerenja: dobro ponašajući crawleri ga poštuju, zlonamjerni botovi ga mogu ignorirati. Za snažniju zaštitu koristi autentikaciju, IP filtriranje ili firewall.

Q: Trebam li uključiti svoj sitemap u robots.txt?
A: Uključivanje Sitemap: https://example.com/sitemap.xml u robots.txt je zgodan način da uputiš crawlere na svoj sitemap; također pošalji sitemape izravno u Google Search Console za sajtove kojima upravljaš.

Q: Primjenjuje li se robots.txt po protokolu i hostu?
A: Da. robots.txt se dohvaća po hostu i protokolu: https://example.com/robots.txt je odvojen od http://example.com/robots.txt ili https://sub.example.com/robots.txt. Postavi datoteku na istu shemu i host koji koristi tvoja stranica.

Q: Kako mobile-first indexing utječe na robots.txt?
A: Google koristi mobilnu verziju kao svoju primarnu osnovu za crawling and indexing. Od srpnja 2024. Google za Search pretraživanje zadano koristi Googlebot Smartphone. Osiguraj da robots.txt nenamjerno ne blokira resurse na mobilnim verzijama stranica koji su potrebni za korektno renderiranje i indeksiranje.

Q: Gdje mogu pronaći službene smjernice?
A: Pogledaj Googleovu dokumentaciju o robots.txt na https://developers.google.com/search/docs/advanced/robots/intro i izvore Schema.org i W3C za povezane prakse crawlanja i indeksiranja.

Izgradi autoritet s kvalitetnim backlinks

Povezani pojmovi