Skip to content
Pretraga

robots.txt: šta je i kako funkcioniše

robots.txt je plain-text fajl smešten u root direktorijumu sajta koji definiše pravila za web crawlere (User-agent, Disallow, Allow, Sitemap). Kontroliše ponašanje crawlanja i može indirektno uticati na indexaciju, ali ne postavlja rangiranje direktno.

Robots.txt: What It Is and How It Works

Šta je robots.txt?

robots.txt (Robots Exclusion Protocol) je plain-text fajl koji se nalazi u root-u hosta — npr. https://example.com/robots.txt — i daje jednostavne instrukcije za user-agente (web crawlere). Javan je i mašinski čitljiv; ne služi za autentifikaciju niti za skrivanje sadržaja. Crawleri čitaju robots.txt da bi saznali koje putanje vlasnik sajta predlaže da izbegnu ili kojima daje prioritet.

Zašto je robots.txt važan za SEO

robots.txt kontroliše crawling. Crawling je faza otkrivanja i preuzimanja kako sepretraživači povezuju sa vašim sajtom; ako jecrawler blokiran da preuzme URL, možda neće videti on-page direktive (kao meta robots) ili sadržaj stranice potreban za indexaciju. To znači da robots.txt može indirektno uticati na indexaciju. Ne postavlja direktno redosled rangiranja — rangiranje koristi mnoge signale nakon indexiranja. Koristite robots.txt da zaštitite resurse servera, izbegnete crawlanje dupliciranih ili internih alata i obezbedite pristup crawlerima do asseta potrebnih za pravilno renderovanje.

Kako robots.txt funkcioniše

Crawler preuzima /robots.txt pre nego što zatraži druge strane na istom hostu i primenjuje prvu poklapajuću User-agent stanzu i njene direktive. Uobičajene direktive koje podržavaju glavni crawleri uključuju User-agent, Disallow, Allow i Sitemap. Podrška za pattern matching i dodatne direktive varira po crawlerima — Google prepoznaje obrasce kao što su * i $ i poštuje pravila prioriteta Allow/Disallow prema svojoj dokumentaciji.

Tipične direktive i primeri

Minimalan primer robots.txt:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Napomene: stavite robots.txt u root sajta. Ako robots.txt vraća HTTP 404, većina crawler-a to tretira kao 'nema ograničenja'; ako se ne može dohvatiti ili vraća greške servera, ponašanje crawler-a može varirati — testirajte i nadgledajte da izbegnete slučajno široko blokiranje. Za Google-specifično ponašanje i primere konsultujte Google's robots.txt dokumentaciju.

Tipovi robots.txt

Različiti obrasci robots.txt koriste se u zavisnosti od cilja. Ispod su uobičajeni pristupi sa sažetim prednostima i manama.

- Potpuna blokada sajta (Disallow: /)
Prednosti: odmah sprečava pristup crawlerima celom hostu.
Nedostaci: sprečava crawlere da preuzimaju sadržaj i assete; može zaustaviti indexaciju javnih stranica.

- Pravila po putanji (Disallow: /private/)
Prednosti: lako isključiti interne ili admin putanje.
Nedostaci: robots.txt je javan; ne navodite osetljive putanje koje očekujete da ostanu skrivene.

- Pravila za određene User-agent (User-agent: Googlebot)
Prednosti: prilagodite ponašanje za određene crawlere.
Nedostaci: povećano održavanje; neki crawleri ignorišu nestandardne direktive.

Kako početi sa robots.txt

1) Odlučite šta treba zaštititi od crawlanja (delovi koji opterećuju server, staging putanje) i šta mora ostati dostupno crawlerima (javne stranice, CSS/JS potrebni za rendering).
2) Napravite plain-text fajl nazvan robots.txt u root direktorijumu sajta. Testirajte lokalno i na staging hostu pre objave u produkciju.
3) Objavite i verifikujte koristeći tehničku kontrolnu listu ispod. Održavajte fajl jednostavnim i dokumentujte pravila specifična za User-agent tako da budući održavaoci razumeju nameru.

Uobičajene greške sa robots.txt

• Oslanjanje na robots.txt da biste sakrili osetljive podatke — robots.txt je javan i ne bi trebalo da se koristi za bezbednost. Koristite autentifikaciju ili uklonite resurs.
• Blokiranje CSS/JS potrebnih za rendering — to može narušiti kako pretraživači razumeju raspored i sadržaj stranice.
• Blokiranje stranica koje sadrže meta noindex — ako je Googlebot blokiran da preuzme stranicu, neće videti meta noindex direktivu.
• Postavljanje robots.txt pod podputanju (npr. /blog/robots.txt) — crawleri traže samo fajl na root nivou.
• Sintaksne greške i pogrešni HTTP status kodovi — osigurajte da se fajl servira sa odgovarajućim HTTP 200 odgovorom.

Verifikacija robots.txt: tehnička kontrolna lista

Koristite provere ispod nakon objave ili ažuriranja robots.txt. Svaka stavka navodi gde proveriti i jasan uslov za prolaz.

**Fajl dostupan** — gde proveriti: curl -I https://example.com/robots.txt — prolazi kada zahtev vrati HTTP 200 i fajl je očekivanog sadržaja.
**Ispravne direktive** — gde proveriti: curl https://example.com/robots.txt ili view-source u browseru — prolazi kada linije User-agent/Disallow/Allow odgovaraju vašoj politici.
**Ne blokiranje rendering asseta** — gde proveriti: Chrome DevTools Network i Coverage ili preuzimanje preko crawler simulatora — prolazi kada CSS/JS potrebni za rendering nisu disallowed.
**Google-block check (sajt koji posedujete)** — gde proveriti: Google Search Console URL Inspection — prolazi kada Inspection pokaže da je URL crawlable i nije "Blocked by robots.txt".
**External crawl check** — gde proveriti: koristite curl ili third-party crawler da zatražite blokirani URL i potvrdite da stranica vraća 200 ali crawleru je odbijen pristup — prolazi kada ponašanje odgovara očekivanjima.
**Sitemap presence** — gde proveriti: sadržaj robots.txt i Google Search Console Sitemaps izveštaj — prolazi kada je sitemap URL naveden u robots.txt ili podnet u Search Console i prihvaćen.

Alati i komande za verifikaciju robots.txt

curl (samo headeri): curl -I https://example.com/robots.txt — vraća HTTP status i response header-e. curl (potpun fajl): curl https://example.com/robots.txt — ispisuje sadržaj za inspekciju. Chrome DevTools: otvorite URL fajla ili pogledajte network requests stranice da potvrdite da su asseti dozvoljeni. Google Search Console URL Inspection: za URL koji posedujete, alat prikazuje da li Google vidi stranicu i da li je bila blokirana od strane robots.txt. Bing Webmaster Tools Site Explorer može prikazati kako je Bing obradio fajl za sajtove koje verifikujete. Koristite server logove da potvrdite koji user-agenti su zahtevali robots.txt i koliko često.

Za autoritativne detalje o podržanim direktivama i prioritetima, konsultujte zvaničnu dokumentaciju na https://developers.google.com/search/docs/advanced/robots/intro

Pročitajte Technical SEO Guide

Često postavljana pitanja

P: Ako blokiram stranicu robots.txt, hoće li nestati iz rezultata pretrage?
O: Blokiranje preko robots.txt sprečava crawlere da preuzmu stranicu, što obično onemogućava da vide on-page signale. Blokirana stranica još uvek može da se pojavi u rezultatima pretrage na osnovu eksternih signala (samo URL), ali neće imati keširani isječak ili renderovan sadržaj. Za zahtev za uklanjanje koristite alate za uklanjanje indeksa za URL-ove koje posedujete; za kontrolu indeksiranja putem metadata, osigurajte da je stranica crawlable kako bi crawleri mogli da vide meta robots:noindex direktivu.

P: Mogu li koristiti robots.txt da blokiram određene botove?
O: Možete dodati stanzas specifične za User-agent da ciljaju poznate crawlere. Međutim, robots.txt je sistem zasnovan na poštovanju: pristojni crawleri ga poštuju, zlonamerni botovi ga mogu ignorisati. Za snažniju zaštitu koristite autentifikaciju, IP filtriranje ili firewall.

P: Treba li uključiti sitemap u robots.txt?
O: Uključivanje Sitemap: https://example.com/sitemap.xml u robots.txt je zgodan način da ukažete crawlerima na vaš sitemap; takođe podnesite sitemape direktno u Google Search Console za sajtove kojima upravljate.

P: Da li robots.txt važi po protokolu i hostu?
O: Da. robots.txt se preuzima po hostu i protokolu: https://example.com/robots.txt je odvojen od http://example.com/robots.txt ili https://sub.example.com/robots.txt. Postavite fajl na istu scheme i host koji koristi vaš sajt.

P: Kako mobile-first indexing utiče na robots.txt?
O: Google koristi mobilnu verziju kao primarnu osnovu za crawling and indexing. Od July 2024, Google po default-u crawla sajtove za Search koristeći Googlebot Smartphone. Osigurajte da robots.txt slučajno ne blokira resurse na mobilnim verzijama koje su potrebne za pravilno renderovanje i indexiranje.

P: Gde mogu naći zvanične smernice?
O: Pogledajte Google's robots.txt dokumentaciju na https://developers.google.com/search/docs/advanced/robots/intro i resurse Schema.org i W3C za povezane prakse crawlanja i indexiranja.

Izgradite autoritet kvalitetnim backlinkovima

Povezani termini