Skip to content
Caută

Robots.txt: ce este și cum funcționează

Robots.txt este un fișier text plasat în directorul rădăcină al unui site care transmite instructiuni crawlerelor (user‑agents) despre ce URL‑uri pot fi accesate; afectează potențial indexarea, dar nu decide direct poziția în SERP.

Robots.txt: Ce este și cum funcționează

Ce este robots.txt?

Robots.txt (Robots Exclusion Protocol) este un fișier text, plasat la rădăcina domeniului (ex.: https://example.com/robots.txt), care conține reguli pentru crawleri: ce directoare sau fișiere pot sau nu pot fi accesate. Este o convenție standard folosită de majoritatea roboților de indexare; conținutul este public și nu oferă protecție pentru date sensibile.

De ce contează robots.txt pentru SEO?

Robots.txt controlează accesul crawlerelor la resursele site-ului, ceea ce poate influența indexarea conținutului. Distinge clar între etapele procesului: crawling (descoperire + fetch), indexare (stocare în index) și ranking (ordonarea rezultatelor). O regulă din robots.txt poate împiedica crawlingul și astfel face mai dificilă indexarea unor pagini, dar nu garantează un avantaj de poziționare — rankingul este determinat de multe semnale suplimentare.

Cum funcționează robots.txt

Serverul servește fișierul robots.txt la calea /robots.txt. Când un crawler ajunge pe site, caută mai întâi acest fișier pentru a citi regulile aplicabile user‑agent‑ului său. Regulile tipice sunt User-agent, Disallow, Allow și Sitemap. Majoritatea motoarelor respectă aceste directive, dar implementările pot varia; Google tratează robots.txt ca un set de instrucțiuni de acces, iar directivele nu sunt mecanisme pentru a ascunde conținutul de ochiul public.

Exemple de reguli simple (în fișierul /robots.txt): User-agent: * Disallow: /private/ Sitemap: https://example.com/sitemap.xml

Tipuri de directive în robots.txt

Principalele directive întâlnite:

- User-agent — definește crawlerul căruia i se aplică regulile.
- Disallow — calea (sau prefixul) pe care crawlerul nu trebuie să o acceseze.
- Allow — permite accesul pe o cale specifică (util când o cale părinte este disallowed).
- Sitemap — indică locația fișierului sitemap.
- Comentarii (#) și reguli pe grupuri de user‑agents.

Notă practică: unele directive (de ex. Crawl-delay) nu sunt respectate de toate motoarele; verifică documentația motoarelor principale. Pentru detalii oficiale vezi: https://developers.google.com/search/docs/crawling-indexing/robots/intro

Cum să începi cu robots.txt

Pași de bază: publică un fișier /robots.txt în rădăcina site-ului, validează sintaxa şi testează efectul. Evită regulile globale care blochează tot site‑ul (ex.: Disallow: /) şi nu folosi robots.txt pentru a ascunde date sensibile — folosește autentificare sau meta‑taguri noindex pentru asta.

Câteva linii utile de start: User-agent: * Disallow: /cart/ Disallow: /checkout/ Sitemap: https://example.com/sitemap.xml

Greșeli frecvente cu robots.txt

- Blocarea fişierelor CSS/JS importante, ceea ce poate împiedica motoarele să înțeleagă structura paginii.
- Disallow: / pus din greșeală, blocând întreg site‑ul.
- Folosirea robots.txt pentru a 'ascunde' conținut sensibil (fişierul e public).
- Sintaxă greșită sau encoding incorect, care face fișierul ignorabil.
- Presupunerea că un URL blocat nu poate fi indexat — motoarele pot indexa URL‑uri doar pe baza linkurilor externe fără a le parsa conținutul.

Robots.txt — verificare și depanare: checklist tehnic

**Fișier accesibil** — unde să verifici — curl https://example.com/robots.txt — trece când serverul returnează 200 și conținutul text conține regulile așteptate.

**Sintaxă corectă** — unde să verifici — citirea fișierului sau un validator online; trece când directivele sunt lizibile şi encoding‑ul e UTF‑8 fără caractere corupte.

**Blocări neintenționate** — unde să verifici — căutare în fișier pentru Disallow: / sau reguli largi; trece când doar căile intenționate sunt listate.

**Efect asupra indexării** — unde să verifici — Google Search Console URL Inspection (pentru pagini pe care le deții) arată dacă o pagină este blocată de robots.txt; trece când URL‑ul nu este marcat ca "blocked by robots.txt".

**Comportament la nivel de user‑agent** — unde să verifici — teste cu curl: curl -A "Googlebot" https://example.com/pagina și curl -A "Googlebot‑Smartphone" https://example.com/pagina; trece când serverul servește același conținut relevant pentru dispozitivele care contează. Reține: din iulie 2024 Google folosește Googlebot Smartphone ca user‑agent implicit pentru crawling în majoritatea cazurilor, deci verifică regulile împotriva acestui user‑agent.

**Instrumente utile** — curl (fetch raw), Chrome DevTools (Network/Response), Google Search Console URL Inspection (pentru domeniile pe care le deții), Bing Webmaster Tools Site Explorer (vizualizare robots.txt/blocked URLs).

Cum să verifici efectul asupra unei pagini (exemplu practic)

1) Fetch robots.txt: curl https://example.com/robots.txt
2) Verifică dacă calea paginii apare în Disallow
3) În Search Console, folosește URL Inspection pentru pagina respectivă: dacă apare "Blocked by robots.txt", atunci crawlerul nu a accesat conținutul; dacă nu deții domeniul, poți testa indexarea indirect cu operatorul site: sau vizualizarea în Bing Site Explorer.

Link util

Documentație oficială Google pentru robots.txt: https://developers.google.com/search/docs/crawling-indexing/robots/intro

Citește Technical SEO Guide

Întrebări frecvente

Unde trebuie plasat robots.txt?

La rădăcina domeniului: https://domeniu.tld/robots.txt. Crawlere caută exact acea cale; un robots.txt plasat în subdirectoare nu va fi citit pentru întreg site‑ul.

Pot folosi robots.txt pentru a preveni indexarea unei pagini?

Nu este recomandat. Robots.txt blochează accesul crawlerelor la conținut, dar motoarele pot încă indexa URL‑ul pe baza linkurilor externe (fără a avea conținutul paginii). Pentru a împiedica indexarea, folosește meta‑tagul <meta name="robots" content="noindex"> pe pagina respectivă sau o autentificare care necesită acces.

Cât timp durează până când modificările din robots.txt sunt aplicate?

Crawlingul reflectă modificările la următoarea vizită a crawlerului. Frecvența variază în funcție de site şi de user‑agent; paginile frecvent actualizate sunt recrawl‑uite mai des. Dacă ai nevoie de confirmare pentru o pagină pe care o deții, folosește Google Search Console URL Inspection pentru a solicita reindexare după ce ai actualizat fișierul.

Robots.txt poate conține tokeni sau reguli dinamice?

Robots.txt este un fișier static în care poți include pattern‑uri (unele servere permit wildcard). Pentru reguli dinamice pe baze de date sau per‑user, gestionează accesul la nivel de server (autentificare) sau meta‑taguri pe pagini.

SEO tehnic este doar o parte din creșterea organică. Autoritatea topicală necesită și backlinkuri de calitate; poți explora opțiuni de plasamente și parteneriate pe pagina noastră de marketplace: /marketplace

Termeni înrudiți