Robots.txt SEO: Controlează eficient crawling-ul
Afli cum funcționează robots.txt, cum să scrii reguli corecte, să verifici efectul asupra crawler-ilor și cum să eviți blocarea accidentală a paginilor importante.

Ce este robots.txt și ce nu face
Robots.txt este un fișier text simplu plasat la rădăcina unui domeniu (ex: https://example.com/robots.txt) care oferă instrucţiuni crawler-ilor conformi despre ce căi pot sau nu pot fi accesate. Este parte din Robots Exclusion Protocol (REP) şi are un rol limitat: gestionează comportamentul de crawling, nu oferă control complet asupra indexării sau ranking-ului.
Important — ce NU face robots.txt:
- Nu este un mecanism de autentificare sau protecție; resursele sensibile trebuie protejate cu autentificare la nivel de server.
- Nu garantează că o pagină nu va apărea în index: motoarele de căutare pot indexa URL-uri pe baza linking-ului chiar dacă nu au acces la conținutul paginii.
- Nu controlează direct ranking-ul; impactul este indirect, prin influențarea eficienței crawling-ului și a accesului la resurse esențiale pentru randare.
Cum funcționează tehnic
La prima accesare a unui domeniu, majoritatea crawler-ilor fac o solicitare GET la /robots.txt pentru a afla regulile. Directiva se aplică pe baza user-agent-ului care face cererea; motorul identifică secțiunea cu potrivirea cea mai specifică pentru user-agentul său.
Directive comune:
- <code>User-agent:</code> identifică crawler-ul căruia i se aplică regulile.
- <code>Disallow:</code> specifică căi pe care crawler-ul ar trebui să nu le fetch-uiască.
- <code>Allow:</code> folosit pentru a permite subcăi într-o cale blocată (util pentru controlul accesului la anumite fişiere statice).
- <code>Sitemap:</code> indică locaţia sitemap-ului XML; este acceptat de motoarele majore şi ajută la descoperire.
Note tehnice relevante:
- Potrivirea se face pe cale (path) şi este simplă — caracterele wildcard ("*") şi simbolul "$" sunt suportate de majoritatea implementărilor utile, dar comportamentul exact poate varia între crawlere.
- Google nu respectă o directivă <code>Crawl-delay</code>; alte crawlere pot respecta această directivă, dar nu te baza pe ea pentru Google.
Scrierea corectă a unui robots.txt: exemple și sintaxă
Regulile trebuie simple şi clare. Exemplul minim pentru a permite accesul tuturor crawler-ilor:
<code>User-agent: *</code>
<code>Disallow:</code> (o linie Disallow: goală înseamnă "permite tot").
Exemplu pentru un site care blochează zona de administrare dar permite un endpoint AJAX necesar pentru funcționalitate:
<code>User-agent: *</code>
<code>Disallow: /wp-admin/</code>
<code>Allow: /wp-admin/admin-ajax.php</code>
<code>Sitemap: https://example.com/sitemap.xml</code>
Dacă ai un subdomeniu care trebuie tratat diferit, amintește-ți că fiecare host are propriul /robots.txt (ex: https://sub.example.com/robots.txt).
Verificare și depanare — pași practici
Verificările trebuie făcute din exteriorul site-ului pentru a fi relevante pentru ceea ce văd crawler-ii. Următoarele pași sunt utili:
- Fetch direct fișierul robots.txt:
Comandă utilă pentru a vedea doar header-ele HTTP:
<code>curl -I https://example.com/robots.txt</code>
Pentru a vedea ce versiune returnează serverul pentru un anumit user-agent (utile dacă ai reguli dependente de user-agent):
<code>curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://example.com/robots.txt</code>
Inspectează server logs pentru solicitările către /robots.txt şi către paginile pe care le-ai blocat. Logs arată exact ce crawleri au cerut ce resurse şi ce răspuns au primit.
Pentru paginile pe care le deții folosește Google Search Console URL Inspection pentru a verifica cum vede Google o anumită adresă URL (dacă este accesibilă pentru crawling, starea de indexare, erori de acces). URL Inspection este autoritativ pentru paginile din proprietatea ta.
Fă testul de acces atât pentru versiunea desktop cât şi pentru cea mobilă: Google folosește Googlebot Smartphone ca agent implicit pentru crawling și indexare, deci testează comportamentul pentru user-agent mobile.
Cazuri frecvente de verificat
- Ai blocat CSS/JS esențial pentru randare → verifică renderizarea cu Chrome DevTools Network/Elements.
- Ai Disallow: / la nivel global din greșeală → log-urile arată 403/200 pentru pagini dar lipsa crawl-urilor confirmă problema.
Greșeli comune și cum să le eviți
Blocarea resurselor necesare pentru randare: mulți dezvoltatori blochează foldere cu CSS, JS sau imagini pentru a conserva crawl budget. Efectul poate fi ca Google să nu poată renderiza corect pagina, ceea ce afectează capacitatea sa de a evalua conținutul.
- Folosirea robots.txt pentru a "ascunde" conținut — robots.txt nu oferă confidențialitate; folosește autentificare sau noindex pe paginile pe care vrei să nu apară în index.
- Conflicte cu canonicalizarea: dacă blochezi versiuni ale paginilor dar permiți versiunea canon, clarifică ce vrei ca motoarele să indexeze; robots.txt nu rescrie canonicalele.
- Dependentă de wildcard-uri neînțelese: testează expresiile cu crawlerii principali; comportamentul poate varia.
Bune practici pentru SEO tehnic
- Păstrează fişierul curat şi comentariile scurte. Un fișier bine organizat reduce riscul de eroare umană.
- Folosește <code>Allow</code> pentru a permite fişiere statice necesare randării chiar dacă o cale de bază este blocată.
- Include directiva <code>Sitemap:</code> pentru a facilita descoperirea URL-urilor importante.
- Testare după fiecare modificare: folosește curl, logs şi URL Inspection pentru paginile tale.
- Documentează de ce blochezi anumite directoare, astfel încât echipa de dezvoltare sau conținut să nu inverseze modificările din greșeală.
Aspecte de compatibilitate cu ecosistemul de căutare (2026)
Până în 2026, crawling şi indexarea au rămas procese distincte: Google foloseşte versiunea mobilă ca bază pentru crawling şi indexare (Googlebot Smartphone este agentul implicit de crawl pentru Search). O pagină blocată de robots.txt înainte de a fi fetch-uită de Google nu va putea fi evaluată complet pentru indexare sau pentru secțiuni generate de AI din rezultate (AI Overviews), deoarece motoarele nu pot citi conținutul blocat.
Checklist rapid înainte de deploy
- Verifică sintaxa fişierului (linia de start la https://{domeniu}/robots.txt).
- Testează cu curl şi cu user-agent-ul Googlebot/Googlebot Smartphone.
- Verifică server logs pentru a confirma comportamentul crawler-ilor.
- Asigură-te că resursele necesare pentru randare nu sunt blocate.
FAQ
Pot folosi robots.txt pentru a împiedica indexarea unei pagini?
Nu în mod direct. Robots.txt împiedică crawling-ul, dar motoarele pot totuși să indexeze un URL pe baza linkurilor externe dacă nu pot vedea conţinutul. Pentru a împiedica indexarea efectivă, foloseşte un header HTTP noindex sau o meta-etichetă <code>meta name="robots" content="noindex"</code> pe pagină — dar acestea necesită ca pagina să poată fi crawlată pentru ca motoarele să le citească. Dacă nu vrei ca ceva să fie văzut deloc, protejează-l cu autentificare la nivel de server.
Cum verific ce returnează serverul pentru un anumit user-agent?
Folosește curl cu opțiunea -A pentru a seta user-agent-ul, de exemplu: <code>curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://example.com/robots.txt</code>. Pentru header-ele doar foloseşte <code>curl -I</code>.
Am blocat fişiere CSS şi JS — ce efect poate avea asupra SEO?
Blocarea CSS/JS poate împiedica motoarele să redea corect pagina şi să înțeleagă structura şi conținutul. Acest lucru poate reduce capacitatea sistemelor de evaluare (inclusiv pentru Core Web Vitals) de a determina experiența utilizatorului. Permite accesul la resursele esenţiale de randare.
Ar trebui să folosesc <code>Crawl-delay</code>?
Nu pentru Google — Google nu respectă <code>Crawl-delay</code>. Dacă ai probleme de performanţă la server cauzate de crawleri non-Google, verifică limitările la nivel de server sau setările specifice ale acelor crawlere. Pentru Google, rezolvă prin optimizarea vitezei serverului şi prin ajustarea priorităţilor de pe sitemap şi structura site-ului.
Articole conexe

Cum să utilizezi fișierul robots.txt pentru SEO
Un ghid practic pentru a scrie, testa și depana fișierul robots.txt astfel încât să controlezi crawling-ul fără a risca indexarea nedorită.

Cele mai bune servicii de optimizare pentru motoarele de căutare (SEO)
Află ce includ serviciile SEO eficiente, cum să le verifici și ce greșeli să eviți pentru a obține vizibilitate durabilă în rezultatele de căutare.

Sfaturi SEO practice pentru îmbunătățirea clasamentului
Sfaturi practice SEO: optimizare on‑page, technical SEO, verificarea backlinkurilor și checklist pentru implementare și audit.
