Skip to content
Caută

Cum să utilizezi fișierul robots.txt pentru SEO

Un ghid practic pentru a scrie, testa și depana fișierul robots.txt astfel încât să controlezi crawling-ul fără a risca indexarea nedorită.

Cum să folosești fișierul robots.txt pentru SEO

Ce vei învăța în acest ghid

Acest articol explică ce este fișierul robots.txt, ce controlează (crawling versus indexare), cum să scrii reguli clare, exemple comune, verificări practice cu curl și DevTools, plus o listă de greșeli frecvente și cum să le eviți.

Ce este robots.txt și ce nu controlează

Fișierul robots.txt este un fișier plasat în directorul rădăcină al unui site (de exemplu http://www.yoursite.com/robots.txt) care transmite indicații către crawleri despre ce pot sau nu pot solicita. Este o metodă pentru a controla crawling-ul — adică ce URL-uri sunt accesate de roboți. Nu confunda crawling-ul cu indexarea sau cu clasarea: blocking prin robots.txt împiedică crawlerul să descarce conținutul paginii, dar nu garantează că URL-ul nu va apărea în rezultatele de căutare (motoarele pot indexa un URL pe baza altor semnale).

Observații importante:

  • Robots.txt este un standard acceptat de mulți crawleri legitimi; roboți malițioși pot ignora regulile.
  • Este despre crawling (descărcare). Dacă vrei să previi indexarea, folosește meta tagul noindex pe pagina respectivă (dar meta noindex necesită ca pagina să poată fi crawlată).
  • Google folosește versiunea mobilă ca bază primară pentru crawling și indexare. Din iulie 2024, Google scanează site-urile pentru Search cu Googlebot Smartphone în mod implicit — păstrează în minte diferenţele între versiuni când scrii reguli.

Sintaxă de bază și exemple practice

Un fișier robots.txt este construit din blocuri pentru fiecare user-agent. Exemple simple:

Blocare completă pentru un crawler:

<pre>User-agent: BadBot
Disallow: /</pre>

Allow pentru un folder și blocare pentru un altul (pentru crawleri care respectă regulile):

<pre>User-agent: *
Disallow: /admin/
Allow: /admin/public-file.html
Sitemap: https://www.example.com/sitemap.xml</pre>

Linia Sitemap nu este obligatorie, dar îţi oferă un loc central unde crawleri pot găsi sitemapurile tale.

Multe motoare de căutare majore înțeleg caracterele wildcard '*' și simbolul '$' (sfârșitul șirului), dar comportamentul poate varia între crawleri. Testează regulile pentru crawlerele țintă înainte de a le publica.

Cum verifici și depanezi robots.txt

Pași practici pe care îi poți face chiar acum, din exteriorul site-ului:

  • Verifică conținutul public accesând http://www.yoursite.com/robots.txt în browser.
  • Folosește curl ca să vezi corpul sau doar headerele:

Pentru corp: `curl http://www.yoursite.com/robots.txt`

Pentru headere: `curl -I http://www.yoursite.com/robots.txt`

Dacă vrei să vezi ce primește un anumit user-agent, folosește flag-ul -A:

`curl -A "Googlebot" http://www.yoursite.com/robots.txt`

Pe server, verifică logurile de acces pentru a confirma că Googlebot (sau alte crawlers legitime) sunt acceptați și nu servite erori 4xx/5xx. Pentru paginile pe care le deții, folosește Google Search Console: Coverage și URL Inspection arată cum Google vede o pagină și dacă blocajele de crawling afectează indexarea.

Greșeli frecvente și cum să le eviți

Liste scurte de probleme pe care le-am întâlnit frecvent:

  • Blocarea accidentală a întregului site printr-un singur Disallow: /. Verifică întotdeauna fișierul înainte de a-l publica.
  • Folosirea exclusivă a robots.txt pentru a ascunde informații sensibile — robots.txt este public și arată adresele pe care vrei să le ascunzi; nu folosi robots.txt pentru secrete.
  • Așteptarea ca robots.txt să împiedice indexarea complet: dacă vrei ca o pagină să dispară din rezultatele Google, folosește meta noindex pe pagina respectivă şi permite accesul crawlerului, sau foloseşte instrumentele de eliminare din Search Console pentru conținutul pe care îl deții.
  • Deploy fără testare: editează mai întâi pe un staging sau pe un host secundar și testează robots.txt acolo.

Cazuri avansate și recomandări

Reguli per-user-agent: poți scrie blocuri specifice pentru Googlebot sau Bingbot. Dacă site-ul tău servește HTML diferit pe mobil și desktop, amintește-ți că Google folosește versiunea mobilă ca referinţă principală; asigură-te că regulile nu blochează resurse esențiale pe mobile (CSS/JS) care afectează randarea.

Dacă ai resurse mari (imagini, PDF-uri) pe care vrei să le ții în afara crawler-ului pentru a economisi lățime de bandă, confirmă impactul asupra indexării și UX: o pagină fără resurse poate fi indexată diferit.

Când folosești CDN-uri sau hosturi separate, verifică că robots.txt este servit de hostul corect și că nu există versiuni contradictorii la diferite domenii/subdomenii.

Checklist rapid înainte de a publica robots.txt

  • Verifică fișierul local: testează regulile pe un staging.
  • Folosește curl pentru a vedea efectiv ce servește serverul.
  • Verifică logurile serverului pentru erori la robot user-agent-ilor importanți.
  • Pe paginile pe care le deții, folosește Google Search Console pentru a urmări acoperirea și pentru a inspecta URL-urile afectate.

Resurse utile

Dacă vrei o verificare tehnică pas cu pas, Citește ghidul de Technical SEO pentru verificări adiționale.

FAQ

Ce se întâmplă dacă blochez o pagină prin robots.txt?

Blocking prin robots.txt împiedică crawlerii să descarce conținutul paginii. Totuși, URL-ul poate apărea totuși în rezultate dacă există linkuri externe sau alte semnale. Dacă vrei ca o pagină să dispară din index, folosește meta noindex şi permite accesul crawlerului sau folosește instrumentele de eliminare din Search Console pentru paginile pe care le deții.

Robots.txt poate opri Google să afișeze o versiune cache?

Google a eliminat paginile cache tradiționale la începutul anului 2024. Pentru controlul conținutului, folosește meta noindex sau instrumentele din Google Search Console.

Pot folosi robots.txt pentru a ascunde fișiere sensibile?

Nu. Robots.txt este public şi listează explicit căi pe care nu vrei ca roboţii legitimi să le acceseze. Pentru fișiere sensibile folosește autentificare, reguli server-side sau permisiuni stricte.

Cum testez dacă regulile mele blochează resurse esențiale pentru randare?

Verifică fișierul robots.txt, apoi folosește Chrome DevTools (Network/Disable cache) și un user-agent mobil pentru a vedea dacă CSS/JS sunt încărcate. Pe paginile controlate de tine, folosește URL Inspection din Google Search Console pentru a vedea cum Googlebot vede pagina.

Articole similare