Skip to content

Cum să utilizezi fișierul Robots.txt pentru SEO

Învață să folosești robots.txt pentru SEO. Controlează crawling-ul, îmbunătățește indexarea și protejează paginile private cu o configurare corectă.

How to Use Robots.txt File for SEO

Știai că Robots.txt este unul dintre elementele cheie în SEO-ul site-ului tău? Ce este mai exact Robots.txt și cum îl vei folosi pentru SEO? Vom explica totul în această postare.

Ce este Robots.txt?

Există fișiere în directorul rădăcină al unui site web care le spun motoarelor de căutare crawler-ilor și spider-ilor ce pagini și fișiere ar trebui să vadă și pe care nu. Administratorii web doresc adesea ca site-urile lor să fie găsite de motoarele de căutare, dar există momente când acest lucru nu este necesar. Dacă păstrezi informații private sau încerci să economisești spațiu, poți împiedica motorul de căutare să-ți indexeze fișierele (excluzând paginile grele cu imagini).

Standardul de excludere a roboților, cunoscut și sub denumirea de protocolul de excludere a roboților sau pur și simplu robots.txt, este un standard utilizat de site-uri webpentru a comunica cu web crawlers și alți web robots.

Roboții sunt adesea utilizați de motoarele de căutare pentru a clasifica site-urile web. Nu toți roboții cooperează cu standardul; colectoarele de e-mailuri, spambots, malware și roboții care scanează vulnerabilități de securitate pot chiar începe cu porțiunile site-ului web unde li s-a spus să nu intre. Standardul poate fi utilizat împreună cu Sitemaps, un standard de includere a roboților pentru site-uri web. – Wikipedia

Motoarele de căutare care utilizează keywords și metadate pentru a indexa paginile web afișează cele mai relevante rezultate persoanelor care caută ceva pe Internet. Este mai important pentru proprietarii de magazine online să obțină rezultate bune în motoarele de căutare decât pentru orice altă afacere. De obicei, oamenii nu trec de primele câteva pagini de rezultate din sugestiile unui motor de căutare.

Indexarea se face cu ajutorul spider-ilor sau crawler-ilor, care se deplasează. Așa obțin și organizează motoarele de căutare toate informațiile de pe Internet. Aceste companii utilizează acești boți.

How to Use Robots.txt File for SEO

robots.txt este fișierul pe care crawler-ii îl caută atunci când vizitează un site web pentru prima dată. De îndată ce crawler-ul găsește un astfel de fișier, va căuta în el instrucțiuni despre cum să indexeze site-ul. Nu există instrucțiuni pentru botul care nu le poate găsi, așa că utilizează algoritmul său de operare pentru a le căuta. Acest lucru determină multe persoane să caute lucruri pe site-ul web, dar face și procesul de indexare mai puțin eficient.

Pentru ca fișierul robots.txt să funcționeze, poate exista doar unul pe site. Un nume de domeniu suplimentar trebuie să aibă un fișier robots.txt la rădăcina paginii sale web. De exemplu, ar trebui să fie la https://www.domain.com/robots.txt și ar trebui să le spună roboților să nu acceseze acel site.

Robots.txt este, de asemenea, important pentru a te asigura că numele fișierului tău este robots.txt. Dacă numele nu este scris corect, nu va funcționa.

Preia controlul

Ai mai mult control asupra SEO-ului site-ului tău decât crezi.

În general, acest lucru este adevărat. Poți alege ce crawlers și indexatori pot vedea și indexa site-ul tău la nivel de pagină. Există un fișier numit robots.txt care poate fi utilizat pentru a te asigura că acest lucru nu se mai întâmplă. Există un fișier text simplu numit robots.txt în directorul rădăcină al site-ului tău web. Acest fișier le spune roboților web să nu-ți citească site-ul. Roboții pot utiliza aceste informații pentru a îmbunătăți rezultatele căutărilor pentru a fi mai specifici.

Deși nu este soluția supremă, ai descoperit că este o modalitate excelentă de a-ți face site-ul vizibil pentru motoarele de căutare. Dacă vrei să faci motoarele de căutare să-ți placă site-ul, trebuie să faci o primă impresie bună. Utilizarea robots.txt, în mod corect, poate ajuta la SEO.

Deci, cum procedezi? Care este scopul acestui fișier? Ce nu ar trebui să faci niciodată? Răspunsurile la aceste întrebări sunt pe pagina următoare.

Motivul pentru a utiliza Robots.txt

Robots.txt este un fișier pe care motoarele de căutare îl utilizează pentru a-și da seama ce pagini de pe site-ul tău să indexeze și pe care să le țină în afara rezultatelor căutării. De exemplu, dacă specifici în fișierul Robots.txt că pagina ta de mulțumire nu ar trebui să fie disponibilă pentru motoarele de căutare, această pagină nu va apărea în rezultatele căutării și nu va fi accesibilă persoanelor care o caută pe web. Unele pagini ale site-ului tău trebuie ascunse de motoarele de căutare atât pentru confidențialitate, cât și pentru ranking-ul. Acest lucru este important pentru ambele.

Unde să-ți localizezi fișierul Robots?

Get in control

Dacă ai un site web, fișierul robots.txt se află în directorul rădăcină al site-ului tău. Intră în cPanel-ul tău FTP și caută-l în zona publică de HTML a contului tău. Aceste fișiere nu ocupă mult spațiu. Ar putea avea doar câteva sute de octeți. Dacă nu găsești unul, va trebui să-l creezi.

Cum funcționează Robots.txt

Atunci când motoarele de căutare doresc să-ți indexeze site-ul, trimit programe mici numite „spiders” sau „roboți” care parcurg site-ul tău și returnează date motoarelor de căutare. Directivele „Disallow” din Robots.txt instruiesc motoarele de căutare și alte programe să nu caute anumite pagini de pe site-ul tău pe care le specifici în comandă. Următoarele comenzi pot fi găsite în fișierul robots.txt:

va împiedica toți roboții motoarelor de căutare să acceseze următoarea pagină de pe site-ul tău: http://www.yoursite.com/thankyou

Înainte de comanda disallow este comanda: „User-agent: * “. Partea User-agent identifică robotul pe care dorești să-l interzici.

„User-agent: Googlebot”. Această comandă ar împiedica doar roboții Google să acceseze site-ul web; alții ar putea totuși să-l acceseze: http://www.yoursite.com/thankyou

Totuși, utilizând caracterul „*”, specifici că comenzile de mai jos se referă la toți roboții. Fișierul tău robots.txt ar fi localizat în directorul principal al site-ului tău. De exemplu: http://www.yoursite.com/robots.txt

Cum să creezi un fișier Robots.txt

How to Put Together a Robots.txt File

Oricine poate crea acest fișier text simplu. Ai nevoie de un editor de text precum Notepad pentru a-ți scrie textul. Deschide un fișier text nou și salvează-l ca „robots.txt”, apoi tastează în el. Când ești în cPanel-ul tău, mergi la folderul public de HTML și dă click pe el. Începe prin a te asigura că fișierul există deja.

Dacă totul arată bine, ai terminat. Doar persoana care deține fișierul ar trebui să-l poată vedea și modifica. Pentru ca fișierul să funcționeze, trebuie să aibă permisiunea „0644”.

Dacă nu, dă click dreapta pe fișier și alege „schimbă permisiunile”. Asta e! Există un fișier numit robots.txt care conține instrucțiuni pentru roboți. Sintaxa Robots.txt. Fișierul robots.txt are mai multe secțiuni de „directive” pentru fiecare user agent care a fost configurat. Fiecare începe cu numele user agent-ului. Fiecare bot de crawling este identificat prin ID-ul său de user agent conform codului.

Există două moduri de a face acest lucru: Atâta timp cât utilizezi un wildcard, poți viza toate motoarele de căutare simultan. Poți alege ce motoare de căutare vrei să vizezi. Când pornești un bot de crawling, acesta va merge în părțile site-ului web care sunt cel mai puțin „fericite” în legătură cu asta. Va merge așa:

Directiva User-Agent

Primele câteva rânduri ale fiecărui bloc includ user-agent-ul, care identifică un bot. Deci, de exemplu: dacă vrei să-i spui unui Googlebot ce să facă, ai începe cu:

User-agent: Googlebot De regulă, motoarele de căutare caută cele mai relevante informații.

Atâta timp cât ai o directivă Googlebot-Video și una Bingbot. User agent-ul „Bingbot” va acționa conform instrucțiunilor. Te poți aștepta la instrucțiuni mai precise de la Googlebot-Video.

Mai jos sunt listați cei mai utilizați roboți de motoare de căutare.

Directiva Disallow

Boții nu vor putea accesa anumite porțiuni ale site-ului tău dacă activezi această funcție. Nimic nu împiedică boții să navigheze pe Internet și să acceseze orice site-uri doresc.

Directiva Sitemap (Sitemaps XML)

Acest meta tag le spune motoarelor de căutare unde se află sitemap-ul tău. Trebuie să le trimiți către Google Search Console pentru a fi găsite. Ar fi util să utilizezi fiecare dintre aceste instrumente, deoarece te pot învăța multe despre site-ul tău web.

Când viteza este importantă, utilizează directiva numită „sitemap”.

Directiva Crawl-Delay

Dacă vrei să încetinești puțin Yahoo, Bing și Yandex atunci când fac crawling, poți introduce o directivă numită „crawl-delay”. Următoarele se vor întâmpla când vei introduce această linie în blocul tău:

Crawl-Delay:10 Așteaptă zece secunde înainte de crawling.

Când un motor de căutare este configurat, poate fi setat să aștepte zece secunde înainte de a face crawling pe un site sau zece secunde înainte de a reveni la un site după un crawl. Efectul este aproape același, dar ușor diferit în funcție de motorul de căutare utilizat. După un crawl, un Crawl-delay de 1 înseamnă că motoarele de căutare vor începe să facă crawling pe site imediat.

Utilizarea Google Search Console pentru a crea Robots.txt

Selectează „crawler acces” din bara de meniu pentru a crea rapid un fișier robots.txt cu un cont gratuit Google Search Console. Pentru a crea un fișier Robots.txt de bază, alege „generează robots.txt” când ajungi pe site.

Sub „acțiune”, alege „blochează”, iar sub „User-agent”, alege roboții pe care nu vrei să-i vezi pe site-ul tău. Alege „directoare și fișiere” și tastează numele folderelor pe care vrei să le ții la distanță. „http://www.yoursite.com” nu ar trebui să facă parte din această strategie sub nicio formă. De exemplu, dacă nu vrei ca oamenii să poată vedea paginile de mai jos, poți:

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

În Google Search Console, introdu următoarele în câmpul „directoare și fișiere”:/thank-you

  • /free-stuff
  • /private

După introducerea acestora pentru toți roboții și apăsarea „adaugă o regulă”, fișierul Robots.txt final ar arăta astfel.

După introducerea acestora pentru toți roboții și apăsarea „adaugă o regulă”, fișierul Robots.txt final ar arăta astfel.

Există o comandă implicită „Allow” dacă vrei să faci o excepție și să permiți unui robot să acceseze un site web pe care l-ai blocat cu o comandă.

Using Google Webmaster Tools to create Robots.txt

Googlebot poate accesa directorul de fotografii al site-ului tău doar dacă comanda de interdicție este plasată lângă el. Apoi, dă click pe „descarcă” pentru a obține fișierul tău Robots.txt. Dă click pe „descarcă” după ce ai ales paginile și fișierele pe care vrei să le blochezi.

Instalează-ți fișierul Robots.txt

Un fișier numit „Robots.txt” poate fi acum adăugat în directorul principal (www) al zonei CNC a site-ului tău web. Acest lucru înseamnă că poate fi acum găsit. Filezilla este un client FTP bun pentru acest lucru. Obține fișierul robots.txt creat de un programator web după ce le-ai dat o listă de URL-uri care ar trebui blocate de la crawling. Aceasta este o opțiune suplimentară. În acest caz, un dezvoltator web calificat va termina treaba în mai puțin de o oră.

Noindex vs. Disallow

Mulți oameni nu știu ce regulă să utilizeze în fișierul robots.txt al site-ului tău în bara de navigare. Acest lucru se datorează faptului că motivele prezentate în secțiunea anterioară fac ca regulile de noindex din Robots.txt să nu mai funcționează.

Site-ul tău poate avea un meta tag „noindex” pe care îl poți utiliza pentru a împiedica motoarele de căutare să indexeze una dintre paginile tale web. De regulă, acest tag va permite roboților web să-ți viziteze site-ul, dar va spune, de asemenea, motoarelor de căutare să nu-ți indexeze pagina.

Pe termen lung, s-ar putea să nu fie la fel de eficient ca tag-ul noindex. Regula disallow s-ar putea să nu fie la fel de eficientă ca acest tag. Acest lucru este bun, deoarece robots.txt împiedică motoarele de căutare să-ți scaneze pagina. Nu le împiedică să-ți indexeze pagina pe baza informațiilor din alte pagini și site-uri web, ceea ce este bine.

Este important să reții că, chiar dacă dezactivezi și adaugi un tag noindex unei pagini, roboții nu vor ști despre tag și ar putea continua să indexeze pagina chiar și așa.

Mistakes you will want to avoid

Greșeli pe care vei dori să le eviți

Ai învățat despre numeroasele lucruri pe care le poți face cu fișierul robots.txt și cum îl poți utiliza. În această parte, vom analiza fiecare problemă mai detaliat și vom arăta cum, dacă este utilizat greșit, ar putea avea un efect negativ asupra SEO.

Nu poți utiliza un fișier robots.txt sau un tag „noindex” pentru a împiedica oamenii să acceseze informații utile pe care vrei să le faci publice. În trecut, am văzut multe astfel de situații în SEO. Toate au avut un efect negativ asupra rezultatelor. Este important să te asiguri că toate paginile tale web au tag-uri și reguli noindex și noblock înainte de a fi publicate.

Dacă utilizezi directive crawl-delay, nu ar trebui să le utilizezi prea des. Acest lucru se datorează faptului că limitează numărul de pagini pe care boții le pot examina. Pe de altă parte, a avea un site web mare îți poate face mai dificil să obții ranking-uri înalte și să atragi mulți vizitatori.

Pentru a te asigura că fișierul robotului tău este citit corect, trebuie să utilizezi formatul Robots.txt corect pentru fișierul tău. Toate literele ar trebui să fie minuscule atunci când este în fișierul robotului. Ar trebui să se numească „robots.txt”. Nu poate funcționa dacă nu este așa.

Încheiere – Testează-ți Robots.TXT

Fișierul tău ar trebui acum verificat pentru a te asigura că funcționează corect. Există o casetă de testare robots.txt pe care o poți utiliza în Google Search Console, dar numai dacă ai utilizat vechea Google Search Console, care nu mai este utilizată. Testerul robots.txt nu mai funcționează din cauza celei mai recente GSC (Google lucrează din greu la adăugarea de noi funcții la GSC, așa că poate pe viitor vom putea vedea testerul Robots.txt în navigația principală).

Dacă vrei să afli mai multe despre ce poate face testerul Robots.txt, accesează pagina de ajutor Google. Un alt instrument util este disponibil:

Alege un proiect din meniul derulant din dreapta. De exemplu, poți lucra la site-ul web al companiei tale sau la un alt proiect.

Pentru a înlocui vechiul fișier robots.txt cu cel pe care tocmai l-ai creat, trebuie mai întâi să scoți totul din casetă. Pentru a începe un test, dă click pe „Test”.

Valoarea „Test” ar trebui schimbată în „Allowed”. Acest lucru va asigura că fișierul tău robots.txt funcționează corect.

Asigurându-te că fișierul tău robots.txt este corect, poți îmbunătăți performanța motorului de căutare și experiența utilizatorului vizitatorilor tăi în același timp. Îți este mai ușor să controlezi ce văd oamenii când caută lucruri pe site-ul tău dacă roboții își pot petrece zilele căutând și indexând.

Întrebări frecvente

Articole similare

Cum să utilizezi fișierul Robots.txt pentru SEO · BlogDrip