Crawling și indexing: Ghid practic pentru descoperire și indexare
Detaliază mecanica crawling-ului și indexing-ului, pașii de verificare cu curl și GSC, erori frecvente și soluții practice pentru site-uri publice și interne.

Ce sunt crawling-ul și indexing-ul?
Crawling și indexing sunt două etape distincte în felul în care motoarele de căutare procesează web‑ul. Crawling-ul este procesul de descoperire și preluare a paginilor: crawleri urmăresc linkuri interne, revizitează URL‑uri cunoscute și folosesc semnale precum XML sitemaps sau backlinkuri pentru a găsi conținut. Indexing‑ul este etapa de evaluare și stocare: după ce o pagină a fost crawl‑uită, motorul de căutare decide dacă o păstrează în index și o face eligibilă pentru afișare în rezultate.
Este important să distingi crawling, indexing și ranking: crawling = descoperire + preluare; indexing = stocare și înțelegere a conținutului; ranking = algoritmul care decide ordinea rezultatelor. O pagină poate fi crawl‑uită fără a fi indexată; de asemenea, poate fi indexabilă din punct de vedere tehnic, dar greu de descoperit dacă este slab legată intern.
Cum funcționează procesul – mecanica practică
Descoperire și crawling
Crawling‑ul pornește de la o listă inițială de URL‑uri (seed), linkuri interne, XML sitemaps și linkuri externe. Motoarele de căutare prioritizează URL‑urile în funcție de factori precum autoritatea paginii sursă, frecvența actualizărilor și resursele serverului. Din 2024, Google folosește Googlebot Smartphone ca user‑agent implicit pentru crawling și indexing, astfel încât versiunea mobilă a paginii este baza principală pentru procesul lor de indexare.
Indexing: evaluare și stocare
După preluare, motorul de căutare analizează conținutul, metadatele, semnalele structurale (canonical, hreflang), datele structurate și comportamentul semnalelor externe pentru a decide dacă păstrează pagina în index. Unele motive pentru care o pagină crawl‑uită nu este indexată includ directive explicite (meta robots noindex), pagini duplicate, conținut de valoare scăzută sau probleme de accesibilitate tehnică.
Dinamica crawl budget și prioritizare
Crawl budget înseamnă resursele pe care un crawler le alocă pentru un site: serverul tău și comportamentul de crawl determină cât de des și câte pagini sunt preluate într‑un interval. Pentru site‑uri mari, optimizarea structurii interne, corectarea erorilor 5xx și curățarea URL‑urilor inutile pot îmbunătăți eficiența descoperirii.
Verificare: pași practici și instrumente
Pagini pe care le deții (verificări authoritative)
Pentru URL‑urile din proprietatea ta, folosește Google Search Console URL Inspection pentru a vedea dacă Google a cunoscut, a crawlat și a indexat o adresă. URL Inspection oferă informații despre ultima dată de crawl, motivul unei stări "Excluded" și detalii despre directive meta sau canonical. Complementar, verifică registrul serverului pentru a vedea când și cu ce user‑agent a fost accesată pagina.
Verificări publice pentru pagini terțe (backlinks & publishers)
Dacă nu deții domeniul (de ex. verifici un publisher sau un backlink), folosește metode care funcționează din exterior: curl sau browserul pentru a vedea HTML‑ul sursă, Chrome DevTools pentru a inspecta DOM‑ul randat și operatorul site: ca semnal public de indexare (nu e concludent). Pentru pagini de publisher, confirmă indexabilitatea, absența meta robots noindex și că linkul către tine apare în HTML (nu doar injectat JS fără fallback).
Pentru plasări comerciale sau guest posts, verifică contextul editorial și indexabilitatea paginii. BlogDrip pune accent pe publisheri verificați și indexabili; poți folosi linkul „Vezi publisherii pentru backlinkuri” pentru a examina publisheri cu istorii de indexare publice și semnale de calitate. Dacă vrei mai mult context tehnic, „Citește ghidul de Technical SEO” acoperă canonical, sitemaps și directive robots într‑un mod aplicat.
Comenzi curl utile (corecte din punct de vedere tehnic)
Comenzi uzuale pentru diagnostic:
- Inspectează doar antetele HTTP: curl -I https://exemplu.ro/pagina
- Urmărește redirecturi și vezi antetele finale: curl -I -L https://exemplu.ro/
- Preia HTML‑ul servit pentru un anumit user‑agent (diagnostic): curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://exemplu.ro/pagina
Notă: -I afișează doar antetele; -A setează User‑Agent. Folosește această simulare pentru diagnosticare, dar nu folosi ca motiv pentru a servi conținut diferit crawlerelor față de utilizatori (evită cloaking).
Erori frecvente și cum le remediezi
Următoarele probleme apar frecvent când paginile nu sunt descoperite sau indexate corect. Pentru fiecare, am inclus pași practici de verificare şi remediere.
1) Blocare prin robots.txt
Verificare: descarcă /robots.txt și caută disallow care acoperă calea; folosește curl -I pentru a testa accesul. Remediere: elimină sau ajustează directivele care blochează resurse esențiale (HTML, CSS, JS) sau pagini importante.
2) Meta robots noindex sau header X‑Robots‑Tag
Verificare: inspectează sursa paginii pentru <meta name="robots" content="noindex"> sau verifică antetele cu curl -I pentru X‑Robots‑Tag. Remediere: elimină noindex de pe paginile care trebuie indexate sau ajustează condițiile (de ex. paginile de test/de staging).
3) Probleme de canonicalizare sau pagini duplicate
Verificare: compară canonicalul din sursă cu adresa preferată; folosește Search Console pentru paginile tale. Remediere: setează canonical corect, evită duplicarea prin parametri și asigură consistență în linkarea internă.
4) Erori server (5xx) și timeouts
Verificare: monitorizează jurnalele serverului și folosește curl -I pentru a vedea codurile de răspuns. Remediere: optimizează timpii de răspuns, ajustează rate‑limiting-ul și remediază erorile repetate pentru a nu pierde frecvența de crawl.
5) Pagini generate dinamic fără fallback (JS only)
Verificare: deschide pagina cu DevTools > Network și vezi ce HTML este livrat inițial; folosește Rich Results Test sau un crawler care randă server side. Remediere: oferă HTML inițial util sau implementează server‑side rendering / prerendering pentru conținut esențial.
Politica Google privind linkurile plătite și plasările sponsorizate
Dacă lucrați cu publisheri sau plasați linkuri plătite, urmați recomandările Google privind link spam. Linkurile al căror scop principal este manipularea clasamentelor pot fi tratate ca link spam. Pentru conținut plătit sau sponsorizat folosește rel="sponsored" sau rel="nofollow"; pentru linkurile generate de utilizatori folosește rel="ugc". Exemple de sintaxă: exemplu, exemplu sponsorizat și exemplu UGC
Reține diferența între acțiuni manuale și ajustări algoritmice: acțiunile manuale sunt vizibile în Google Search Console; majoritatea tratamentelor pentru link spam sunt automatizate și nu apar ca "penalizări" explicite. Evaluarea valoarei unei plasări plătite depinde de context editorial, calitatea publisherului și indexabilitate, nu doar de un scor DR/DA.
Check‑list finală de verificare
Următorii pași acoperă verificările esențiale pentru a te asigura că paginile tale sau plasările externe pot fi descoperite și indexate corect:
- Verifică URL‑ul în Google Search Console URL Inspection (proprietăți deținute).
- Citește /robots.txt, rulează curl -I și asigură acces pentru resurse critice.
- Verifică meta robots și X‑Robots‑Tag pentru noindex accidental.
- Asigură canonical corect și evită duplicarea conținutului nerelevant.
- Monitorizează jurnalele serverului pentru erori frecvente și pentru patternuri de crawl.
Întrebări frecvente
Ce înseamnă că o pagină este "crawl‑uită, dar nu indexată"?
Înseamnă că motorul de căutare a vizitat URL‑ul și a preluat conținutul, dar a decis, temporar sau permanent, să nu o includă în index. Motive comune: meta robots noindex, pagini duplicate, conținut de slabă valoare sau decizii algoritmice bazate pe semnale externe.
Operatorul site: confirmă că o pagină este indexată?
site: este un semnal public de indexare, util pentru verificări rapide, dar nu este definitiv. Google poate cunoaște o pagină fără ca ea să apară în rezultatele unui site: query. Pentru proprietăți deținute, folosește URL Inspection în Google Search Console pentru informație autoritativă.
Ce instrumente folosesc pentru a verifica conținutul randat?
Folosește Chrome DevTools pentru a inspecta DOM‑ul randat și Network pentru a vedea ce resurse sunt încărcate. Rich Results Test și Schema Markup Validator sunt utile pentru datele structurate. Pentru verificări de server‑side, analizează jurnalele și rulează comenzi curl fără JS pentru a vedea HTML‑ul inițial livrat.
Articole conexe

Cum să utilizezi fișierul robots.txt pentru SEO
Un ghid practic pentru a scrie, testa și depana fișierul robots.txt astfel încât să controlezi crawling-ul fără a risca indexarea nedorită.

Cele mai bune servicii de optimizare pentru motoarele de căutare (SEO)
Află ce includ serviciile SEO eficiente, cum să le verifici și ce greșeli să eviți pentru a obține vizibilitate durabilă în rezultatele de căutare.

Checklist SEO on-page pentru a îmbunătăți clasamentele și UX
Lista de verificare esențială pentru SEO on-page: optimizare tehnică, conținut și UX pentru a îmbunătăți indexarea și experiența vizitatorilor.
