Come Usare il File Robots.txt per la SEO
Scopri come usare il file robots.txt per la SEO. Controlla il crawling dei motori di ricerca, migliora l'indicizzazione e proteggi le pagine private con una corretta configurazione di robots.txt.

Sapevi che Robots.txt è uno degli elementi chiave per la SEO del tuo sito? Cos'è esattamente Robots.txt e come lo userai per la SEO? Stiamo per spiegarlo in questo post.
Cos'è Robots.txt?
Nella directory principale di un sito web ci sono file che indicano ai motori di ricerca crawler e spider quali pagine e file dovrebbero vedere e quali no. Gli amministratori web spesso vogliono che i loro siti siano trovati dai motori di ricerca, ma ci sono momenti in cui non è necessario. Se stai conservando informazioni private o cercando di risparmiare spazio, puoi impedire ai motori di ricerca di indicizzare i tuoi file (escludendo pagine pesanti con immagini).
Lo standard di esclusione dei robot, noto anche come protocollo di esclusione dei robot o semplicemente robots.txt, è uno standard utilizzato dai siti webper comunicare con i web crawler e altri web robot.
I robot sono spesso usati dai motori di ricerca per categorizzare i siti web. Non tutti i robot cooperano con lo standard; i raccoglitori di email, gli spambot, i malware e i robot che cercano vulnerabilità di sicurezza potrebbero persino iniziare dalle porzioni del sito web da cui è stato detto loro di stare fuori. Lo standard può essere utilizzato in combinazione con le Sitemap, uno standard di inclusione dei robot per i siti web. – Wikipedia
I motori di ricerca che usano le keyword e i metadati per indicizzare le pagine web mostrano i risultati più pertinenti alle persone che cercano qualcosa su Internet. È più importante per i proprietari di negozi online ottenere buoni risultati nei motori di ricerca che per qualsiasi altra attività. Di solito, le persone non vanno oltre le prime pagine di risultati dei suggerimenti di un motore di ricerca. suggerimenti.
L'indicizzazione viene effettuata con l'aiuto di spider o crawler, che si muovono. È così che le aziende di motori di ricerca ottengono e organizzano tutte le informazioni su Internet. Queste aziende usano questi bot.

robots.txt è il file che i crawler cercano quando visitano un sito web per la prima volta. Non appena il crawler trova un file come questo, cercherà al suo interno le istruzioni su come indicizzare il sito. Non ci sono istruzioni per il bot che non riesce a trovarle, quindi usa l' algoritmo della sua operazione per cercarle. Ciò porta molte persone a cercare cose sul sito web, ma rende anche il processo di indicizzazione meno efficace.
Affinché il file robots.txt funzioni, ce ne può essere solo uno sul sito. Un nome di dominio aggiuntivo deve avere un file robots.txt nella root della sua pagina web. Ad esempio, dovrebbe essere su https://www.domain.com/robots.txt, e dovrebbe dire ai robot di non andare su quel sito.
È anche importante assicurarsi che il nome del tuo file sia robots.txt. Se il nome non è scritto correttamente, non funzionerà.
Prendi il controllo
Hai più controllo sulla SEO del tuo sito di quanto pensi.
In generale, questo è vero. Puoi scegliere quali crawler e indicizzatori possono vedere e indicizzare il tuo sito a livello di pagina. Esiste un file chiamato robots.txt che può essere utilizzato per assicurarsi che ciò non accada di nuovo. C'è un semplice file di testo chiamato robots.txt nella directory principale del tuo sito web. Questo file dice ai web robot di non leggere il tuo sito web. I robot possono usare queste informazioni per migliorare i loro risultati di ricerca per essere più specifici.
Poiché non è la soluzione definitiva, hai scoperto che è un ottimo modo per far vedere il tuo sito web dai motori di ricerca. Se vuoi che i motori di ricerca apprezzino il tuo sito, devi fare una buona prima impressione. Nel modo giusto, l'uso di robots.txt può aiutare con la SEO.
Quindi, come si fa? Qual è lo scopo di questo? Cosa non dovresti mai fare? Le risposte a queste domande sono nella pagina successiva.
Il motivo per usare Robots.txt
Robots.txt è un file che i motori di ricerca usano per capire quali pagine del tuo sito indicizzare e quali tenere fuori dai risultati di ricerca. Ad esempio, se nel tuo file Robots.txt dici che la tua pagina di ringraziamento non dovrebbe essere disponibile per i motori di ricerca, questa pagina non apparirà nei risultati di ricerca e non sarà accessibile alle persone che la cercano sul web. Alcune pagine del tuo sito devono essere nascoste ai motori di ricerca sia per la privacy che per il ranking. Questo è importante per entrambi.
Dove trovare il tuo file Robots?

Se hai un sito web, il file robots.txt si trova nella directory principale del tuo sito. Accedi al tuo cPanel FTP e cercalo nell'area HTML pubblica del tuo account. Questi file non occupano molto spazio. Potrebbero essere solo poche centinaia di byte. Se non ne trovi uno, dovrai crearne uno.
Come Funziona Robots.txt
Quando i motori di ricerca desiderano indicizzare il tuo sito, inviano piccoli programmi chiamati “spider” o “robot” che scansionano il tuo sito e restituiscono dati ai motori di ricerca. Le direttive “Disallow” di Robots.txt istruiscono i motori di ricerca e altri programmi a non cercare determinate pagine sul tuo sito web che specifichi nel comando. I seguenti comandi possono essere trovati nel file robots.txt:
impedirà a tutti i robot dei motori di ricerca di accedere alla seguente pagina del tuo sito: http://www.yoursite.com/thankyou
Prima del comando disallow c'è il comando: “User-agent: * “. La parte User-agent identifica quale robot desideri proibire.
“User-agent: Googlebot”. Questo comando impedirebbe solo ai robot di Google di accedere al sito web; altri sarebbero comunque in grado di accedervi: http://www.yoursite.com/thankyou
Tuttavia, usando il carattere “*”, specifichi che i comandi sottostanti si riferiscono a tutti i robot. Il tuo file robots.txt si troverebbe nella directory principale del tuo sito. Ad esempio: http://www.yoursite.com/robots.txt
Come Creare un File Robots.txt

Chiunque può creare questo semplice file di testo. Hai bisogno di un editor di testo come Blocco Note per scrivere il tuo testo. Apri un nuovo file di testo e salvalo come “robots.txt”, quindi digita al suo interno. Quando sei nel tuo cPanel, vai alla cartella HTML pubblica e cliccaci sopra. Inizia assicurandoti che il file sia già presente.
Se tutto sembra a posto, hai finito. Solo la persona che possiede il file dovrebbe essere in grado di vederlo e modificarlo. Affinché il file funzioni, deve avere il permesso “0644”.
In caso contrario, fai clic destro sul file e scegli “cambia permessi”. Ecco fatto! C'è un file chiamato robots.txt che contiene istruzioni per i robot. Sintassi di Robots.txt. Il file robots.txt ha più sezioni di “direttive” per ogni user agent che è stato configurato. Ognuna inizia con il nome dello user agent. Ogni bot di crawling è identificato dal suo ID user agent secondo il codice.
Ci sono due modi per farlo: finché usi un carattere jolly, puoi mirare a tutti i motori di ricerca contemporaneamente. Puoi scegliere quali motori di ricerca vuoi mirare. Quando avvii un bot di crawling, andrà alle parti del sito web che sono meno restrittive. Andrà così:
Direttiva User-Agent
Le prime righe di ogni blocco includono lo user-agent, che identifica un bot. Quindi, ad esempio: se vuoi dire a un Googlebot cosa fare, inizieresti con:
User-agent: Googlebot Di norma, i motori di ricerca cercano le informazioni più pertinenti.
Finché hai una direttiva Googlebot-Video e una Bingbot in atto. Lo user agent ‘Bingbot’ farà come istruito. Puoi aspettarti istruzioni più precise da Googlebot-Video.
Di seguito sono elencati i robot dei motori di ricerca più utilizzati.
Direttiva Disallow
I bot non potranno accedere a determinate porzioni del tuo sito se abiliti questa funzione. Nulla impedisce ai bot di viaggiare su Internet e accedere a qualsiasi sito web desiderino.
Direttiva Sitemap (Sitemap XML)
Questo meta tag dice ai motori di ricerca dove si trova la tua sitemap. Devi inviarli alla Google Search Console dei motori di ricerca affinché vengano trovati. Ti sarebbe utile usare ognuno di questi strumenti perché potrebbero insegnarti molto sul tuo sito web.
Quando la velocità è importante, usa la direttiva chiamata “sitemap”.
Direttiva Crawl-Delay
Se vuoi rallentare un po' Yahoo, Bing e Yandex quando eseguono il crawling, puoi inserire una direttiva chiamata “crawl-delay”. Questo è ciò che accadrà quando inserirai questa riga nel tuo blocco:
Crawl-Delay:10 Attendi dieci secondi prima del crawling.
Quando un motore di ricerca è configurato, può essere impostato per attendere dieci secondi prima di scansionare un sito o dieci secondi prima di tornare a un sito dopo una scansione. L'effetto è quasi lo stesso ma leggermente diverso a seconda del motore di ricerca utilizzato. Dopo una scansione, un Crawl-delay di 1 significa che i motori di ricerca inizieranno a scansionare il sito immediatamente.
Usare Google Search Console per creare Robots.txt
Seleziona “crawler access” dalla barra del menu per creare rapidamente un file robots.txt con un account gratuito di Google Search Console. Per creare un file Robots.txt di base, scegli “genera robots.txt” quando arrivi al sito.
Sotto “azione”, scegli “blocca”, e sotto “User-agent”, scegli quali robot non vuoi vedere sul tuo sito web. Scegli “directory e file” e digita i nomi delle cartelle che vuoi tenere fuori portata. “http://www.yoursite.com” non dovrebbe far parte di questa strategia in alcun modo, forma o maniera.” Ad esempio, se non vuoi che le persone possano vedere le pagine sottostanti, puoi:
- http://www.yoursite.com/thank-you
- http://www.yoursite.com/free-stuff
- http://www.yoursite.com/private
In Google Search Console, inserisci quanto segue nel campo “directory e file”:/thank-you
- /free-stuff
- /private
Dopo aver inserito questi per tutti i robot e aver cliccato su “aggiungi una regola”, il file Robots.txt finale apparirebbe così.
Dopo aver inserito questi per tutti i robot e aver cliccato su “aggiungi una regola”, il file Robots.txt finale apparirebbe così.
C'è un comando “Allow” predefinito se vuoi fare un'eccezione e consentire a un robot di accedere a un sito web che hai bloccato con un comando.

Il Googlebot può accedere alla directory delle foto del tuo sito solo se il comando di divieto è posizionato accanto ad essa. Quindi, clicca su “download” per ottenere il tuo file Robots.txt. Clicca su “download” quando hai scelto le pagine e i file che vuoi bloccare, clicca su “download”.
Installa il Tuo File Robots.txt
Un file chiamato “Robots.txt” può ora essere aggiunto alla directory principale (www) dell'area CNC del tuo sito web. Ciò significa che ora può essere trovato. Filezilla è un buon client FTP per questo. Fai creare il tuo file robots.txt da un programmatore web dopo avergli fornito un elenco di URL che dovrebbero essere bloccati dal crawling. Questa è un'opzione aggiuntiva. In questo caso, uno sviluppatore web esperto completerà il lavoro in meno di un'ora.
Noindex vs. Disallow
Molte persone non sanno quale regola usare nel file robots.txt del tuo sito web nella barra di navigazione. Questo perché le ragioni fornite nella sezione precedente rendono le regole noindex di Robots.txt non più funzionanti.
Il tuo sito web potrebbe avere un “noindex” meta tag che puoi usare per impedire ai motori di ricerca di indicizzare una delle tue pagine web. Di norma, questo tag permetterà ai web robot di visitare il tuo sito, ma dirà anche ai motori di ricerca di non indicizzare la tua pagina.
Potrebbe non essere così efficace come il tag noindex a lungo termine. La regola disallow potrebbe non essere così efficace come questo tag. Questo è un bene perché robots.txt impedisce ai motori di ricerca di scansionare la tua pagina. Non impedisce loro di indicizzare la tua pagina basandosi su informazioni provenienti da altre pagine e siti web, il che è un bene.
È importante ricordare che anche se disabiliti e aggiungi un tag noindex a una pagina, i robot non conosceranno il tag e potrebbero continuare a indicizzare la pagina anche se lo fai.

Errori che vorrai evitare
Hai imparato molte cose che puoi fare con il tuo file robots.txt e come usarlo. In questa parte, esamineremo ogni problema più in dettaglio e mostreremo come, se usato in modo errato, potrebbe avere un effetto negativo sulla SEO.
Non puoi usare un file robots.txt o un tag “noindex” per impedire alle persone di accedere a informazioni utili che vuoi rendere pubbliche. In passato, abbiamo visto molte cose simili accadere con la SEO. Tutte hanno avuto un effetto negativo sui risultati. È importante assicurarsi che tutte le tue pagine web abbiano tag e regole noindex e noblock prima che vadano online.
Se usi le direttive crawl-delay, non dovresti usarle troppo spesso. Questo perché limitano il numero di pagine che i bot possono esaminare. D'altra parte, avere un sito web di grandi dimensioni potrebbe rendere più difficile per te ottenere ranking elevati e ottenere molti visitatori.
Per assicurarti che il file del tuo robot sia letto correttamente, devi usare il formato Robots.txt corretto per il tuo file. Tutte le lettere dovrebbero essere minuscole quando si trova nel file del robot. Dovrebbe essere chiamato “robots.txt”. Non può funzionare se non lo è.
Conclusione – Testa il Tuo Robots.TXT
Il tuo file dovrebbe ora essere controllato per assicurarti che funzioni correttamente. C'è una casella di test robots.txt che puoi usare in Google Search Console, ma solo se hai usato la vecchia Google Search Console, che non è più utilizzata. Il tester robots.txt non funziona più a causa della più recente GSC (Google sta lavorando sodo per aggiungere nuove funzionalità alla GSC, quindi forse in futuro potremo vedere il tester Robots.txt nella navigazione principale).
Se vuoi saperne di più su cosa può fare il tester Robots.txt, vai alla pagina di aiuto di Google. Un altro strumento utile è disponibile:
Scegli un progetto dal menu a discesa a destra. Ad esempio, puoi lavorare sul sito web della tua azienda o su un altro progetto.
Per sostituire il vecchio file robots.txt con quello che hai appena creato, devi prima rimuovere tutto dalla casella. Per avviare un test, clicca su “Test”.
Il valore di “Test” dovrebbe essere cambiato in “Allowed”. Questo assicurerà che il tuo file robots.txt funzioni correttamente.
Assicurandoti che il tuo file robots.txt sia corretto, puoi migliorare le prestazioni del tuo motore di ricerca e la user experience dei tuoi visitatori allo stesso tempo. È più facile per te controllare ciò che le persone vedono quando cercano cose sul tuo sito se i robot possono passare le loro giornate a cercarlo e indicizzarlo.
Domande frequenti
Articoli correlati
Checklist SEO On-Page per Migliorare il Ranking e la UX
Checklist SEO On-Page Guida completa su velocità del sito, caching, immagini e title tag per un ranking migliore.
Consigli SEO per Migliorare il Ranking: Strategie Pratiche e Durature
Scopri consigli SEO essenziali: ottimizza la velocità della pagina, crea link di qualità, contenuti long-form e sfrutta il video marketing per un miglior r…
Migliori Pratiche per i Titoli SEO | Google H1 SEO
Scopri l'importanza dei titoli in SEO. Impara come i tag H1, H2 e H3 migliorano il ranking, l'esperienza utente e i featured snippets con strategie esperte.
Passi per Costruire una Pipeline di Traffico Organico di Successo
Costruisci una pipeline di traffico organico di successo con strategie SEO comprovate. Impara la keyword research, gli angoli di contenuto e tecniche efficaci per aumentare il traffico organico…
FAQ Schema - Le Basi che Devi Conoscere
Impara le basi del FAQ Schema per aumentare il traffico organico e il CTR. Scopri come i dati strutturati aiutano i motori di ricerca a visualizzare i rich result in modo efficace.
