Skip to content

Como Usar o Arquivo Robots.txt para SEO

Aprenda a usar o arquivo robots.txt para SEO. Controle o rastreamento de mecanismos de busca, melhore a indexação e proteja páginas privadas com a configuração correta do robots.txt.

How to Use Robots.txt File for SEO

Sabias que Robots.txt é um dos elementos chave no SEO do teu site? O que é exatamente o Robots.txt e como o usarás para SEO? Vamos explicar tudo neste post.

O que é Robots.txt?

Existem arquivos no diretório raiz de um site que informam aos mecanismos de busca crawlers e spiders quais páginas e arquivos eles devem ver e quais não devem. Administradores de web frequentemente querem que seus sites sejam encontrados por mecanismos de busca, mas há momentos em que isso não é necessário. Se estás a guardar informações privadas ou a tentar poupar espaço, podes impedir que o mecanismo de busca indexe os teus arquivos (excluindo páginas pesadas com imagens).

O padrão de exclusão de robôs, também conhecido como protocolo de exclusão de robôs ou simplesmente robots.txt, é um padrão usado por sitespara comunicar com web crawlers e outros web robots.

Robôs são frequentemente usados por mecanismos de busca para categorizar sites. Nem todos os robôs cooperam com o padrão; coletores de e-mail, spambots, malware e robôs que procuram vulnerabilidades de segurança podem até começar pelas partes do site onde foram instruídos a não entrar. O padrão pode ser usado em conjunto com Sitemaps, um padrão de inclusão de robôs para sites. – Wikipedia

Mecanismos de busca que usam palavras-chave e metadados para indexar páginas da web mostram os resultados mais relevantes para quem pesquisa algo na Internet. É mais importante para os proprietários de lojas online obter bons resultados nos mecanismos de busca do que para qualquer outro negócio. Geralmente, as pessoas não passam das primeiras páginas de resultados das sugestões de um mecanismo de busca sugestões.

A indexação é feita com a ajuda de spiders ou crawlers, que se movem. É assim que as empresas de mecanismos de busca obtêm e organizam todas as informações na Internet. Essas empresas usam esses bots.

How to Use Robots.txt File for SEO

robots.txt é o arquivo que os crawlers procuram quando visitam um site pela primeira vez. Assim que o crawler encontra um arquivo como este, ele procurará nele instruções sobre como indexar o site. Não há instruções para o bot que não consegue encontrá-las, então ele usa o algoritmo da sua operação para procurá-las. Isso faz com que muitas pessoas procurem coisas no site, mas também torna o processo de indexação menos eficaz.

Para que o arquivo robots.txt funcione, só pode haver um no site. Um nome de domínio adicional deve ter um arquivo robots.txt na raiz da sua página web. Por exemplo, deve estar em https://www.domain.com/robots.txt, e deve dizer aos robôs para não irem a esse site.

É também importante garantir que o nome do teu arquivo seja robots.txt. Se o nome não estiver escrito corretamente, não funcionará.

Assume o controlo

Tens mais controlo sobre o SEO do teu site do que pensas.

Em geral, isso é verdade. Podes escolher quais crawlers e indexadores podem ver e indexar o teu site ao nível da página. Existe um arquivo chamado robots.txt que pode ser usado para garantir que isso não aconteça novamente. Existe um arquivo de texto simples chamado robots.txt no diretório raiz do teu site. Este arquivo informa aos robôs da web para não lerem o teu site. Os robôs podem usar esta informação para melhorar os seus resultados de busca para serem mais específicos.

Como não é a solução definitiva, descobriste que é uma ótima maneira de fazer com que o teu site seja visto pelos mecanismos de busca. Se queres que os mecanismos de busca gostem do teu site, deves causar uma boa primeira impressão. Da maneira certa, o uso do robots.txt pode ajudar com o SEO.

Então, como fazes isso? Qual é o objetivo de usar isto? O que nunca deves fazer? As respostas a estas perguntas estão na próxima página.

A razão para usar Robots.txt

Robots.txt é um arquivo que os mecanismos de busca usam para descobrir quais páginas do teu site indexar e quais manter fora dos resultados de busca. Por exemplo, se disseres no teu arquivo Robots.txt que a tua página de agradecimento não deve estar disponível para os mecanismos de busca, esta página não aparecerá nos resultados de busca e não será acessível a pessoas que a procurem na web. Algumas páginas do teu site devem ser ocultadas dos mecanismos de busca tanto por privacidade quanto para o ranking. Isso é importante para ambos.

Onde localizar o teu arquivo Robots?

Get in control

Se tens um site, o arquivo robots.txt está no diretório raiz do teu site. Entra no teu cPanel FTP e procura-o na área HTML pública da tua conta. Estes arquivos não ocupam muito espaço. Podem ter apenas algumas centenas de bytes. Se não conseguires encontrar um, terás de criar um.

Como o Robots.txt Funciona

Quando os mecanismos de busca desejam indexar o teu site, eles enviam pequenos programas chamados “spiders” ou “robôs” que rastreiam o teu site e retornam dados aos mecanismos de busca. As diretivas “Disallow” do Robots.txt instruem os mecanismos de busca e outros programas a não procurarem certas páginas no teu site que especificas no comando. Os seguintes comandos podem ser encontrados no arquivo robots.txt:

impedirá que todos os robôs dos mecanismos de busca acedam à seguinte página do teu site: http://www.yoursite.com/thankyou

Antes do comando disallow está o comando: “User-agent: * “, A parte User-agent identifica qual robô desejas proibir.

“User-agent: Googlebot” . Este comando impediria apenas os robôs do Google de aceder ao site; outros ainda poderiam aceder: http://www.yoursite.com/thankyou

No entanto, ao usar o caractere “*”, especificas que os comandos abaixo se referem a todos os robôs. O teu arquivo robots.txt estaria localizado no diretório principal do teu site. Por exemplo: http://www.yoursite.com/robots.txt

Como Montar um Arquivo Robots.txt

How to Put Together a Robots.txt File

Qualquer pessoa pode criar este arquivo de texto simples. Precisas de um editor de texto como o Bloco de Notas para escrever o teu texto. Abre um novo arquivo de texto e guarda-o como “robots.txt”, depois digita nele. Quando estiveres no teu cPanel, vai para a pasta HTML pública e clica nela. Começa por garantir que o arquivo já existe.

Se tudo estiver bem, terminaste. Apenas o proprietário do arquivo deve poder vê-lo e alterá-lo. Para que o arquivo funcione, precisa ter a permissão “0644”.

Se não, clica com o botão direito no arquivo e escolhe “alterar permissões”. Aí está! Existe um arquivo chamado robots.txt que contém instruções para robôs. Sintaxe do Robots.txt. O arquivo robots.txt tem várias seções de “diretivas” para cada user agent que foi configurado. Cada uma começa com o nome do user agent. Cada bot de rastreamento é identificado pelo seu ID de user agent de acordo com o código.

Existem duas maneiras de fazer isso: Enquanto usares um curinga, podes direcionar todos os mecanismos de busca simultaneamente. Podes escolher quais mecanismos de busca queres direcionar. Quando inicias um bot de rastreamento, ele irá para as partes do site que são as menos "felizes" com isso. Será assim:

Diretiva User-Agent

As primeiras linhas de cada bloco incluem o user-agent, que identifica um bot. Então, por exemplo: se quiseres dizer a um Googlebot o que fazer, começarias com:

User-agent: Googlebot Como regra, os mecanismos de busca procuram as informações mais relevantes.

Enquanto tiveres uma diretiva Googlebot-Video e Bingbot em vigor. O user agent ‘Bingbot’ fará o que for instruído. Podes esperar instruções mais precisas do Googlebot-Video.

Abaixo estão os robôs de mecanismos de busca mais usados.

Diretiva Disallow

Os bots não conseguirão aceder a certas partes do teu site se ativardes esta funcionalidade. Nada impede os bots de viajar pela Internet e aceder a quaisquer sites que desejem.

Diretiva Sitemap (XML Sitemaps)

Esta meta tag informa aos mecanismos de busca onde está o teu sitemap. Deves enviá-los para o Google Search Console dos mecanismos de busca para que sejam encontrados. Seria útil se usasses cada uma destas ferramentas porque elas podem ensinar-te muito sobre o teu site.

Quando a velocidade é importante, usa a diretiva chamada “sitemap.”

Diretiva Crawl-Delay

Se quiseres atrasar um pouco o Yahoo, Bing e Yandex quando eles rastreiam, podes inserir uma diretiva chamada “crawl-delay”. O seguinte acontecerá quando inserires esta linha no teu bloco:

Crawl-Delay:10 Espera dez segundos antes de rastrear.

Quando um mecanismo de busca é configurado, ele pode ser configurado para esperar dez segundos antes de rastrear um site ou dez segundos antes de retornar a um site após um rastreamento. O efeito é quase o mesmo, mas ligeiramente diferente dependendo do mecanismo de busca usado. Após um rastreamento, um Crawl-delay de 1 significa que os mecanismos de busca começarão a rastrear o site imediatamente.

Usando o Google Search Console para criar Robots.txt

Seleciona “crawler access” na barra de menu para criar rapidamente um arquivo robots.txt com uma conta gratuita do Google Search Console. Para criar um arquivo Robots.txt básico, escolhe “gerar robots.txt” quando chegares ao site.

Em “ação”, escolhe “bloquear”, e em “User-agent”, escolhe quais robôs não queres ver no teu site. Escolhe “diretórios e arquivos” e digita os nomes das pastas que queres manter fora do alcance. “http://www.yoursite.com” não deve fazer parte desta estratégia de forma alguma.” Por exemplo, se não quiseres que as pessoas vejam as páginas abaixo, podes:

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

No Google Search Console, insere o seguinte no campo “diretórios e arquivos”:/thank-you

  • /free-stuff
  • /private

Depois de inserir estes para todos os robôs e clicar em “adicionar uma regra”, o arquivo Robots.txt final ficaria assim.

Depois de inserir estes para todos os robôs e clicar em “adicionar uma regra”, o arquivo Robots.txt final ficaria assim.

Existe um comando “Allow” padrão se quiseres fazer uma exceção e permitir que um robô aceda a um site que bloqueaste com um comando.

Using Google Webmaster Tools to create Robots.txt

O Googlebot só pode aceder ao diretório de fotos do teu site se o comando de proibição for colocado ao lado dele. Em seguida, clica em “download” para obter o teu arquivo Robots.txt. Clica em “download” quando tiveres escolhido as páginas e arquivos que queres bloquear, clica em “download”.

Instala o Teu Arquivo Robots.txt

Um arquivo chamado “Robots.txt” pode agora ser adicionado ao diretório principal (www) da área CNC do teu site. Isso significa que agora pode ser encontrado. O Filezilla é um bom cliente FTP para isso. Pede a um programador web para criar o teu arquivo robots.txt depois de lhes dares uma lista de URLs que devem ser impedidos de serem rastreados. Esta é uma opção extra. Neste caso, um desenvolvedor web qualificado terminará o trabalho em menos de uma hora.

Noindex vs. Disallow

Muitas pessoas não sabem qual regra usar no arquivo robots.txt do teu site na barra de navegação. Isso ocorre porque as razões dadas na seção anterior fazem com que as regras de noindex do Robots.txt não funcionem mais.

O teu site pode ter uma meta tag “noindex” que podes usar para impedir que os mecanismos de busca indexem uma das tuas páginas web. Como regra, esta tag permitirá que os robôs da web visitem o teu site, mas também dirá aos mecanismos de busca para não indexarem a tua página.

Pode não ser tão eficaz quanto a tag noindex a longo prazo. A regra disallow pode não ser tão eficaz quanto esta tag. Isso é bom porque o robots.txt impede que os mecanismos de busca rastreiem a tua página. Não os impede de indexar a tua página com base em informações de outras páginas e sites, o que é bom.

É importante lembrar que, mesmo que desatives e adiciones uma tag noindex a uma página, os robôs não saberão sobre a tag e podem continuar a indexar a página, mesmo que o faças.

Mistakes you will want to avoid

Erros que vais querer evitar

Aprendeste sobre as muitas coisas que podes fazer com o teu arquivo robots.txt e como podes usá-lo. Nesta parte, vamos abordar cada questão em mais detalhes e mostrar como, se usado incorretamente, pode ter um efeito negativo no SEO.

Não podes usar um arquivo robots.txt ou uma tag “noindex” para impedir que as pessoas acedam a informações úteis que queres tornar públicas. No passado, vimos muitas coisas assim acontecerem com o SEO. Todas elas tiveram um efeito negativo nos resultados. É importante garantir que todas as tuas páginas web tenham tags e regras de noindex e noblock antes de serem publicadas.

Se usares diretivas crawl-delay, não deves usá-las com muita frequência. Isso ocorre porque elas limitam o número de páginas que os bots podem analisar. Por outro lado, ter um site grande pode dificultar a obtenção de rankings altos e a obtenção de muitos visitantes.

Para garantir que o arquivo do teu robô seja lido corretamente, precisas usar o formato Robots.txt correto para o teu arquivo. Todas as letras devem ser minúsculas quando estiver no arquivo do robô. Deve ser chamado de “robots.txt”. Não funcionará se não for.

Conclusão – Testa o Teu Robots.TXT

O teu arquivo deve agora ser verificado para garantir que funciona corretamente. Existe uma caixa de teste robots.txt que podes usar no Google Search Console, mas apenas se usaste o antigo Google Search Console, que já não é usado. O testador de robots.txt já não funciona devido ao GSC mais recente (o Google está a trabalhar arduamente para adicionar novas funcionalidades ao GSC, então talvez no futuro possamos ver o testador de Robots.txt na navegação principal).

Se quiseres saber mais sobre o que o testador de Robots.txt pode fazer, vai à página de ajuda do Google. Outra ferramenta útil está disponível:

Escolhe um projeto no menu suspenso à direita. Por exemplo, podes trabalhar no site da tua empresa ou noutro projeto.

Para substituir o antigo arquivo robots.txt pelo que acabaste de criar, precisas primeiro remover tudo da caixa. Para iniciar um teste, clica em “Testar”.

O valor de “Testar” deve ser alterado para “Permitido”. Isso garantirá que o teu arquivo robots.txt está a funcionar corretamente.

Ao garantir que o teu arquivo robots.txt está correto, podes melhorar o desempenho do teu mecanismo de busca e a experiência do utilizador dos teus visitantes ao mesmo tempo. É mais fácil para ti controlar o que as pessoas veem quando pesquisam coisas no teu site se os robôs puderem passar os seus dias a procurá-lo e a indexá-lo.

Perguntas frequentes

Artigos relacionados

Como Usar o Arquivo Robots.txt para SEO · BlogDrip