Skip to content
Pesquisar

Robots.txt SEO: controle eficiente do rastreamento

Aprenda a usar robots.txt para orientar rastreadores, verificar bloqueios, evitar erros comuns e garantir que páginas importantes permaneçam acessíveis para indexação.

Robots.txt SEO: Controlar Rastreamento Eficientemente

O que é robots.txt e o que ele faz (e não faz)

Robots.txt é um arquivo de texto colocado na raiz do host (ex.: https://example.com/robots.txt) que fornece instruções aos crawlers compatíveis sobre quais caminhos do site devem ou não ser rastreados. É uma ferramenta de controle de rastreamento: impacta a descoberta e a frequência do crawl, não é um mecanismo direto de bloqueio de indexação ou de posicionamento nas SERPs.

Pontos-chave: robots.txt ordena o comportamento de crawler; não garante que um URL deixe de aparecer nos resultados de busca (motores podem indexar um URL conhecido por links mesmo que não possam rastreá-lo); meta robots noindex só funciona se o crawler puder acessar a página para ler a meta tag. Para impedir indexação de forma confiável, permita o acesso e use meta robots noindex, HTTP status apropriado (por exemplo 404/410) ou a remoção via ferramenta do proprietário (Search Console).

Sintaxe básica e diretivas essenciais

Um robots.txt típico contém seções por user-agent e regras de Disallow/Allow. As diretivas mais utilizadas são:

  • User-agent: especifica a família de crawlers a que a seção se aplica
  • Disallow: bloqueia caminhos (ou deixa em branco para permitir tudo)
  • Allow: permite explicitamente caminhos dentro de um diretório bloqueado (útil para exceções)
  • Sitemap: aponta para o(s) sitemap(s) XML — boa prática incluí-lo no robots.txt

Exemplo mínimo:

User-agent: *
Disallow: /private/
Allow: /private/public-file.html
Sitemap: https://example.com/sitemap.xml

Padrões e comportamento dos crawlers principais

O suporte a curingas e símbolos varia por crawler. O Google interpreta '*' (qualquer sequência) e '$' (fim da URL) em regras; 'Crawl-delay' não é suportado pelo Googlebot. Para diretivas específicas (por exemplo para outros buscadores), verifique a documentação do motor. A regra mais específica costuma prevalecer: se duas regras entram em conflito, a mais específica sobre o caminho determina o comportamento do crawler compatível.

Boas práticas para configuração

Use robots.txt para eficiência de crawl e para proteger áreas de baixo valor. Não use robots.txt para tentar esconder conteúdo sensível — autenticação e controlo de acesso são mais apropriados. Principais recomendações:

  • Mantenha o arquivo na raiz do host canônico (ex.: https://www.example.com/robots.txt). Cada subdomínio precisa do seu próprio robots.txt.
  • Inclua a diretiva Sitemap para ajudar na descoberta de URLs relevantes.
  • Evite bloquear arquivos CSS e JavaScript necessários para renderização — isso pode impedir que o Google renderize a página corretamente e afetar Core Web Vitals e indexação de conteúdo.
  • Prefira regras específicas em vez de um grande bloco global. Use Allow para exceções claras.
  • Teste alterações em um ambiente controlado antes de publicar em produção (use um host de staging com seu próprio robots.txt).

Como verificar e depurar robots.txt

Faça verificações externas (sem exigir acesso ao Search Console) e internas (quando você tiver propriedade verificada). Combine inspeção direta, testes por user-agent e análise de logs.

Inspeção direta com curl e navegador

Busque o arquivo pelo navegador: vá a https://seusite.com/robots.txt. Para inspeção por linha de comando:

Recuperar o corpo do arquivo (mostra conteúdo):
curl https://seusite.com/robots.txt

Recuperar apenas os cabeçalhos HTTP (útil para checar caching ou compressão):
curl -I https://seusite.com/robots.txt

Simular a requisição de um crawler específico (ex.: Googlebot):
curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://seusite.com/robots.txt

Ferramentas do proprietário (Search Console)

Se você é proprietário verificado do domínio, use o teste de robots.txt no Google Search Console para simular regras por user-agent e testar se um URL específico é permitido. Use a Inspeção de URL para ver se o Google tentou buscar a página e se houve bloqueio por robots.txt ou outro motivo.

Análise de logs e comportamento de crawl

Examine logs de servidor para ver quais user-agents acessaram URLs, códigos de resposta e frequência. Logs mostram se crawlers foram impedidos de buscar um recurso devido a 403/401 ou erro de conexão, mas não registram “bloqueio por robots.txt” — nesse caso, você verá ausência de tentativa de fetch do crawler nas rotas bloqueadas.

Erros comuns e como corrigi-los

  • Bloquear acidentalmente recursos críticos (CSS/JS) — verifique se arquivos usados no carregamento e renderização não estão em Disallow; o Google precisa desses recursos para renderizar páginas corretamente.
  • Regras muito amplas (ex.: Disallow: /) que impedem todo o site de ser rastreado — revise imediatamente e teste com o Search Console.
  • Confusão entre subdomínios e diretórios — cada subdomínio precisa do seu próprio robots.txt na raiz desse host.
  • Capitalização e barras finais: servidores são sensíveis a maiúsculas/minúsculas e a presença/ausência de trailing slash pode fazer a regra não casar como esperado.
  • Deixar robots.txt de staging público sem bloqueio — isso pode expor URLs de teste aos motores de busca. Use autenticação ou bloqueie staging de forma controlada.

Cenários práticos e soluções recomendadas

Quero impedir indexação de páginas específicas

Não bloqueie essas páginas via robots.txt se a intenção for fazer com que desapareçam dos resultados de busca. Em vez disso, permita o acesso ao crawler e aplique meta robots noindex ou um cabeçalho HTTP X-Robots-Tag: noindex; isso garante que o motor possa ler a instrução. Para remoções urgentes, use o relatório de Remoções temporárias no Search Console para seu site verificado.

Blindar áreas administrativas ou dados sensíveis

Robots.txt pode reduzir rastreamento, mas não é segurança. Proteja áreas administrativas com autenticação, firewalls ou restrições de IP. Use robots.txt apenas como uma camada adicional de orientação para crawlers.

Checklist rápido antes de publicar alterações

  1. Valide o arquivo com curl e abra https://seusite.com/robots.txt no navegador.
  2. Simule o user-agent do Google com curl -A e confirme que as regras aplicam-se conforme esperado.
  3. Use o teste de robots.txt no Google Search Console (propriedade verificada) para verificar permissões de URLs-chave.
  4. Verifique logs de servidor para confirmar comportamento de crawlers e identificar mudanças na taxa de fetch.
  5. Confirme que arquivos críticos de renderização (CSS/JS) não estão bloqueados.

Perguntas frequentes

O robots.txt impede que uma página apareça nos resultados de busca?

Não necessariamente. Robots.txt impede que crawlers compatíveis busquem o conteúdo da página, mas motores de busca podem ainda indexar um URL conhecido por links externos e exibir o URL sem snippet. Para impedir indexação, permita o acesso do crawler e aplique meta robots noindex ou use métodos de remoção apropriados.

Posso usar robots.txt para reduzir a carga do servidor?

Sim — direcionar crawlers para páginas de maior valor e bloquear áreas de baixo valor pode economizar recursos de crawl. Porém, para controlar com precisão frequência de acesso, analise logs e ajuste regras de servidor, cache e taxa de requisição; o robots.txt por si só não garante um ritmo fixo de crawl.

O que acontece se eu bloquear CSS/JS no robots.txt?

Bloquear recursos necessários para renderização pode impedir que o Google entenda e renderize corretamente suas páginas, afetando avaliação de conteúdo e Core Web Vitals. Evite bloquear recursos que o navegador do usuário também precisa para exibir a página.

Como testar regras para uma URL específica?

Para proprietários verificados, use o teste de robots.txt no Google Search Console para simular user-agents e testar permissões por URL. Para verificações externas, use curl para baixar o robots.txt e avalie manualmente se a regra cobre a URL em questão; em paralelo, verifique logs para ver se o crawler tentou buscar esse caminho.

Artigos relacionados