Skip to content
Pesquisar

robots.txt: o que é e como funciona

robots.txt é um arquivo de texto no diretório raiz do site que instrui crawlers sobre quais URLs e recursos podem ser rastreados; influencia crawling e indexação, mas não serve como mecanismo de segurança para dados sensíveis.

Robots.txt: O que é e como funciona

O que é robots.txt?

robots.txt é o arquivo do Robots Exclusion Protocol localizado no diretório raiz (https://seudominio.com/robots.txt). Ele contém diretivas simples — por exemplo User-agent e Disallow — que informam crawlers quais caminhos não devem ser visitados. Essas diretivas orientam o comportamento de rastreadores, mas não autenticar nem ocultar conteúdo de forma segura.

Por que robots.txt importa para SEO

robots.txt controla o que os crawlers podem acessar; isso afeta diretamente o volume e o custo do rastreamento e influencia que recursos o mecanismo de busca consegue renderizar. Importante: bloquear uma URL via robots.txt impede o crawl dessa URL, mas não garante que ela não apareça nos resultados a partir de links externos. Em outras palavras, robots.txt atua no estágio de crawling/indexação, não decide sozinho o posicionamento final (ranking), que depende de muitos sinais adicionais.

Como robots.txt funciona

Quando um crawler pede uma página, muitos bots solicitam primeiro /robots.txt para ler as regras aplicáveis ao seu User-agent. O parser do crawler procura a seção mais específica para o User-agent e aplica Allow/Disallow ao caminho solicitado. Se uma página estiver bloqueada, o crawler deve respeitar essa diretiva e não buscar o recurso; porém o motor de busca pode ainda indexar a URL sem conteúdo caso encontre referências externas.

Exemplos simples de diretivas em robots.txt: <User-agent: *>, <Disallow: /admin/>, <Allow: /assets/js/> e <Sitemap: https://seudominio.com/sitemap.xml>. Para testar o que um User-agent em particular verá, simule esse agente ao buscar o arquivo.

Tipos de diretivas comuns em robots.txt

- User-agent — identifica o crawler a que as regras se aplicam (ex.: * para todos).

- Disallow — caminho que não deve ser rastreado (ex.: Disallow: /private/).

- Allow — permite explicitamente um subcaminho quando uma regra mais geral bloqueia (útil para assets).

- Sitemap — aponta para o(s) sitemap(s) XML.

- Crawl-delay — parâmetro não padronizado; alguns crawlers (por exemplo, motores menores ou Bing) o respeitam para reduzir taxa de rastreamento.

Como começar com robots.txt

1) Crie um arquivo de texto simples chamado robots.txt e coloque-o no diretório raiz do domínio. 2) Defina seções por User-agent e adicione Disallow/Allow conforme necessário. 3) Declare o(s) sitemap(s). 4) Não use robots.txt para proteger dados sensíveis — controles de acesso e autenticação são necessários para isso.

Exemplo mínimo:
User-agent: *
Disallow: /private/
Sitemap: https://seudominio.com/sitemap.xml

Erros comuns com robots.txt

- Bloquear CSS/JS críticos: impede renderização e pode reduzir a qualidade de indexação do Google. - Colocar robots.txt fora da raiz (subdiretório): o arquivo deve estar em https://seudominio.com/robots.txt. - Confiar em robots.txt para segurança: caminhos ficam públicos. - Sintaxe incorreta/encoding: use UTF-8 e linhas simples. - Esquecer versões com e sem www ou protocolos (http vs https): cada host/protocolo precisa do seu robots.txt.

Verificação e resolução de problemas: checklist técnico

- **robots.txt presente** — onde verificar: browser ou curl — passa quando https://seudominio.com/robots.txt retorna 200 e o conteúdo esperado.
- **Diretiva para User-agent alvo** — onde verificar: arquivo robots.txt — passa quando existe uma seção aplicável para o crawler que você quer controlar.
- **Não bloquear recursos críticos (CSS/JS)** — onde verificar: usar Chrome DevTools > Network e crawlers simulados — passa quando recursos necessários à renderização não são Disallow.
- **Sitemap declarado** — onde verificar: robots.txt ou página de sitemap — passa quando Sitemap: aponta para um XML acessível.
- **Resposta HTTP correta** — onde verificar: curl -I https://seudominio.com/robots.txt — passa quando o servidor retorna 200 e Content-Type adequado.
- **Encoding e formato** — onde verificar: abrir em editor/terminal — passa quando o arquivo está em UTF-8 sem BOM e linhas terminadas corretamente.
- **Testar por user-agent** — onde verificar: curl -A "Googlebot" https://seudominio.com/robots.txt e simulações locais — passa quando as regras aplicáveis aparecem ao agente simulado.

Comandos úteis

Para obter apenas os cabeçalhos: curl -I https://seudominio.com/robots.txt. Para buscar o conteúdo como um user-agent específico: curl -A "Googlebot" https://seudominio.com/robots.txt. Use Chrome DevTools (Network) para ver se recursos bloqueados são carregados durante renderização.

Ferramentas para verificação

- Google Search Console (se você controla o domínio): use Inspeção de URL para ver cobertura e logs relacionados; a ferramenta também indica problemas de acesso e recursos bloqueados. - Bing Webmaster Tools Site Explorer: verifique como o site é rastreado por Bing. - Ferramentas de linha de comando: curl e wget para simular user-agents e obter status HTTP. - Navegador/DevTools: verifique efeitos em tempo de execução e recursos bloqueados.

Tipos de robots.txt e variações práticas

- Arquivo simples para sites estáticos: poucas regras, foco em /private/. - Arquivo complexo para grandes sites: várias seções User-agent e regras Allow para preservar assets. - Arquivo para indexação seletiva: combinar robots.txt com meta robots (no caso de páginas próprias) — lembre que meta robots é aplicado apenas quando o crawler consegue acessar a página; se a página estiver bloqueada pelo robots.txt, o crawler não verá a meta tag.

Misturar robots.txt com meta robots e cabeçalhos X-Robots-Tag

Use meta robots (meta name="robots") ou cabeçalhos HTTP X-Robots-Tag para controlar indexação quando o crawler pode acessar a página. Se você bloquear a página no robots.txt, o crawler não verá essas instruções. Em síntese: robots.txt controla crawl; meta e X-Robots-Tag controlam indexação quando a página é acessível.

Leia o Technical SEO Guide

Perguntas frequentes

Construa autoridade com backlinks de qualidade: visite o marketplace para explorar opções de publishers relevantes

P: robots.txt impede que uma página apareça nos resultados de busca?

R: Nem sempre. robots.txt impede o crawl, mas motores podem indexar uma URL com base em links externos sem acessar o conteúdo. Para bloquear indexação, prefira meta robots no HTML ou cabeçalhos X-Robots-Tag quando a página for acessível.

P: Posso usar robots.txt para esconder arquivos sensíveis?

R: Não. robots.txt publica caminhos e não autentica acesso. Use controles de autenticação, regras do servidor ou políticas de privacidade para proteger dados sensíveis.

P: O arquivo precisa ser UTF-8?

R: Sim, use UTF-8 sem BOM para evitar problemas de parsing em alguns crawlers. Linhas simples e caracteres ASCII evitam ambiguidades.

P: robots.txt afeta links pagos ou afiliados?

R: robots.txt apenas controla crawl; políticas sobre links pagos devem seguir as diretrizes dos mecanismos de busca, que recomendam rel="sponsored" ou rel="nofollow" para links compensados. robots.txt não substitui estas práticas.

Termos relacionados