robots.txt: o que é e como funciona
robots.txt é um arquivo de texto no diretório raiz do site que instrui crawlers sobre quais URLs e recursos podem ser rastreados; influencia crawling e indexação, mas não serve como mecanismo de segurança para dados sensíveis.

O que é robots.txt?
robots.txt é o arquivo do Robots Exclusion Protocol localizado no diretório raiz (https://seudominio.com/robots.txt). Ele contém diretivas simples — por exemplo User-agent e Disallow — que informam crawlers quais caminhos não devem ser visitados. Essas diretivas orientam o comportamento de rastreadores, mas não autenticar nem ocultar conteúdo de forma segura.
Por que robots.txt importa para SEO
robots.txt controla o que os crawlers podem acessar; isso afeta diretamente o volume e o custo do rastreamento e influencia que recursos o mecanismo de busca consegue renderizar. Importante: bloquear uma URL via robots.txt impede o crawl dessa URL, mas não garante que ela não apareça nos resultados a partir de links externos. Em outras palavras, robots.txt atua no estágio de crawling/indexação, não decide sozinho o posicionamento final (ranking), que depende de muitos sinais adicionais.
Como robots.txt funciona
Quando um crawler pede uma página, muitos bots solicitam primeiro /robots.txt para ler as regras aplicáveis ao seu User-agent. O parser do crawler procura a seção mais específica para o User-agent e aplica Allow/Disallow ao caminho solicitado. Se uma página estiver bloqueada, o crawler deve respeitar essa diretiva e não buscar o recurso; porém o motor de busca pode ainda indexar a URL sem conteúdo caso encontre referências externas.
Exemplos simples de diretivas em robots.txt: <User-agent: *>, <Disallow: /admin/>, <Allow: /assets/js/> e <Sitemap: https://seudominio.com/sitemap.xml>. Para testar o que um User-agent em particular verá, simule esse agente ao buscar o arquivo.
Tipos de diretivas comuns em robots.txt
- User-agent — identifica o crawler a que as regras se aplicam (ex.: * para todos).
- Disallow — caminho que não deve ser rastreado (ex.: Disallow: /private/).
- Allow — permite explicitamente um subcaminho quando uma regra mais geral bloqueia (útil para assets).
- Sitemap — aponta para o(s) sitemap(s) XML.
- Crawl-delay — parâmetro não padronizado; alguns crawlers (por exemplo, motores menores ou Bing) o respeitam para reduzir taxa de rastreamento.
Como começar com robots.txt
1) Crie um arquivo de texto simples chamado robots.txt e coloque-o no diretório raiz do domínio. 2) Defina seções por User-agent e adicione Disallow/Allow conforme necessário. 3) Declare o(s) sitemap(s). 4) Não use robots.txt para proteger dados sensíveis — controles de acesso e autenticação são necessários para isso.
Exemplo mínimo:
User-agent: *
Disallow: /private/
Sitemap: https://seudominio.com/sitemap.xml
Erros comuns com robots.txt
- Bloquear CSS/JS críticos: impede renderização e pode reduzir a qualidade de indexação do Google. - Colocar robots.txt fora da raiz (subdiretório): o arquivo deve estar em https://seudominio.com/robots.txt. - Confiar em robots.txt para segurança: caminhos ficam públicos. - Sintaxe incorreta/encoding: use UTF-8 e linhas simples. - Esquecer versões com e sem www ou protocolos (http vs https): cada host/protocolo precisa do seu robots.txt.
Verificação e resolução de problemas: checklist técnico
- **robots.txt presente** — onde verificar: browser ou curl — passa quando https://seudominio.com/robots.txt retorna 200 e o conteúdo esperado.
- **Diretiva para User-agent alvo** — onde verificar: arquivo robots.txt — passa quando existe uma seção aplicável para o crawler que você quer controlar.
- **Não bloquear recursos críticos (CSS/JS)** — onde verificar: usar Chrome DevTools > Network e crawlers simulados — passa quando recursos necessários à renderização não são Disallow.
- **Sitemap declarado** — onde verificar: robots.txt ou página de sitemap — passa quando Sitemap: aponta para um XML acessível.
- **Resposta HTTP correta** — onde verificar: curl -I https://seudominio.com/robots.txt — passa quando o servidor retorna 200 e Content-Type adequado.
- **Encoding e formato** — onde verificar: abrir em editor/terminal — passa quando o arquivo está em UTF-8 sem BOM e linhas terminadas corretamente.
- **Testar por user-agent** — onde verificar: curl -A "Googlebot" https://seudominio.com/robots.txt e simulações locais — passa quando as regras aplicáveis aparecem ao agente simulado.
Comandos úteis
Para obter apenas os cabeçalhos: curl -I https://seudominio.com/robots.txt. Para buscar o conteúdo como um user-agent específico: curl -A "Googlebot" https://seudominio.com/robots.txt. Use Chrome DevTools (Network) para ver se recursos bloqueados são carregados durante renderização.
Ferramentas para verificação
- Google Search Console (se você controla o domínio): use Inspeção de URL para ver cobertura e logs relacionados; a ferramenta também indica problemas de acesso e recursos bloqueados. - Bing Webmaster Tools Site Explorer: verifique como o site é rastreado por Bing. - Ferramentas de linha de comando: curl e wget para simular user-agents e obter status HTTP. - Navegador/DevTools: verifique efeitos em tempo de execução e recursos bloqueados.
Tipos de robots.txt e variações práticas
- Arquivo simples para sites estáticos: poucas regras, foco em /private/. - Arquivo complexo para grandes sites: várias seções User-agent e regras Allow para preservar assets. - Arquivo para indexação seletiva: combinar robots.txt com meta robots (no caso de páginas próprias) — lembre que meta robots é aplicado apenas quando o crawler consegue acessar a página; se a página estiver bloqueada pelo robots.txt, o crawler não verá a meta tag.
Misturar robots.txt com meta robots e cabeçalhos X-Robots-Tag
Use meta robots (meta name="robots") ou cabeçalhos HTTP X-Robots-Tag para controlar indexação quando o crawler pode acessar a página. Se você bloquear a página no robots.txt, o crawler não verá essas instruções. Em síntese: robots.txt controla crawl; meta e X-Robots-Tag controlam indexação quando a página é acessível.
Perguntas frequentes
P: robots.txt impede que uma página apareça nos resultados de busca?
R: Nem sempre. robots.txt impede o crawl, mas motores podem indexar uma URL com base em links externos sem acessar o conteúdo. Para bloquear indexação, prefira meta robots no HTML ou cabeçalhos X-Robots-Tag quando a página for acessível.
P: Posso usar robots.txt para esconder arquivos sensíveis?
R: Não. robots.txt publica caminhos e não autentica acesso. Use controles de autenticação, regras do servidor ou políticas de privacidade para proteger dados sensíveis.
P: O arquivo precisa ser UTF-8?
R: Sim, use UTF-8 sem BOM para evitar problemas de parsing em alguns crawlers. Linhas simples e caracteres ASCII evitam ambiguidades.
P: robots.txt afeta links pagos ou afiliados?
R: robots.txt apenas controla crawl; políticas sobre links pagos devem seguir as diretrizes dos mecanismos de busca, que recomendam rel="sponsored" ou rel="nofollow" para links compensados. robots.txt não substitui estas práticas.
Termos relacionados

Crawler: o que é e por que importa para SEO
Um crawler é um software automatizado que percorre páginas web para descoberta e coleta de conteúdo destinado à indexação por motores de busca; em 2026, crawlers usam a versão móvel como base e avaliam renderização por JavaScript.

Mecanismos de busca: definição, funcionamento e checklist
Mecanismos de busca são sistemas que descobrem, armazenam e organizam conteúdo web para responder consultas; em 2026 combinam sinais técnicos, semânticos e camadas de IA generativa que influenciam trechos e apresentações nos resultados.

Algoritmo de busca: o que é e por que importa
Um algoritmo de busca é um conjunto automatizado de regras e processos que motores de busca (Google, Bing) usam para descobrir, rastrear, indexar e ordenar páginas; hoje combina sinais de conteúdo, qualidade da experiência e resumos gerados por IA.

Classificações de motores de busca: definição e impacto
Classificações de motores de busca são as posições que páginas ocupam nas SERPs; resultam da avaliação de sinais como conteúdo, indexação, links e experiência do utilizador, e ajudam a priorizar esforços técnicos e de conteúdo de SEO.

Meta tags: definição, impacto e checklist SEO
Meta tags são elementos HTML no head que descrevem título, descrição, instruções de indexação e metadados sociais; comunicam conteúdo a motores de busca e plataformas, influenciam exibição e indexação sem garantir posições de ranking por si só.

SEO on-page: definição, funcionamento e checklist
SEO on-page é o conjunto de otimizações aplicadas na própria página — conteúdo, HTML, metadados, UX, desempenho e marcação estruturada — para tornar o conteúdo compreensível, indexável e mais relevante nas buscas.
