Dicas Gerais

Robots.txt: como controlar o rastreamento do site

Entenda os limites do robots.txt e escolha entre controle de rastreamento, noindex e proteção de acesso. Veja os detalhes.

Revisão técnica: 08/09/2026. Conteúdo reescrito; a data original de publicação foi preservada.

O robots.txt orienta o rastreamento de URLs por robôs que respeitam suas regras. Ele não exige senha, não impede o acesso de pessoas e não protege arquivos confidenciais. Uma URL bloqueada para rastreamento ainda pode aparecer nos resultados de busca.

Escolha o mecanismo conforme o objetivo

  • Para controlar o rastreamento, avalie regras no robots.txt.
  • Para evitar a indexação de uma página pública, use noindex na página ou no cabeçalho HTTP, mantendo acesso para o buscador ler a instrução.
  • Para proteger conteúdo privado, use autenticação e autorização no servidor ou na aplicação.

Não publique caminhos de backups ou senhas nesse arquivo como estratégia de proteção. O próprio robots.txt é público. Evite também bloquear recursos necessários para que o buscador compreenda a página, como CSS e JavaScript usados na renderização.

Entenda um exemplo simples

O arquivo deve ser texto simples em UTF-8, disponível na raiz do host, como https://www.example.com/robots.txt. Um exemplo didático é:

User-agent: *
Disallow: /catalogo-duplicado/
Sitemap: https://www.example.com/sitemap.xml

O grupo genérico pede aos robôs aos quais se aplica que não rastreiem o caminho indicado. A linha Sitemap informa a localização do mapa. Substitua os exemplos pelos caminhos reais somente depois de avaliar a finalidade de cada regra. Domínio principal e subdomínios precisam ser considerados separadamente.

Valide antes e depois de alterar

  1. Salve uma cópia do conteúdo atual e confira se o CMS ou algum plugin gera esse arquivo.
  2. Liste URLs que devem continuar acessíveis ao rastreador e as que pretende restringir.
  3. Depois de publicar, abra /robots.txt e confira o texto servido, incluindo possíveis efeitos de cache.
  4. Use o relatório de robots.txt e a inspeção de URLs do Search Console para acompanhar o resultado.

Uma regra ampla como Disallow: / pode bloquear o rastreamento do site. Não a utilize como solução para conteúdo antigo nem para tornar um ambiente de testes privado. Para uma página que mudou de endereço, avalie um redirecionamento permanente; para uma página inexistente, confira o tratamento correto do erro 404.

Referências: finalidade e limitações do robots.txt e criação e validação do arquivo.