Agendar reunião
SEO

O que é Robots.txt? O que bloquear e o que liberar

Sintaxe do robots.txt, diretivas que funcionam, diferença entre bloquear e desindexar e como testar antes de publicar. Com modelos prontos.

Porta imponente entreaberta com luz dourada saindo por uma fresta, em paisagem escura de montanhas, representando o controle de acesso ao site

Existe um arquivo de texto minúsculo, com poucas linhas, que tem poder para tirar o seu site inteiro do Google. É o robots.txt. Ele fica na raiz do seu site, é o primeiro lugar que o robô do Google visita ao chegar, e uma única linha errada nele pode bloquear todo o seu conteúdo dos resultados de busca. Ao mesmo tempo, bem configurado, ele é uma ferramenta útil para orientar o rastreamento. Poucos arquivos combinam tanto poder com tanto risco.

Este guia explica o que é o robots.txt, o que ele faz e o que não faz, quais diretivas funcionam de verdade, a diferença crucial entre bloquear e desindexar, e como testar antes de publicar. Com modelos prontos para adaptar ao seu site.

O que é o robots.txt

O robots.txt é um arquivo de texto simples que fica na raiz do seu site e dá instruções aos robôs dos mecanismos de busca sobre o que eles podem ou não rastrear. Quando o robô do Google chega ao seu site, esse arquivo é a primeira coisa que ele consulta, antes de qualquer página.

A função dele é orientar o rastreamento, não a indexação. Essa distinção parece sutil, mas é a origem de quase todos os erros graves com robots.txt, e vamos voltar a ela em detalhe mais adiante. Por ora, guarde que o robots.txt diz por onde o robô pode andar, não o que ele deve ou não mostrar nos resultados.

Ele é uma peça central do SEO técnico, trabalhando junto com o crawler, que é o robô que percorre a web. Se o crawler é o visitante, o robots.txt é a placa na entrada dizendo quais corredores estão abertos e quais estão fechados.

Como o robots.txt funciona

O arquivo funciona com base em regras simples, que combinam três elementos principais.

O primeiro é o agente, que identifica a qual robô a regra se aplica. Você pode criar regras para todos os robôs de uma vez ou para um robô específico, como o do Google. Na maioria dos casos, as regras valem para todos.

O segundo é a diretiva de bloqueio, que indica quais caminhos o robô não deve rastrear. É com ela que você impede o robô de gastar tempo em áreas irrelevantes do site, como pastas de sistema ou páginas de função interna.

O terceiro é a diretiva de liberação, que abre exceções dentro de uma área bloqueada. Serve para dizer “não entre nesta pasta, exceto neste arquivo específico”.

Além dessas, o robots.txt costuma incluir a indicação do endereço do seu sitemap XML, o que ajuda o robô a encontrar a lista completa das suas páginas logo na chegada. É uma boa prática que conecta os dois arquivos de forma inteligente.

A diferença entre bloquear e desindexar

Este é o ponto mais importante do guia, e o que mais gera confusão perigosa. Bloquear no robots.txt não é a mesma coisa que remover do Google.

Quando você bloqueia uma página no robots.txt, você impede o robô de rastreá-la, ou seja, de ler o conteúdo dela. Mas isso não a remove necessariamente dos resultados. Se outros sites apontam links para essa página, o Google pode continuar exibindo o endereço dela nos resultados, só que sem conseguir ler o conteúdo, mostrando um resultado vazio e sem descrição. O efeito é o pior dos dois mundos: a página aparece feia e o Google não sabe o que há nela.

Para de fato remover uma página dos resultados, o caminho é outro: uma tag específica de não indexação dentro da própria página, que só funciona se o robô conseguir rastreá-la. E aqui está a armadilha: se você bloqueia a página no robots.txt, o robô nunca lê a tag de não indexação, e a remoção não acontece. Os dois métodos se anulam quando usados juntos por engano.

A regra prática: use o robots.txt para economizar rastreamento em áreas sem valor, e use a tag de não indexação para tirar páginas específicas dos resultados. Nunca confie no robots.txt para esconder algo dos resultados de busca.

O erro que apaga o site inteiro

Existe uma configuração que, colocada por engano, bloqueia todo o site de uma vez. É uma diretiva que impede qualquer robô de rastrear qualquer página.

Isso acontece com mais frequência do que se imagina, por um motivo específico: muitos sites em desenvolvimento usam esse bloqueio total de propósito, para não aparecerem no Google enquanto estão sendo construídos. O problema é esquecer de remover o bloqueio quando o site vai ao ar. O site é lançado, tudo parece certo, e semanas depois vem a descoberta de que ele nunca apareceu no Google porque o bloqueio de desenvolvimento continuou lá.

Por isso, a primeira coisa a conferir em qualquer site recém-lançado, ou que sofreu queda inexplicável de tráfego, é o robots.txt. É uma verificação de trinta segundos que pode explicar um desastre. Essa checagem é item obrigatório de toda auditoria de SEO, justamente por ser um erro comum, grave e fácil de passar despercebido.

O que colocar e o que não colocar

Um bom robots.txt é enxuto. Quanto menos regras, menor a chance de erro.

Vale bloquear áreas que não têm valor de busca e que só desperdiçariam o rastreamento, como pastas de administração do sistema, páginas de função interna e áreas que geram conteúdo duplicado sem propósito. Isso ajuda a direcionar a atenção do Google para o que importa.

Não vale bloquear páginas que você quer remover dos resultados, porque, como vimos, o robots.txt não faz isso. Também não vale bloquear recursos que o Google precisa para entender a página, como certos arquivos de estilo e script, porque sem eles o robô pode enxergar uma versão quebrada do seu site e avaliá-lo mal.

E, fundamental, nunca use o robots.txt como ferramenta de segurança. Bloquear uma pasta ali não a esconde de quem quiser acessá-la, apenas pede para os robôs bem-comportados não entrarem. Informação sensível precisa de proteção de verdade, não de uma linha no robots.txt.

Como testar antes de publicar

Dado o poder do arquivo, testar antes de aplicar não é opcional. Um erro aqui é caro.

O Google Search Console oferece ferramentas para verificar como o robô interpreta o seu robots.txt e para testar se uma URL específica está bloqueada ou liberada. Antes de subir qualquer alteração, vale simular o comportamento ali e confirmar que as páginas importantes continuam acessíveis ao robô.

Depois de publicar, confira de novo. Acesse o endereço do seu robots.txt diretamente no navegador, ele fica sempre no mesmo lugar, na raiz do site seguida de robots.txt, e leia o conteúdo com calma. Confirme que nenhuma regra bloqueia o que deveria estar aberto. Essa leitura final de trinta segundos evita a maioria dos desastres.

Perguntas frequentes sobre robots.txt

Todo site precisa de um robots.txt?

Não é obrigatório, mas é altamente recomendado. Sem ele, o robô rastreia tudo que encontra, o que costuma funcionar em sites pequenos. Um robots.txt bem feito dá controle sobre o rastreamento e evita desperdício, o que faz diferença conforme o site cresce.

Bloquear uma página no robots.txt a remove do Google?

Não, e essa é a confusão mais perigosa. Bloquear impede o robô de ler o conteúdo, mas a página ainda pode aparecer nos resultados se houver links para ela, só que sem descrição. Para remover de fato, use uma tag de não indexação na própria página, sem bloqueá-la no robots.txt.

Onde fica o arquivo robots.txt?

Ele fica sempre na raiz do site, acessível ao adicionar /robots.txt ao final do seu domínio. Esse local é fixo: o robô do Google sempre procura ali e em nenhum outro lugar. Um robots.txt em qualquer outra pasta simplesmente não é lido.

Posso ter um robots.txt no WordPress sem mexer em código?

Sim. Os principais plugins de SEO permitem editar o robots.txt diretamente pelo painel do WordPress, sem acessar arquivos do servidor. É o caminho mais seguro para a maioria dos usuários, porque reduz o risco de erros de manuseio.

O que acontece se eu não tiver robots.txt?

O robô assume que pode rastrear tudo. Para sites pequenos e bem estruturados, isso raramente é um problema. Para sites grandes, a ausência de robots.txt pode levar ao desperdício de rastreamento em páginas irrelevantes, deixando menos atenção para o conteúdo que importa.

Devo incluir o sitemap no robots.txt?

Sim, é uma boa prática. Indicar o endereço do seu sitemap XML dentro do robots.txt ajuda o robô a encontrar a lista completa de páginas logo na chegada, reforçando o que você já enviou pelo Search Console. É uma linha simples que melhora a descoberta.

Não deixe uma linha de texto derrubar seu site

O robots.txt é pequeno, mas o estrago que ele causa quando mal configurado é enorme. Um site inteiro pode ficar invisível no Google por causa de uma única regra esquecida, e a causa costuma passar despercebida por semanas.

Solicite uma auditoria de SEO com a Malamute Digital e confirme que o seu robots.txt está liberando o que importa e bloqueando só o que deve, com o cuidado de quem trata SEO técnico como a fundação de todo o resto.

Quer transformar busca orgânica em receita?