✨ Garanta 50% OFFno primeiro mês do Pro. Use o cupom:

Robots.txt: o que é e como usar o arquivo no seu site

Por Tiago CostaAtualizado em 2 de julho de 2026

Ilustração de um robô diante do portão de um site segurando uma lista, com placas de permitido e bloqueado, representando o arquivo robots.txt.
Definição

Robots.txt é um arquivo de texto simples, salvo na raiz do domínio (em seudominio.com/robots.txt), que orienta os robôs dos buscadores sobre quais partes do site eles podem rastrear. Ele costuma conter:

  • uma linha User-agent que nomeia o robô alvo;
  • regras Disallow para os caminhos que não devem ser rastreados;
  • regras Allow que abrem exceções;
  • uma linha Sitemap que aponta o mapa do site.

O que é o arquivo robots.txt

Robots.txt é um arquivo de texto simples, salvo na raiz do domínio (em seudominio.com/robots.txt), que orienta os robôs dos buscadores sobre quais partes do site eles podem ou não rastrear. Ele é a porta de entrada que todo crawler educado consulta antes de percorrer as páginas.

O arquivo segue o Protocolo de Exclusão de Robôs (REP, na sigla em inglês), um padrão criado em 1994 e adotado por praticamente todos os buscadores. As regras são públicas: qualquer pessoa pode abrir o robots.txt de um site digitando o endereço no navegador.

Vale entender o papel dele desde já: o robots.txt controla o rastreamento, não a indexação. Ou seja, ele diz por onde o robô pode andar, mas não é a ferramenta certa para esconder uma página dos resultados de busca.

Como o robots.txt funciona na prática

Sempre que um buscador visita um site, a primeira coisa que o motor de busca faz é procurar o arquivo em /robots.txt. Se ele existe, o robô lê as instruções e as respeita; se não existe, o robô assume que pode rastrear tudo.

As regras são organizadas em blocos, cada um começando por um User-agent (o robô alvo) seguido de linhas Disallow e Allow. Um exemplo típico:

  • User-agent: * aplica a regra a todos os robôs;
  • Disallow: /admin/ pede que não rastreiem a pasta de administração;
  • Allow: /admin/ajax.php abre uma exceção dentro da pasta bloqueada;
  • Sitemap: https://seudominio.com/sitemap.xml aponta o mapa do site.

É importante lembrar que essas regras são uma orientação, não uma trava. Robôs legítimos como o Googlebot obedecem, mas robôs maliciosos podem simplesmente ignorar o arquivo.

Infográfico da anatomia de um arquivo robots.txt mostrando as diretivas User-agent, Disallow, Allow e Sitemap empilhadas.
Anatomia de um arquivo robots.txt: as diretivas empilhadas de cima para baixo.

Sintaxe e principais diretivas

O robots.txt aceita um conjunto pequeno de diretivas. Conhecer cada uma evita bloqueios acidentais:

DiretivaO que faz
User-agentDefine a qual robô as regras seguintes se aplicam (use * para todos).
DisallowIndica um caminho que o robô não deve rastrear.
AllowLibera um caminho específico dentro de uma área bloqueada.
SitemapInforma a URL do sitemap XML para ajudar na descoberta de páginas.

Há limites técnicos a respeitar. Segundo a documentação do Google Search Central, o Googlebot processa apenas os primeiros 500 kibibytes (cerca de 512 KB) de um arquivo robots.txt e ignora tudo o que vier depois desse limite. Diretivas antigas como Crawl-delay, aliás, não são interpretadas pelo Google.

Robots.txt não bloqueia a indexação

Esse é o mal-entendido mais caro do robots.txt. Bloquear uma página com Disallow impede o robô de ler o conteúdo, mas não garante que ela fique fora do Google. Se outras páginas apontam links para ela, o buscador pode indexar a URL mesmo sem rastreá-la, exibindo o resultado sem descrição.

A própria documentação do Google Search Central avisa que o robots.txt não serve para manter uma página fora dos resultados de busca. Para isso existe a diretiva noindex, aplicada na própria página.

Há ainda uma armadilha: se você bloqueia a página no robots.txt, o Google não consegue ler a tag noindex dentro dela e o comando nunca é obedecido. A regra prática para tirar algo da busca é o contrário do intuitivo: deixe o robô rastrear e use o noindex. Entender a diferença entre rastreamento e indexação resolve a maioria desses casos.

Ilustração de uma página bloqueada por cadeado que ainda aparece nos resultados de busca sem descrição, mostrando que Disallow não é o mesmo que noindex.

Onde fica o robots.txt e como criar no WordPress

O robots.txt fica sempre na raiz do domínio, acessível em seudominio.com/robots.txt. Não existe robots.txt por subpasta: cada domínio (e subdomínio) tem o seu.

No WordPress, o sistema gera um arquivo virtual automático quando não há um físico. Para assumir o controle, você pode:

  • usar um plugin de SEO como Yoast ou Rank Math, que oferece um editor de robots.txt direto no painel;
  • criar um arquivo físico chamado robots.txt na pasta raiz da instalação, via FTP ou gerenciador de arquivos;
  • ativar a opção de robots.txt personalizado do plugin, que substitui o arquivo virtual pelas suas próprias regras.

Ativar o robots.txt personalizado significa justamente trocar o arquivo padrão gerado pela plataforma por uma versão editável, em que você define manualmente o que liberar e o que bloquear.

Erros comuns e boas práticas

Por ser um arquivo pequeno e poderoso, o robots.txt causa estragos quando mal configurado. Os deslizes mais frequentes:

  • Bloquear o site inteiro: um Disallow: / esquecido após o desenvolvimento tira todas as páginas do rastreamento.
  • Bloquear CSS e JavaScript: impedir esses arquivos atrapalha o Google a renderizar a página e pode prejudicar a avaliação.
  • Confiar no robots.txt para privacidade: como o arquivo é público, listar pastas sensíveis nele acaba entregando o caminho.
  • Esquecer o sitemap: incluir a linha Sitemap ajuda o buscador a descobrir suas URLs mais rápido.

Depois de qualquer alteração, teste o arquivo no Google Search Console e trate o robots.txt como parte da sua rotina de SEO técnico. Um bom uso também ajuda a direcionar o orçamento de rastreamento para as páginas que realmente importam.

Dúvidas frequentes

Perguntas frequentes

O que é ativar robots.txt personalizado?

Ativar o robots.txt personalizado é substituir o arquivo automático que a plataforma gera por uma versão editável, criada por você. Em plugins como Yoast e Rank Math, essa opção libera um editor onde você define manualmente quais áreas do site liberar (Allow) e quais bloquear (Disallow).

Onde fica o arquivo robots.txt no WordPress?

Ele fica na raiz do domínio, em seudominio.com/robots.txt. No WordPress, por padrão o arquivo é virtual (gerado pelo sistema). Para editá-lo, use um plugin de SEO ou crie um arquivo físico robots.txt na pasta raiz da instalação via FTP.

Qual é a principal função do arquivo robots.txt em um site no contexto de SEO?

Orientar os rastreadores sobre quais partes do site podem ou não ser acessadas, poupando o rastreamento de páginas irrelevantes e ajudando a direcionar o orçamento de rastreamento para o conteúdo importante. Ele controla o rastreamento, não a indexação.

O que faz o Googlebot?

O Googlebot é o robô rastreador do Google. Ele percorre a web seguindo links, lê o robots.txt de cada site para saber o que pode acessar e envia as páginas permitidas para serem processadas e, se for o caso, indexadas nos resultados de busca.

Deixe a parte técnica do seu blog no automático

A Automarticles cria, otimiza e publica os artigos do seu blog sozinha, cuidando de SEO técnico e rastreamento para você focar no negócio.

Começar teste grátis
Continue aprendendo

Conceitos relacionados

CrawlerCrawler é um programa robô que percorre a web de link em link, baixando e lendo páginas para alimentar o índice de um buscador. Também chamado de spider, robô ou bot, o exemplo mais conhecido é o Googlebot. O crawler é a primeira etapa da busca: antes de uma página poder ser indexada e ranqueada, ela precisa ser encontrada e lida por um desses rastreadores.Sitemap XMLSitemap XML é um arquivo em formato XML que lista as URLs importantes de um site para ajudar os buscadores a descobrir, rastrear e priorizar essas páginas. Ele funciona como um mapa do site entregue ao Google, informando quais endereços existem e, opcionalmente, quando foram atualizados, o que é especialmente útil em sites grandes, novos ou com páginas pouco conectadas por links internos.NoindexNoindex é uma diretiva que diz aos buscadores para não incluir uma página nos resultados de pesquisa. Ela é aplicada por uma meta tag robots no HTML ou por um cabeçalho HTTP, e faz o Google remover a página do índice mesmo que outros sites apontem para ela. Ao contrário do robots.txt, que bloqueia o rastreamento, o noindex exige que a página continue rastreável para que o buscador leia a instrução.IndexaçãoIndexação é o processo pelo qual o buscador adiciona uma página ao seu índice, o enorme banco de dados que ele consulta para responder às pesquisas. Depois de rastrear e analisar o conteúdo, o Google decide se armazena a página no índice, e só o que está indexado pode aparecer nos resultados. Em SEO, garantir a indexação é o passo obrigatório antes de qualquer tentativa de ranquear: uma página fora do índice é, na prática, invisível para quem pesquisa.