PerplexityBot: o que é o crawler do Perplexity e como controlar o rastreio do site
Por Tiago CostaAtualizado em 2 de julho de 2026

PerplexityBot é o rastreador do Perplexity, o buscador com IA que responde perguntas citando fontes. Na prática, o PerplexityBot:
- visita páginas públicas e as indexa para consulta;
- ajuda o Perplexity a montar respostas com links para as origens;
- se identifica pelo user-agent PerplexityBot nos registros do servidor;
- deve respeitar o robots.txt, que é onde você libera ou bloqueia o acesso.
O que é o PerplexityBot
O PerplexityBot é o rastreador automatizado do Perplexity, uma ferramenta que mistura busca e inteligência artificial para responder perguntas em linguagem natural, sempre com links para as fontes. Para que essa resposta com citações exista, o Perplexity precisa antes conhecer o conteúdo da web, e é aí que entra o bot.
Como todo crawler, o PerplexityBot percorre páginas públicas, lê o texto e o guarda em um índice. A diferença em relação a um rastreador de treino puro está no uso: o material serve para o Perplexity encontrar e citar informações atuais na hora de responder, não apenas para treinar um modelo de uma vez só. Por isso o PerplexityBot valoriza conteúdo fresco e bem estruturado.
Para quem publica na web, isso muda a lógica da decisão. Bloquear o PerplexityBot protege o conteúdo, mas também tira o seu site da lista de fontes que o Perplexity pode citar, com links que trazem visitas de volta.
PerplexityBot e Perplexity-User: dois agentes, dois propósitos
Um detalhe que confunde muita gente é que o Perplexity opera mais de um agente, e cada um se comporta de um jeito. Entender a diferença é essencial para escrever regras que fazem o que você espera:
- PerplexityBot: o rastreador que indexa a web de forma sistemática para abastecer o índice do buscador. É ele que você controla no robots.txt.
- Perplexity-User: aciona uma visita a uma página específica quando um usuário faz uma pergunta que exige checar aquele endereço em tempo real. Por agir a pedido de uma pessoa, o Perplexity trata esse acesso de forma diferente do rastreio em massa.
Essa distinção tem consequências práticas. Uma regra que barra o PerplexityBot pode não afetar o agente que busca a pedido do usuário, o que costuma ser fonte de mal-entendidos sobre bloqueios que parecem não funcionar.

Qual é o user-agent do PerplexityBot
Nos registros (logs) do seu servidor, o rastreador do Perplexity aparece com um user-agent que contém a palavra PerplexityBot, num formato parecido com PerplexityBot/1.0 acompanhado de um endereço de contato do Perplexity. O agente acionado por usuário aparece com o identificador Perplexity-User.
Saber ler esse identificador é o primeiro passo para monitorar quanto o Perplexity rastreia o seu site e para confirmar se um acesso é mesmo dele. Vale lembrar que o user-agent é só um texto declarado pelo próprio visitante, então ele pode ser copiado. A confirmação sólida vem de cruzar o nome com as faixas de IP oficiais e com o comportamento do acesso, e não apenas da linha que aparece no log.
Como permitir ou bloquear o PerplexityBot no robots.txt
O ponto de controle principal é o arquivo de robots.txt, na raiz do site. Para bloquear o rastreamento do PerplexityBot, use:
- User-agent: PerplexityBot
- Disallow: /
Para liberar, basta não bloquear, ou usar Allow: /. Se você quer barrar também o agente acionado por usuário, precisa de uma regra específica para o Perplexity-User, ciente de que o Perplexity argumenta que buscas feitas a pedido de uma pessoa funcionam como um navegador agindo por ela.
Aqui mora um alerta importante: o robots.txt depende da boa vontade do bot. E, no caso do Perplexity, essa boa vontade foi colocada em dúvida, como mostra a seção a seguir. Para conteúdo que você realmente precisa proteger, o robots.txt sozinho pode não bastar.
A polêmica do rastreamento furtivo do Perplexity
Nem todo rastreio do Perplexity aconteceu à luz do dia. Em 2025, a Cloudflare publicou uma investigação afirmando que, quando os bots declarados do Perplexity encontravam bloqueios, a empresa recorria a rastreadores não declarados que se disfarçavam de um navegador Chrome comum para acessar conteúdo de sites que haviam pedido para não ser rastreados. Segundo a Cloudflare, esse comportamento foi observado em dezenas de milhares de domínios e chegava a milhões de requisições por dia.
A Cloudflare relatou ter criado domínios novos e não divulgados, configurados para negar acesso a todos os bots, e ainda assim o Perplexity teria conseguido recuperar e exibir o conteúdo desses sites de teste. Em resposta, o Perplexity contestou a acusação, alegando que parte do tráfego atribuído a ele vinha de um serviço terceiro e que suas buscas a pedido de usuário agem como um navegador, não como um raspador de treino.
Independentemente do desfecho do debate, a lição para quem tem site é clara: o robots.txt é uma orientação, não uma barreira física. Se o objetivo é impedir o acesso de fato, e não apenas sinalizar a preferência, é preciso reforço técnico no servidor ou em um firewall de aplicação.

PerplexityBot e GEO: virar uma fonte citada
Do ponto de vista do GEO (Generative Engine Optimization), o Perplexity é um dos alvos mais interessantes, justamente porque ele cita e linka as fontes das respostas. Cada citação é uma chance real de aparecer para o usuário e de receber um clique de volta, algo que nem todo assistente de IA oferece.
Para ser um candidato a essa citação por IA, o caminho começa por liberar o PerplexityBot e seguir as boas práticas de conteúdo para motores de resposta: responder a pergunta de forma direta no início, sustentar as afirmações com dados e fontes, e organizar o texto em blocos fáceis de extrair. Conteúdo atual e específico tende a ser preferido, já que o Perplexity foca em responder com informação recente.
Como sinal complementar, o arquivo de llms.txt vem sendo adotado para indicar aos modelos qual conteúdo do site priorizar. Ele não obriga nada, mas ajuda a comunicar organização e intenção a quem quer ser bem representado nas respostas de IA, em vez de simplesmente sumir delas.