✨ Garanta 50% OFFno primeiro mês do Pro. Use o cupom:

PerplexityBot: o que é o crawler do Perplexity e como controlar o rastreio do site

Por Tiago CostaAtualizado em 2 de julho de 2026

Ilustração de um robô com lupa lendo páginas e montando uma resposta com citações numeradas, representando o PerplexityBot.
Definição

PerplexityBot é o rastreador do Perplexity, o buscador com IA que responde perguntas citando fontes. Na prática, o PerplexityBot:

  • visita páginas públicas e as indexa para consulta;
  • ajuda o Perplexity a montar respostas com links para as origens;
  • se identifica pelo user-agent PerplexityBot nos registros do servidor;
  • deve respeitar o robots.txt, que é onde você libera ou bloqueia o acesso.

O que é o PerplexityBot

O PerplexityBot é o rastreador automatizado do Perplexity, uma ferramenta que mistura busca e inteligência artificial para responder perguntas em linguagem natural, sempre com links para as fontes. Para que essa resposta com citações exista, o Perplexity precisa antes conhecer o conteúdo da web, e é aí que entra o bot.

Como todo crawler, o PerplexityBot percorre páginas públicas, lê o texto e o guarda em um índice. A diferença em relação a um rastreador de treino puro está no uso: o material serve para o Perplexity encontrar e citar informações atuais na hora de responder, não apenas para treinar um modelo de uma vez só. Por isso o PerplexityBot valoriza conteúdo fresco e bem estruturado.

Para quem publica na web, isso muda a lógica da decisão. Bloquear o PerplexityBot protege o conteúdo, mas também tira o seu site da lista de fontes que o Perplexity pode citar, com links que trazem visitas de volta.

PerplexityBot e Perplexity-User: dois agentes, dois propósitos

Um detalhe que confunde muita gente é que o Perplexity opera mais de um agente, e cada um se comporta de um jeito. Entender a diferença é essencial para escrever regras que fazem o que você espera:

  • PerplexityBot: o rastreador que indexa a web de forma sistemática para abastecer o índice do buscador. É ele que você controla no robots.txt.
  • Perplexity-User: aciona uma visita a uma página específica quando um usuário faz uma pergunta que exige checar aquele endereço em tempo real. Por agir a pedido de uma pessoa, o Perplexity trata esse acesso de forma diferente do rastreio em massa.

Essa distinção tem consequências práticas. Uma regra que barra o PerplexityBot pode não afetar o agente que busca a pedido do usuário, o que costuma ser fonte de mal-entendidos sobre bloqueios que parecem não funcionar.

Infográfico do ciclo do PerplexityBot: rastrear, indexar, pergunta, resposta com fontes e clique de volta à página original.
Como o PerplexityBot vira resposta: da indexação da página à citação com link de volta à fonte.

Qual é o user-agent do PerplexityBot

Nos registros (logs) do seu servidor, o rastreador do Perplexity aparece com um user-agent que contém a palavra PerplexityBot, num formato parecido com PerplexityBot/1.0 acompanhado de um endereço de contato do Perplexity. O agente acionado por usuário aparece com o identificador Perplexity-User.

Saber ler esse identificador é o primeiro passo para monitorar quanto o Perplexity rastreia o seu site e para confirmar se um acesso é mesmo dele. Vale lembrar que o user-agent é só um texto declarado pelo próprio visitante, então ele pode ser copiado. A confirmação sólida vem de cruzar o nome com as faixas de IP oficiais e com o comportamento do acesso, e não apenas da linha que aparece no log.

Como permitir ou bloquear o PerplexityBot no robots.txt

O ponto de controle principal é o arquivo de robots.txt, na raiz do site. Para bloquear o rastreamento do PerplexityBot, use:

  • User-agent: PerplexityBot
  • Disallow: /

Para liberar, basta não bloquear, ou usar Allow: /. Se você quer barrar também o agente acionado por usuário, precisa de uma regra específica para o Perplexity-User, ciente de que o Perplexity argumenta que buscas feitas a pedido de uma pessoa funcionam como um navegador agindo por ela.

Aqui mora um alerta importante: o robots.txt depende da boa vontade do bot. E, no caso do Perplexity, essa boa vontade foi colocada em dúvida, como mostra a seção a seguir. Para conteúdo que você realmente precisa proteger, o robots.txt sozinho pode não bastar.

A polêmica do rastreamento furtivo do Perplexity

Nem todo rastreio do Perplexity aconteceu à luz do dia. Em 2025, a Cloudflare publicou uma investigação afirmando que, quando os bots declarados do Perplexity encontravam bloqueios, a empresa recorria a rastreadores não declarados que se disfarçavam de um navegador Chrome comum para acessar conteúdo de sites que haviam pedido para não ser rastreados. Segundo a Cloudflare, esse comportamento foi observado em dezenas de milhares de domínios e chegava a milhões de requisições por dia.

A Cloudflare relatou ter criado domínios novos e não divulgados, configurados para negar acesso a todos os bots, e ainda assim o Perplexity teria conseguido recuperar e exibir o conteúdo desses sites de teste. Em resposta, o Perplexity contestou a acusação, alegando que parte do tráfego atribuído a ele vinha de um serviço terceiro e que suas buscas a pedido de usuário agem como um navegador, não como um raspador de treino.

Independentemente do desfecho do debate, a lição para quem tem site é clara: o robots.txt é uma orientação, não uma barreira física. Se o objetivo é impedir o acesso de fato, e não apenas sinalizar a preferência, é preciso reforço técnico no servidor ou em um firewall de aplicação.

Ilustração de um robô disfarçado de navegador passando por um portão proibido e ignorando um robots.txt, representando o rastreamento furtivo atribuído ao Perplexity.

PerplexityBot e GEO: virar uma fonte citada

Do ponto de vista do GEO (Generative Engine Optimization), o Perplexity é um dos alvos mais interessantes, justamente porque ele cita e linka as fontes das respostas. Cada citação é uma chance real de aparecer para o usuário e de receber um clique de volta, algo que nem todo assistente de IA oferece.

Para ser um candidato a essa citação por IA, o caminho começa por liberar o PerplexityBot e seguir as boas práticas de conteúdo para motores de resposta: responder a pergunta de forma direta no início, sustentar as afirmações com dados e fontes, e organizar o texto em blocos fáceis de extrair. Conteúdo atual e específico tende a ser preferido, já que o Perplexity foca em responder com informação recente.

Como sinal complementar, o arquivo de llms.txt vem sendo adotado para indicar aos modelos qual conteúdo do site priorizar. Ele não obriga nada, mas ajuda a comunicar organização e intenção a quem quer ser bem representado nas respostas de IA, em vez de simplesmente sumir delas.

Dúvidas frequentes

Perguntas frequentes

O que é o PerplexityBot?

O PerplexityBot é o rastreador (crawler) do Perplexity, o buscador com IA que responde perguntas citando fontes. Ele indexa páginas públicas para abastecer o índice que o Perplexity consulta ao montar respostas. Identifica-se pelo user-agent PerplexityBot e deve respeitar o robots.txt.

Como bloquear o PerplexityBot?

No robots.txt, use User-agent: PerplexityBot e Disallow: / para barrar o rastreamento. Para o agente acionado por usuário, crie uma regra para o Perplexity-User. Como já houve relatos de rastreio furtivo, conteúdo sensível pede reforço no servidor ou em um firewall.

O Perplexity é gratuito?

O Perplexity tem uma versão gratuita com recursos básicos de busca e resposta, além de um plano pago com modelos mais avançados e limites maiores. Vale distinguir: o Perplexity é o produto que você usa; o PerplexityBot é o robô que rastreia a web para alimentar esse produto.

Qual é melhor, ChatGPT ou Perplexity?

Depende do uso. O Perplexity foca em responder perguntas com fontes citadas e links, o que ajuda a checar a informação. O ChatGPT é um assistente mais amplo, com forte capacidade de conversa e escrita. Para pesquisa com referências rastreáveis, o Perplexity costuma agradar.

Quanto custa o Perplexity Pro?

O Perplexity Pro é o plano pago do Perplexity, com preço na casa dos 20 dólares por mês (ou uma anuidade equivalente com desconto). Já existiram promoções de acesso gratuito por um período via parcerias, mas os valores mudam, então confirme sempre a tabela oficial.

Seja a fonte que a IA cita e linka

A Automarticles cria e otimiza os artigos do seu blog sozinha, com respostas objetivas e fontes claras que aumentam a chance de ser citado por buscadores de IA como o Perplexity.

Começar teste grátis
Continue aprendendo

Conceitos relacionados

ClaudeBotClaudeBot é o rastreador (crawler) da Anthropic, a empresa por trás do assistente de IA Claude. Ele percorre páginas públicas da web para coletar conteúdo que ajuda a treinar e a alimentar os modelos Claude. Assim como o Googlebot faz pela busca, o ClaudeBot se identifica por um user-agent próprio, respeita o arquivo robots.txt e pode ser liberado ou bloqueado por qualquer site. Decidir o que fazer com ele virou parte da estratégia de quem quer, ou não quer, aparecer nas respostas de IA.OAI-SearchBotOAI-SearchBot é o rastreador (crawler) que a OpenAI usa para alimentar a busca do ChatGPT, ou seja, para descobrir e indexar páginas que podem virar fonte citada nas respostas com busca em tempo real. Ele é diferente do GPTBot, que coleta conteúdo para treinar os modelos, e do ChatGPT-User, que age quando o usuário pede uma ação. Entender essa separação é o que permite aparecer na busca do ChatGPT sem necessariamente liberar o seu conteúdo para o treino.Answer engineAnswer engine, ou motor de resposta, é qualquer sistema de busca que devolve uma resposta direta e já sintetizada em vez de uma lista de links azuis. Em vez de mandar a pessoa clicar em vários resultados, ele lê várias fontes, resume e entrega a resposta pronta ali mesmo. Entram nessa categoria os AI Overviews do Google, assistentes de IA como ChatGPT, Perplexity e Gemini, os assistentes de voz e até os featured snippets tradicionais. É a mudança que faz o SEO evoluir para virar fonte citada, não só link clicado.Robots.txtRobots.txt é um arquivo de texto simples, salvo na raiz do domínio, que orienta os robôs dos buscadores sobre quais partes de um site eles podem ou não rastrear. Ele segue o Protocolo de Exclusão de Robôs e controla o rastreamento, não a indexação, por isso não é a ferramenta certa para esconder uma página dos resultados de busca.