✨ Garanta 50% OFFno primeiro mês do Pro. Use o cupom:

TF-IDF: o que é e como funciona no SEO

Por Tiago CostaAtualizado em 2 de julho de 2026

Ilustração de um documento com palavras de pesos diferentes sobre uma balança, representando o cálculo do TF-IDF.
Definição

TF-IDF combina duas medidas para calcular o peso de uma palavra em um texto:

  • TF (Term Frequency): quantas vezes o termo aparece no documento;
  • IDF (Inverse Document Frequency): o quanto o termo é raro no corpus inteiro.

Multiplicando as duas, palavras frequentes na página e raras na web recebem peso alto, enquanto palavras comuns como "de" e "para" recebem peso baixo.

O que é TF-IDF e o que significa a sigla

TF-IDF é a sigla de Term Frequency, Inverse Document Frequency, ou frequência do termo pela frequência inversa nos documentos. Trata-se de uma medida estatística clássica da recuperação de informação, criada para responder a uma pergunta simples: dentro de um texto, quais palavras realmente importam para descrever o assunto?

A intuição é fácil de captar. Se a palavra fotossíntese aparece várias vezes em um artigo e quase não aparece nos outros textos da coleção, ela é um ótimo indício do tema daquele artigo. Já palavras como de, que e para aparecem em quase tudo, então não ajudam a distinguir um documento do outro e recebem peso baixo.

Por isso o TF-IDF virou base de motores de busca antigos, filtros de spam e sistemas de recomendação. Ele transforma texto em números que podem ser comparados, o primeiro passo para uma máquina entender do que uma palavra-chave está falando.

Como funciona a fórmula do TF-IDF

O TF-IDF é o produto de dois componentes calculados separadamente e depois multiplicados.

O TF (Term Frequency) mede a frequência do termo no documento. Na forma mais comum, é o número de vezes que a palavra aparece dividido pelo total de palavras do texto, para não penalizar documentos curtos nem inflar os longos.

O IDF (Inverse Document Frequency) mede o quanto o termo é raro no corpus. Ele é o logaritmo do total de documentos dividido pelo número de documentos que contêm aquele termo. Quanto mais raro o termo, maior o IDF; quanto mais comum, mais o IDF se aproxima de zero.

O resultado final é TF x IDF. Uma palavra só alcança peso alto quando é frequente naquele texto e incomum no conjunto. Se ela é frequente em toda parte, o IDF derruba o valor. Se é rara na coleção, mas nem aparece no documento, o TF zera a conta.

Infográfico da fórmula do TF-IDF mostrando TF (frequência no documento) multiplicado por IDF (raridade no corpus) igual ao peso do termo.
A fórmula do TF-IDF: TF (frequência no documento) multiplicado por IDF (raridade no corpus) resulta no peso do termo.

TF-IDF na prática: um exemplo passo a passo

Imagine um corpus de 1.000 artigos de um blog. Você quer saber o peso das palavras em um post sobre café especial. Veja três termos desse post:

TermoAparições no postDocumentos com o termoPeso relativo
de401.000Baixo
café18300Médio
torra925Alto

A palavra de aparece muito, mas está em todos os 1.000 documentos, então o IDF a leva quase a zero. Café é relevante, porém aparece em boa parte do blog, o que reduz seu peso. Já torra, presente em só 25 textos, ganha o maior peso relativo: é ela que melhor caracteriza aquele post específico.

Esse raciocínio explica por que encher o texto com o termo principal não funciona. Repetir a palavra alvo aumenta o TF, mas não muda o IDF, e ainda esbarra no keyword stuffing, a repetição artificial de palavras. O que enriquece o conteúdo é a presença natural dos termos de apoio, os que dão profundidade ao tema.

TF-IDF em SEO: para que serve de verdade

Vale um alerta importante: o TF-IDF não é um fator de ranqueamento direto do Google. O próprio Google já minimizou seu peso. Em declarações compiladas pelo Search Engine Journal, John Mueller descreveu o TF-IDF como uma métrica muito antiga e afirmou que ela nem é totalmente calculável, pois dependeria das estatísticas da web inteira. O buscador moderno usa modelos de linguagem e sinais bem mais sofisticados.

Ainda assim, o raciocínio por trás do TF-IDF continua útil como ferramenta de análise. Ele ajuda a mapear o vocabulário que os conteúdos que já ranqueiam usam para cobrir um tema, revelando termos de apoio que talvez faltem no seu texto. É um apoio ao SEO semântico, não um alvo em si.

Na prática, ferramentas de otimização de conteúdo usam variações do TF-IDF para sugerir palavras relacionadas. O erro é tratar a lista como meta a bater. O uso saudável é usá-la como checklist de cobertura: se o tema pede subtópicos que você esqueceu, o TF-IDF acende a luz.

TF-IDF, densidade de palavra-chave e LSI: o que é diferente

Esses três conceitos são fáceis de confundir, mas medem coisas distintas.

  • TF-IDF: pesa um termo no documento contra um corpus inteiro. É relativo e considera o restante da coleção.
  • Densidade de palavra-chave: a densidade de palavra-chave é só a porcentagem de vezes que um termo aparece em um texto, sem comparar com nada externo.
  • LSI: o conceito de LSI (indexação semântica latente) tenta descobrir relações de significado entre termos, indo além da contagem simples.

Na escala e no idioma da web real, nenhum desses cálculos é feito da forma pura que os manuais descrevem. Eles servem melhor como modelos mentais: o TF-IDF lembra que relevância é relativa, a densidade alerta contra exagero, e o LSI reforça a ideia de cobrir um tema por significado, não por repetição.

Ilustração comparando um texto que apenas repete a palavra-chave com um texto que cobre o tema usando vocabulário variado.

Como usar o raciocínio do TF-IDF no seu conteúdo

Você não precisa calcular logaritmos para se beneficiar da ideia. Um roteiro prático:

  • Estude quem já ranqueia: liste os termos de apoio recorrentes nos textos do topo e veja o que falta no seu.
  • Cubra o tema, não a palavra: em vez de repetir o termo alvo, traga variações, sinônimos e subtópicos que o assunto pede.
  • Evite o exagero: repetir a palavra principal não aumenta a relevância percebida e pode configurar spam.
  • Escreva para pessoas: um texto que responde bem à dúvida costuma incluir os termos certos de forma natural.
  • Use ferramentas como apoio, não como regra: listas de termos sugeridos ajudam a lembrar lacunas, mas o critério final é a clareza para o leitor.

No fim, o TF-IDF é mais valioso como forma de pensar do que como número a perseguir. Cobrir um assunto com profundidade e vocabulário rico é o que o buscador recompensa, com ou sem a fórmula na mão.

Dúvidas frequentes

Perguntas frequentes

O que é o algoritmo TF-IDF?

O TF-IDF é um método estatístico que atribui um peso a cada palavra de um texto, combinando a frequência do termo no documento (TF) com o quanto ele é raro em uma coleção de documentos (IDF). Palavras frequentes na página e raras no corpus recebem peso alto.

O que significa a sigla TF-IDF?

TF-IDF significa Term Frequency, Inverse Document Frequency, ou seja, frequência do termo pela frequência inversa nos documentos. A primeira parte mede a repetição na página, a segunda mede a raridade no conjunto de textos.

Para que serve o TF-IDF?

Serve para medir a importância relativa de uma palavra em um texto e é a base de motores de busca antigos, filtros de spam e sistemas de recomendação. No SEO atual, funciona como apoio de análise para mapear o vocabulário de um tema, não como fator de ranqueamento.

O que é o vetor TF-IDF?

É a representação de um documento como uma lista de números, em que cada posição guarda o peso TF-IDF de uma palavra do vocabulário. Esse vetor permite que algoritmos comparem textos por similaridade, agrupem documentos parecidos ou façam recomendações.

TF-IDF é um fator de ranqueamento do Google?

Não diretamente. O próprio Google já disse que é uma métrica antiga e que não a usa isoladamente. O valor do TF-IDF hoje está em ajudar a entender quais termos dão contexto a um assunto, apoiando a criação de conteúdo mais completo.

Conteúdo que cobre o tema inteiro, no automático

A Automarticles pesquisa os termos que o assunto pede e escreve artigos completos e otimizados para o seu blog, sem você precisar calcular nada.

Começar teste grátis
Continue aprendendo

Conceitos relacionados

Densidade de palavra-chaveDensidade de palavra-chave é a proporção de vezes que uma palavra-chave aparece em relação ao total de palavras de um texto, expressa em porcentagem. Ela é calculada dividindo o número de aparições do termo pela contagem total de palavras. Por muito tempo se acreditou em uma densidade ideal, mas hoje o Google entende contexto e sinônimos, então não existe número mágico: o que importa é usar a palavra-chave de forma natural, sem repetição forçada.LSILSI, sigla de Latent Semantic Indexing (indexação semântica latente), é uma técnica de recuperação de informação dos anos 1980 que identifica relações entre termos a partir dos padrões em que eles aparecem juntos em muitos documentos. No vocabulário de SEO, o nome acabou virando sinônimo das chamadas palavras-chave LSI, os termos semanticamente relacionados a um tema, ainda que o Google afirme não usar LSI em seu algoritmo.SEO semânticoSEO semântico é a prática de otimizar um conteúdo pelo seu significado, pelas entidades que ele cita e pelos tópicos que cobre, e não apenas pela repetição de uma palavra-chave exata. A ideia é ajudar buscadores como o Google a entender o contexto completo de um assunto, as relações entre os temas e a intenção por trás da busca. Quando o conteúdo cobre um tópico com profundidade e clareza, ele responde a muitas variações da mesma dúvida de uma vez e ganha relevância aos olhos de um algoritmo que hoje lê sentido, não só palavras soltas.Palavra-chavePalavra-chave é o termo ou a frase que uma pessoa digita em um buscador e que um site escolhe como alvo para aparecer nos resultados. Em SEO, ela é a ponte entre o que o público procura e o conteúdo que você publica: entender quais palavras-chave a sua audiência usa, com que intenção e com qual volume de busca é o ponto de partida de qualquer estratégia de conteúdo.