← Voltar aos estudos
SEGMENTAÇÃO DE CLIENTES DADO REAL · CÓDIGO ABERTO

RFV: quando pontuar não é suficiente — uma comparação com clusterização

Comparando RFV por Pontuação, K-Means, K-Medoids e HDBSCAN na mesma base de 5.878 clientes reais — com métrica de negócio, não só estatística

Por Thiago Rosa · TSR Insights · código completo no GitHub →

Todo time de CRM já usou alguma variação de RFV (Recência, Frequência, Valor) pra segmentar a base — é rápido, é intuitivo, e funciona. A dúvida que este estudo investiga é diferente de "RFV funciona?": é "o RFV por Pontuação clássico consegue separar adequadamente os clientes de maior valor dentro do próprio grupo topo, ou ele mistura outliers de altíssimo valor com clientes apenas engajados, só porque os dois empatam na soma de pontos?"

Testamos isso com dado real — não ilustrativo — sobre 5.878 clientes de um varejista online do Reino Unido (Online Retail II, UCI, licença aberta), comparando o RFV por Pontuação clássico contra três métodos de clusterização: K-Means, K-Medoids e HDBSCAN. Código completo, notebooks executáveis e dataset documentado no GitHub.

Conceito · RFV (Recência, Frequência, Valor)

Técnico: técnica de segmentação que pontua cada cliente em 3 dimensões — há quanto tempo comprou, com que frequência compra, quanto gasta — e combina as notas num score de negócio.

Em linguagem simples: uma forma de responder "quem são meus melhores clientes?" sem depender de achismo — mas a forma clássica de calcular isso (cortar cada dimensão em quintil e somar) tem uma limitação estrutural que este estudo mede.

5.878

clientes reais analisados

£17,7M

receita no período (2 anos)

4

métodos de segmentação comparados

2,14x

ganho de concentração do melhor método

1. O que o RFV por Pontuação já entrega

Antes de qualquer crítica: o RFV por Pontuação funciona. Cortando Recência, Frequência e Valor em quintis (1 a 5) e somando as notas, os "Campeões" — o grupo de maior pontuação — já isolam uma concentração de receita clássica de Pareto:

1.297 clientes (22,1% da base) respondem por 72,2% de toda a receita — um resultado de negócio genuinamente bom, sem nenhum algoritmo de Machine Learning envolvido.

Isso já seria suficiente pra justificar o método em qualquer operação de CRM. A pergunta que interessa não é "RFV por Pontuação presta?" — presta. É: dentro desse grupo de 1.297 "Campeões", todo mundo é igualmente valioso, ou existe uma mistura escondida?

2. O problema escondido dentro do grupo-topo

Rodamos K-Means sobre as mesmas 3 dimensões (com tratamento de assimetria via log-transform, já que Frequência e Valor têm cauda longa) e comparamos: dos 1.297 "Campeões" do método pontual, quantos são de fato o cluster de maior valor identificado pelo algoritmo?

Dentro do grupo "Campeões" do RFV por Pontuação, o K-Means revela dois perfis bem diferentes — não um grupo homogêneo.

Só 35,2% dos "Campeões" (456 clientes, valor médio £20.604) correspondem ao cluster VIP de fato identificado pelo K-Means. Os outros 64,1% (831 clientes) têm valor médio de apenas £4.095 — quase 5x menor — mas ainda caem no mesmo bucket "Campeões", porque a nota de quintil trata Recência, Frequência e Valor de forma independente, sem capturar a interação entre elas. Um cliente com boa recência e frequência alta, mas ticket médio moderado, pode empatar em soma de pontos com um outlier de compra grande e esporádica — e os dois recebem exatamente a mesma etiqueta de negócio.

3. Clusterização entra em cena: quanto vale a diferenciação?

Testamos três métodos de clusterização — K-Means, K-Medoids (que usa sempre um cliente real como "centro" do grupo, não uma média sintética) e HDBSCAN (que não exige escolher o número de grupos, e trata quem não se encaixa como "ruído"). A métrica de negócio mais direta pra comparar os quatro: quanta receita, em média, cada cliente do grupo-topo gera — não o total capturado (que depende do tamanho do grupo), mas a eficiência por cliente.

Receita média por cliente no grupo-topo de cada método — normalizada em "x" sobre o RFV por Pontuação (linha de base = 1,0x).

O K-Means vence com folga: seu grupo VIP (462 clientes, 7,9% da base) concentra 2,14x mais receita por cliente que os "Campeões" pontuais. O K-Medoids fica no meio (1,49x) — mais robusto a outliers, o que aqui significa um grupo maior e menos concentrado. E o resultado mais contraintuitivo do estudo: o HDBSCAN, o método estatisticamente mais sofisticado dos quatro, fica em último lugar (0,74x) — pior até que o corte simples por quintil.

Por que o método "mais avançado" perdeu

O HDBSCAN classifica 28,2% da base (1.658 clientes) como "ruído" — não um segmento, uma categoria de exclusão pra quem não se encaixa em nenhuma região densa. Esse grupo carrega 68,3% de toda a receita, o maior total dos quatro métodos — mas só porque é um grupo enorme e heterogêneo, não porque é eficiente. Ao normalizar por cliente, ele perde até pro método mais simples. "Capturar mais receita total" e "ser um grupo de alto valor por cliente" são coisas diferentes, e é fácil confundir uma com a outra.

4. Assimetria interna: nenhum método é perfeito

Olhar só a média pode enganar — é sensível a outliers dentro do próprio grupo-topo. Comparamos média e mediana de Valor em cada grupo-topo:

Razão entre valor médio e valor mediano no grupo-topo de cada método — quanto mais perto de 1,0x, mais homogêneo o grupo.

K-Means e K-Medoids têm quase a mesma razão (~2,13x–2,15x) — mesmo o cluster "mais concentrado" ainda tem um cliente mediano valendo menos da metade do cliente médio. O HDBSCAN dispara pra 4,21x, confirmando numericamente que seu "ruído" não é um grupo coeso — é uma mistura ampla de perfis muito diferentes entre si.

5. Trade-offs: nenhum método vence em tudo

A pergunta "qual modelo é melhor" não tem resposta fixa. Depende do que a decisão de negócio realmente exige:

CritérioRFV por PontuaçãoK-MeansK-MedoidsHDBSCAN
Concentração de receita por clienteBaseline (1,00x)Melhor (2,14x)Intermediária (1,49x)Pior de todos (0,74x)
Todo cliente recebe rótulo de negócio?SimSimSimNão — 28% viram "ruído"
Centro do grupo é um cliente real?N/ANão (média sintética)SimN/A (densidade, não centro)
Precisa escolher parâmetro (k)?NãoSimSimSó min. de cluster
Fácil de explicar pro time comercial?MuitoBaixoMédio (exemplo real)Baixo
Custo computacionalTrivialEscala bemMais pesado (O(n²))Sensível a parâmetro
Pronto pra usar direto no negócio?SimSimSimNão — precisa 2ª etapa

Na prática, a recomendação que sai deste estudo não é "sempre use K-Means" — é: combine os métodos por camada. RFV por Pontuação como régua operacional ampla (barata de manter, fácil de auditar); K-Means rodando por cima só pra identificar o subconjunto que justifica investimento por cliente mais alto (atendimento dedicado, benefícios exclusivos). Essa combinação — segmentação simples pra volume, modelo mais preciso pra decisão de alto risco/alto retorno — é como grandes operações de CRM já trabalham na prática.

O que este estudo não faz

RFV, em qualquer dos quatro métodos, é descritivo — descreve o comportamento passado, não prevê o futuro. Não é um modelo de churn nem de LTV projetado; é um próximo passo natural, não coberto aqui. Os números absolutos (valor em libras, faixas de recência) vêm de um varejista específico do Reino Unido e não generalizam sem reajuste pra outro setor ou geografia. E a escolha de k=5 (K-Means/K-Medoids) foi feita para comparabilidade com os 5 segmentos do método pontual — não é o valor estatisticamente ótimo em nenhum dos dois algoritmos, uma escolha documentada e não escondida no código.

Quer ver a metodologia completa, com todos os notebooks executáveis e o dado documentado? O código está aberto no GitHub — carga, limpeza, os 4 métodos de segmentação e a comparação final, tudo reprodutível.