Medi as 1.337 páginas do meu site. 465 palavras se repetiam em todas.
Rhaideline Calazans
Fundadora, Calazans Lumina

Resumo (TL;DR)
Páginas irmãs de uma malha por cidade tendem a repetir os mesmos blocos. Medi as do meu site: 465 de cada 1.050 palavras eram idênticas, e só 89 das 1.337 páginas recebiam impressão. Tirando dois blocos repetidos, a sobreposição caiu de 56% para 35%. O método de medição está aqui, com o código.
O sintoma que eu ignorei por semanas
O site tinha 1.337 páginas publicadas. Uma para cada cidade atendida e uma para cada combinação de serviço com cidade. A malha estava no ar, o sitemap enviado, o Search Console conectado.
E o relatório dizia isto: 89 páginas com alguma impressão nos últimos 28 dias.
Oitenta e nove de mil trezentas e trinta e sete. O resto existia e ninguém via.
A explicação fácil seria "o domínio é novo, falta autoridade". É verdade em parte, e é insuficiente. Domínio novo faz as páginas subirem devagar — não faz 93% delas ficarem invisíveis enquanto as outras 7% aparecem. Tinha outra coisa.
O que eu fui medir
A suspeita era duplicata. Malha programática morre disso: as páginas irmãs ficam parecidas demais, o buscador entende que são a mesma coisa, escolhe uma e engaveta as outras.
Só que "parecidas demais" não é diagnóstico. Precisa de número.
O jeito certo de medir é comparar trigramas de palavra — sequências de três palavras seguidas. Duas páginas que compartilham muitos trigramas compartilham redação, não só vocabulário. A medida é o índice de Jaccard: quantos trigramas as duas têm em comum, dividido pelo total de trigramas distintos entre elas.
```
similaridade = trigramas em comum / trigramas totais
```
A armadilha que quase me deu o número errado
Na primeira medição eu comparei o HTML inteiro das páginas e deu 65%. Número assustador, e errado.
Cabeçalho, menu e rodapé são idênticos em toda página do site. Eles entram nos dois lados da conta — aumentam o numerador e o denominador ao mesmo tempo — e empurram o resultado para cima artificialmente. Quanto mais navegação o site tem, mais alto o número fica, independentemente do conteúdo.
Medir só o miolo. Na prática: pegar o conteúdo de dentro do `<main>`, remover `<header>`, `<nav>` e `<footer>`, tirar as tags, e comparar o texto que sobra. É esse texto que deveria ser diferente de cidade para cidade.
Refeita a medição, os números honestos:
| Comparação | Sobreposição |
|---|---|
| Duas páginas de cidade | 60,5% |
| Mesmo serviço, cidades diferentes | 55 a 58% |
| Mesma cidade, serviços diferentes | 64% |
O último é o pior e o mais revelador. Duas páginas da mesma cidade, para serviços diferentes, eram 64% a mesma página. Se nem o serviço muda o texto, o texto não está falando do serviço.
Descobrindo onde a repetição morava
Saber que são 60% não conserta nada. Precisa saber quais blocos repetem.
Então eu quebrei cada página em seções, comparei seção com seção entre duas páginas irmãs, e imprimi a similaridade de cada uma. O resultado foi imediato:
```
bloco palavras igual
Título e abertura do serviço 254 12%
Problemas que resolvemos 39 85%
Como funciona 133 64%
Pacotes que cabem no seu bolso 340 100% ← idêntico
Trabalhos no ar 125 100% ← idêntico
Outros serviços na cidade 31 29%
```
Dois blocos, 465 palavras, 100% idênticos em toda a malha.
Eram a tabela de preços e o bloco de prova social. Componentes bons, escritos com cuidado, colocados em toda página de cidade e de serviço porque "converte". E multiplicados por 1.246 páginas, viraram quase meio milhão de palavras de texto duplicado dentro do próprio domínio.
Numa página de mil palavras, 465 repetidas significa que menos da metade do texto era daquela página.
Por que isso mata a malha
O buscador não precisa te punir para você sumir. Basta ele decidir que essas páginas são variações da mesma coisa e escolher uma como representante. As outras ficam no índice, sem tráfego, consumindo orçamento de rastreamento.
É pior que não ter a página: você pagou para criar, o robô gasta tempo lendo, e o retorno é zero.
O conserto
Tirei os dois blocos das páginas de cidade e de serviço. No lugar entrou uma chamada curta, que varia com a cidade e o serviço, e que leva a página de preços e ao portfólio em um clique.
O preço e a prova não sumiram. Sumiu a repetição deles em texto indexável.
Depois da mudança, medido de novo com o mesmo método:
| Comparação | Antes | Depois |
|---|---|---|
| Mesmo serviço, cidades diferentes | 55–58% | 34–38% |
| Mesma cidade, serviços diferentes | 64% | 44,8% |
| Duas páginas de cidade | 60,5% | 44,6% |
As páginas de serviço com cidade — que são 1.068 das 1.337, ou 80% da malha — saíram da faixa de risco.
O que eu levaria para qualquer site com malha grande
Meça antes de acreditar. "Cada página tem conteúdo próprio" é sempre o que se acredita e quase nunca o que o HTML mostra. Rode a medição.
Meça o miolo, nunca a página inteira. Com navegação no meio, o número mente para cima.
Desconfie do componente reutilizável. Tabela de preço, prova social, bloco de depoimento, chamada final: todos são bons, e todos viram duplicata quando entram em mil páginas. Componente de conversão é para página de conversão. Página de descoberta leva um link.
A conta que importa: quanto do texto desta página existe só nela? Se for menos da metade, não é uma página, é uma variação.
O limite prático: abaixo de 35% de sobreposição entre irmãs, a malha respira. Entre 35% e 50%, incomoda. Acima disso, o buscador escolhe uma e esquece o resto.
Sobre publicar mil páginas
A ideia de uma página por cidade e por serviço está certa. A pessoa não busca "marketing digital" — ela busca o problema dela, na cidade dela. Uma página que responde exatamente isso ganha de uma página genérica todas as vezes.
O que derruba não é a quantidade. É a página nascer da mesma fôrma, com o nome trocado.
Se você tem uma malha grande e não sabe quanto dela é repetição, me chama. É meia hora de medição e o resultado costuma explicar muita coisa.
Por Rhaideline Calazans • 20 de Setembro de 2026
Falar sobre este artigo →


