llms.txt, GPTBot e o robots.txt que decide se a IA cita você
Rhaideline Calazans
Fundadora, Calazans Lumina

Resumo (TL;DR)
Para uma IA citar o seu site ela precisa poder lê-lo. Isso depende do robots.txt liberar os robôs de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended e outros), de dados estruturados que descrevam o negócio, e de um llms.txt que resuma o site em texto. É infraestrutura, e dá para conferir em quinze minutos.
O que mudou na busca
Uma parte das pessoas parou de digitar "eletricista perto de mim" no Google e passou a perguntar para uma IA: "preciso de um eletricista em Framingham que atenda em português, quem você recomenda?"
A resposta vem em texto, com dois ou três nomes. Quem está nessa lista recebe a visita. Quem não está não aparece em lugar nenhum — não existe segunda página para rolar.
A pergunta prática é: como entrar nessa lista?
Parte disso é reputação e menção, que se constrói devagar. Mas existe uma parte técnica, que é pré-requisito, dá para conferir hoje, e é onde a maioria dos sites falha sem saber.
Primeiro: o robô consegue entrar?
Os modelos leem a web com robôs identificados. Os principais:
| Robô | De quem é |
|---|---|
| `GPTBot` | OpenAI, alimenta o ChatGPT |
| `ChatGPT-User` | OpenAI, quando o usuário pede para abrir um link |
| `ClaudeBot` e `anthropic-ai` | Anthropic |
| `PerplexityBot` | Perplexity |
| `Google-Extended` | Google, controla uso em IA separado da busca |
| `Applebot-Extended` | Apple |
| `meta-externalagent` | Meta |
O arquivo `robots.txt`, na raiz do site, decide quem entra. Muitos sites bloqueiam esses robôs — às vezes de propósito, às vezes porque um plugin de segurança fez isso sozinho.
Confira agora: abra `seusite.com/robots.txt` e procure por esses nomes. Se algum aparecer com `Disallow: /`, ele está barrado.
O que deve estar lá, para quem quer ser citado:
```
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
```
Uma observação honesta: liberar significa deixar o seu conteúdo ser usado para treinar e para responder. É uma troca. Quem vende serviço local costuma ganhar mais sendo citado do que protegendo o texto. Quem vive de vender o próprio conteúdo talvez prefira o contrário. É decisão de negócio, não regra técnica.
Segundo: o site se descreve em dado estruturado?
Modelo de linguagem lê texto, mas dado estruturado é o que ele entende sem ambiguidade. É o `schema.org`, em JSON-LD, dentro da página.
O que importa para negócio de serviço:
`LocalBusiness` — quem você é, o que faz, onde atende, telefone. Se a operação é remota, declare `areaServed` e não invente endereço. Endereço falso em dado estruturado é problema sério, e é fácil de conferir.
`Service` — cada serviço como uma entidade própria, ligada ao negócio.
`FAQPage` — pergunta e resposta em formato que a IA consegue extrair inteiro. É o formato que mais vira citação direta, porque já vem no formato da resposta.
`BreadcrumbList` — onde a página fica na hierarquia do site.
Um cuidado: só declare o que está visível na página. Schema de FAQ com perguntas que não aparecem no texto é contra as diretrizes e derruba o resto junto.
Terceiro: o llms.txt
O `llms.txt` é um arquivo em texto, na raiz do site, que resume o que o site é e aponta para as páginas que importam. A ideia é a mesma do `robots.txt`, só que o destinatário é um modelo de linguagem: em vez de o robô ter que inferir o site inteiro a partir do HTML, ele lê um resumo escrito por você.
Um esqueleto que funciona:
```
# Nome do Negócio
> Uma frase dizendo o que é, para quem, e onde atende.
O que fazemos
- Serviço — o que resolve, em uma linha
- Serviço — o que resolve, em uma linha
Onde atendemos
Cidades, com link para a página de cada uma.
Perguntas frequentes
Pergunta em uma linha.
Resposta em três.
Contato
Como falar, e o link.
```
E aqui vem o aviso que vale o artigo inteiro.
O erro que eu achei no meu próprio llms.txt
Fui auditar o meu e encontrei três coisas erradas no arquivo que descreve o meu negócio para as IAs:
- Um número de resultado que não batia com nenhuma medição que eu tivesse
- O nome de um cliente escrito errado — trocado por outro parecido
- Uma contagem de volume que eu não uso mais em material público
Esse arquivo é exatamente o que o modelo lê para te descrever. Número errado ali não fica só ali: vira a resposta que a IA dá sobre você, para quem perguntar, sem contexto e sem correção.
Só ponha no llms.txt o que você consegue provar. Número com origem declarada, nome de cliente conferido, e nada de contagem que envelhece sozinha. Se o dado muda, o arquivo precisa mudar junto — e alguém tem que ser responsável por isso.
Quarto: conteúdo que responde pergunta
Infraestrutura liberada e nenhuma resposta útil não gera citação.
O que vira citação é conteúdo que responde uma pergunta inteira, em um lugar só, com número que tem fonte. "Quanto custa um site para empresa pequena em Massachusetts" respondido com faixa, com o que entra em cada faixa e com o que faz variar, vira resposta. Página de vendas dizendo "soluções sob medida" não vira.
A conferência de quinze minutos
1. Abra seusite.com/robots.txt e procure GPTBot, ClaudeBot, PerplexityBot e Google-Extended
2. Rode o teste de resultados ricos do Google numa página de serviço e veja quais schemas aparecem
3. Tente abrir seusite.com/llms.txt — se der 404, ele não existe
4. Leia o llms.txt, se existir, procurando número sem fonte e nome escrito errado
5. Pergunte ao ChatGPT e ao Perplexity pelo seu serviço na sua cidade e veja quem aparece
Os quatro primeiros você resolve esta semana. O quinto é o placar.
Por Rhaideline Calazans • 20 de Setembro de 2026
Falar sobre este artigo →


