Uma parte crescente das decisões de compra começa numa pergunta ao ChatGPT, ao Gemini ou à Perplexity, e não numa busca no Google. A loja que não aparece nessa resposta perde o cliente antes de ele saber que ela existe. Este guia mostra, na ordem certa, o que faz uma loja VTEX ser encontrada, lida e citada pelos assistentes de IA, com os testes para comprovar cada etapa.
Como a IA encontra uma loja, em três camadas
Antes de otimizar qualquer coisa, vale entender o caminho. Quando alguém pergunta "qual o melhor tênis para correr 10 km", o assistente faz uma busca na web, lê algumas páginas, cruza com o que já sabe e escreve a resposta citando as fontes. Três coisas precisam dar certo, nesta ordem:
- 1AcessoOs robôs da IA precisam conseguir entrar no site. Firewall, bloqueio por user-agent e desafio de bot derrubam essa etapa em silêncio.
- 2LeituraO conteúdo precisa estar no HTML que o robô recebe, com dados estruturados que expliquem o que é produto, serviço, pergunta e resposta.
- 3EscolhaEntre todas as páginas lidas, a IA cita as que respondem a pergunta de forma direta e são confirmadas por outras fontes.
A maioria dos esforços de "aparecer na IA" começa pela terceira camada, produzindo conteúdo, sem verificar as duas primeiras. É desperdício: conteúdo excelente atrás de um bloqueio não existe para a IA.
Camada 1: garantir que os robôs entram
Conheça os robôs, porque eles não são iguais
Cada empresa de IA opera mais de um robô, e eles têm funções diferentes. Tratar todos como "bot de IA" e bloquear em bloco é o erro mais comum que vimos.
| Robô | Empresa | Função | Bloquear tira da resposta? |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Indexa páginas para a busca do ChatGPT | Sim |
| ChatGPT-User | OpenAI | Acessa páginas quando o usuário pede na conversa | Sim |
| GPTBot | OpenAI | Coleta conteúdo para treinar modelos | Não |
| PerplexityBot | Perplexity | Indexa para as respostas da Perplexity | Sim |
| Claude-SearchBot e Claude-User | Anthropic | Busca e acesso a pedido do usuário | Sim |
| ClaudeBot | Anthropic | Coleta conteúdo para treinamento | Não |
| Googlebot e Google-Extended | Busca e uso em IA generativa | Googlebot sim; Google-Extended só para treino | |
| CCBot e Bytespider | Common Crawl e ByteDance | Raspagem para treino, sem retorno de tráfego | Não |
A OpenAI documenta que sites que bloqueiam o OAI-SearchBot não aparecem nas respostas de busca do ChatGPT. Ou seja, a decisão de política é separada: você pode recusar o treinamento bloqueando GPTBot e ClaudeBot e, ao mesmo tempo, liberar os robôs de busca. Bloquear tudo junto é abrir mão do canal.
Os três lugares onde o bloqueio se esconde
- Firewall da hospedagem. Regras gerenciadas do tipo "AI Bots" costumam vir com uma lista única que mistura busca e treino. Em modo de negar, elas derrubam o OAI-SearchBot junto com o CCBot. A correção é uma regra de exceção por user-agent para os robôs de busca, acima da regra de negar.
- Proteção contra bots. Desafios de JavaScript barram qualquer cliente que não seja navegador. Alguns robôs de busca são verificados por IP pela hospedagem e passam; outros não. Vale testar um a um.
- O próprio código. Middlewares que devolvem 403 para uma lista de user-agents são invisíveis no painel da hospedagem. É o bloqueio mais difícil de achar, porque ninguém olha o código procurando por ele.
Como testar em um minuto
Faça uma requisição à home simulando cada robô e leia o código de resposta e os cabeçalhos. Este é o teste que usamos em toda auditoria:
for ua in "OAI-SearchBot/1.0" "ChatGPT-User/1.0" "PerplexityBot/1.0" \
"Claude-SearchBot/1.0" "GPTBot/1.2" "Googlebot/2.1"; do
printf "%-22s " "$ua"
curl -s -o /dev/null -A "$ua" \
-w "%{http_code} mitigated=%header{x-vercel-mitigated}\n" https://www.sualoja.com.br/
doneLeitura do resultado: 200 é acesso liberado. 403 com um cabeçalho de mitigação é o firewall. 429 com desafio é a proteção contra bots. 403 sem cabeçalho de mitigação é o código da loja. Cada um tem uma correção diferente, e adivinhar custa semanas.
robots.txt: uma armadilha específica
Ao liberar robôs no robots.txt, não crie um grupo próprio para o robô de IA com "Allow: /". Um grupo específico substitui por inteiro o grupo geral, e o robô passa a ignorar os Disallow de checkout, conta e rotas privadas que valem para todos. O certo é deixar os robôs de busca cobertos pelo grupo geral e criar grupos específicos só para os que você quer bloquear.
User-agent: *
Allow: /
Disallow: /checkout
Disallow: /account
Disallow: /api/
# Bloqueados de propósito: raspagem para treino, sem retorno
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /Camada 2: fazer a IA ler o que importa
O conteúdo tem que estar no HTML
Os robôs de IA, em geral, não executam JavaScript como um navegador. Se a página de produto chega vazia e só preenche depois de rodar o script, a IA lê uma casca. Em lojas Next.js com renderização no servidor, o conteúdo vem inteiro no HTML. Em lojas que montam a vitrine no navegador, não. O teste é simples: baixe a página com o user-agent do robô e procure um trecho de texto do fim da página.
curl -s -A "OAI-SearchBot/1.0" https://www.sualoja.com.br/produto-x/p \
| grep -c "Perguntas frequentes"
# 0 = o conteúdo não está no HTML; a IA não lêDados estruturados que a IA usa de verdade
Schema.org não é só para o Google. Os assistentes usam os mesmos blocos para entender o que é o quê. Quatro tipos resolvem a maior parte:
- Organization na raiz do site, com nome, endereço, telefone, redes e, se houver, avaliação agregada. É a identidade da empresa para a IA.
- Product e Offer nas páginas de produto, com preço, disponibilidade e marca. É o que permite a IA citar "está por R$ X, em estoque".
- FAQPage onde houver perguntas e respostas. É o formato mais próximo de como o assistente monta a resposta.
- Service nas páginas de serviço, com nome oficial e descrição em uma frase. Evita que a IA invente nomes para o que você vende.
llms.txt: o mapa para o assistente
É um arquivo de texto simples na raiz do site, no padrão proposto em llmstxt.org, que resume em linguagem natural quem é a empresa, o que vende, com os nomes oficiais dos produtos e os links das páginas principais. Não substitui nada do que veio antes, mas é barato e dá à IA um ponto de partida confiável. Mantenha atualizado: um produto novo que não está no llms.txt é um produto que a IA pode descrever com o nome errado.
Um domínio só
Se a loja responde em dois domínios com o mesmo conteúdo, a autoridade se divide e a IA pode citar um ou outro ao acaso. Escolha o canônico, redirecione o outro com 301 em todas as rotas e alinhe canonical, robots.txt, sitemap e llms.txt ao mesmo domínio. Parece básico, e é o erro que mais encontramos em sites bem cuidados.
Camada 3: ser a página que a IA escolhe citar
Responda a pergunta, não o tema
A IA não procura "página sobre tênis". Ela procura a resposta para "qual tênis para corredor de 90 kg com pisada neutra". A página que tem essa resposta em uma frase clara, seguida do produto que resolve, é a que entra na resposta. Isso muda o que uma página de produto precisa ter: além de preço e foto, atributos de uso em texto, indicado para, não indicado para, e comparação com o modelo vizinho.
Comparativos e perguntas frequentes são ouro
"Modelo A ou modelo B?" é uma das perguntas mais feitas às IAs em qualquer categoria. Uma página de comparação honesta, com tabela e recomendação por perfil, responde exatamente isso. Perguntas frequentes com dados estruturados fazem o mesmo para as dúvidas de uso, tamanho, entrega e troca.
Autoridade externa confirma a história
A IA não confia só no site da marca. Ela procura outras fontes dizendo a mesma coisa: reviews, imprensa especializada, marketplaces, fóruns, diretórios oficiais. Se o seu site diz que o produto é para corrida diária e três fontes confirmam, a IA repete. Se só o seu site diz, a IA hesita. Parte do trabalho é fora do site.
Anúncio não compra recomendação
O ChatGPT Ads coloca a loja ao lado da resposta, identificada como anúncio, e a OpenAI declara que isso não altera a resposta orgânica. Vale usar, e vale atribuir a venda. Mas é um canal paralelo, não um atalho para a recomendação.
Como medir, porque sem número não há decisão
O ciclo só fecha com medição. Monte uma bateria com as perguntas de compra da sua categoria, em português, do jeito que o cliente digita, e rode nas quatro IAs todo mês, várias vezes cada, com a busca web ligada. Anote: a marca apareceu, foi recomendada ou só citada, em que posição, qual produto, qual fonte a IA usou e contra quem perdeu. A lista das perguntas em que você perde é o plano de conteúdo do mês seguinte.
É exatamente isso que o Radar de Presença nas IAs faz como serviço, e é a primeira fase do Programa AI-Ready. Mas o método vale para quem quiser rodar por conta própria.
A ordem certa, resumida
- 1Testar o acesso dos robôsUm comando, cinco minutos. Corrigir firewall, proteção contra bots e código antes de qualquer conteúdo.
- 2Confirmar que o conteúdo está no HTMLBaixar a página como o robô e procurar um trecho do fim.
- 3Unificar o domínio301 do secundário, canonical, robots, sitemap e llms.txt no mesmo host.
- 4Dados estruturados e llms.txtOrganization, Product, FAQPage e Service. Um mapa em texto na raiz.
- 5Medir a leitura zeroBateria de perguntas nas quatro IAs. Guardar o resultado.
- 6Conteúdo que respondePerguntas frequentes, comparativos e atributos de uso nas páginas onde a IA hoje escolhe outra fonte.
- 7Medir de novo em 30 diasMesma bateria. Comparar. Repetir.