llms.txt, schema e robots: o que o seu site precisa ter para a IA conseguir ler
São três arquivos e um cuidado. O robots.txt libera os robôs de IA, o schema.org declara quem é a sua empresa, o llms.txt resume o negócio em texto simples, e o conteúdo precisa estar dentro do HTML, não montado por JavaScript depois que a página abre.
robots.txt: quem você deixa entrar?
O robots.txt é um arquivo de texto na raiz do site que diz quais robôs podem ler as páginas. Ele já existia para o Googlebot, e os robôs de IA entraram nessa lista nos últimos anos, então muito site antigo não fala com eles.
Confira o seu digitando o endereço do site com /robots.txt no fim. Se aparecer "Disallow: /" embaixo de algum dos nomes abaixo, aquele robô está proibido de ler o seu site inteiro. O bloco mínimo que libera quem alimenta as respostas:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://seusite.com.br/sitemap.xmlLiberar não obriga ninguém a citar você. Bloquear, por outro lado, garante que ninguém vai citar, porque não há como ler o que está fechado.
schema.org: quem é a sua empresa dentro do código?
O schema.org é a ficha de identificação formal do negócio, escrita em um formato que a máquina entende sem adivinhar. Vai dentro do HTML, invisível para quem visita, e responde de uma vez nome, tipo de negócio, endereço, telefone e horário.
É o item que mais muda o resultado por hora de trabalho, porque transforma texto solto em fato conferível. Um bloco básico de negócio local:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "LocalBusiness",
"name": "Clínica Exemplo",
"url": "https://seusite.com.br",
"telephone": "+55-31-3333-4444",
"address": {
"@type": "PostalAddress",
"streetAddress": "Rua Exemplo, 100",
"addressLocality": "Belo Horizonte",
"addressRegion": "MG",
"addressCountry": "BR"
},
"openingHours": "Mo-Fr 08:00-18:00"
}
</script>Depois vem o bloco de perguntas frequentes, o FAQPage, que é o que faz a resposta pronta virar candidata a citação. Uma regra importante: o texto marcado ali precisa ser o mesmo texto que aparece na tela. Marcar pergunta que o visitante não vê é penalizado pelo Google e não engana modelo nenhum.
llms.txt: o resumo que a máquina lê primeiro?
O llms.txt é um arquivo de texto, também na raiz do site, escrito para ser lido por modelo de linguagem. Ele resume em uma página quem é a empresa, o que ela faz, onde fica, quanto custa e como citar. A proposta é recente e ainda não é adotada por todos, o que a torna barata: são vinte minutos de trabalho para uma vantagem que quase nenhum concorrente local tem.
# Clínica Exemplo
> Clínica odontológica em Belo Horizonte (MG), no Belvedere,
> especializada em implante e ortodontia. Atende de segunda a sexta.
## Serviços
- Implante dentário
- Ortodontia
- Clareamento
## Contato
Telefone: +55 31 3333-4444
Endereço: Rua Exemplo, 100, Belvedere, Belo Horizonte, MG
Site: https://seusite.com.brPor que o conteúdo precisa estar no HTML?
Porque muitos robôs leem a página como ela chega do servidor, antes de qualquer script rodar. Se o seu texto é montado por JavaScript depois que a página abre, o visitante vê tudo e o robô pode ver uma casca vazia.
O teste é simples e não custa nada: abra a página, aperte Ctrl+U e procure um trecho do seu texto principal dentro do que aparecer. Se você não achar, o robô também não acha. Isso pega em cheio site feito em construtor visual com carregamento tardio, e é a causa silenciosa de muita página boa que nunca foi citada.
Como conferir se deu certo?
Confira cada peça no lugar dela, em vez de esperar o resultado final aparecer sozinho.
- robots.txt: abra o endereço no navegador e leia. Se abrir e liberar, está feito.
- schema.org: use o Teste de Resultados Aprimorados do Google, que aponta o erro linha a linha.
- llms.txt: abra o endereço no navegador. Ele precisa aparecer como texto puro.
- HTML: Ctrl+U e busque o seu texto principal.
Depois disso, o resto é tempo. Os motores precisam reler o site, o que leva de duas a seis semanas, e só então a mudança começa a aparecer no que eles respondem.
Perguntas frequentes
Preciso dos três arquivos ou dá para escolher?
A ordem de prioridade é robots.txt, schema.org e llms.txt. O primeiro é obrigatório, porque bloqueio anula todo o resto. O segundo é o que mais rende por hora de trabalho. O terceiro é rápido e ainda pouco disputado.
Onde eu coloco o robots.txt e o llms.txt?
Na raiz do site, no mesmo nível do endereço principal, para que abram em seusite.com.br/robots.txt e seusite.com.br/llms.txt. No WordPress, plugins de SEO editam o robots.txt pelo painel; o llms.txt costuma exigir subir o arquivo pelo gerenciador da hospedagem.
Liberar os robôs de IA deixa meu conteúdo desprotegido?
É uma decisão de negócio legítima e há quem prefira bloquear. Para uma PME local que quer ser recomendada, o cálculo costuma ser simples: o conteúdo do site já é público, e ficar de fora das respostas custa cliente. Para quem vive de vender o próprio conteúdo, a conta pode ser outra.
O llms.txt já é reconhecido pelas IAs?
É uma proposta recente, adotada por parte dos motores e ignorada por outros. O custo de publicar é de minutos e o arquivo não atrapalha nada, então vale mais como aposta barata do que como item essencial.