Diagnóstico grátis →
Presença em IA

llms.txt, schema e robots: o que o seu site precisa ter para a IA conseguir ler

São três arquivos e um cuidado. O robots.txt libera os robôs de IA, o schema.org declara quem é a sua empresa, o llms.txt resume o negócio em texto simples, e o conteúdo precisa estar dentro do HTML, não montado por JavaScript depois que a página abre.

robots.txt: quem você deixa entrar?

O robots.txt é um arquivo de texto na raiz do site que diz quais robôs podem ler as páginas. Ele já existia para o Googlebot, e os robôs de IA entraram nessa lista nos últimos anos, então muito site antigo não fala com eles.

Confira o seu digitando o endereço do site com /robots.txt no fim. Se aparecer "Disallow: /" embaixo de algum dos nomes abaixo, aquele robô está proibido de ler o seu site inteiro. O bloco mínimo que libera quem alimenta as respostas:

User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ClaudeBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: / Sitemap: https://seusite.com.br/sitemap.xml

Liberar não obriga ninguém a citar você. Bloquear, por outro lado, garante que ninguém vai citar, porque não há como ler o que está fechado.

schema.org: quem é a sua empresa dentro do código?

O schema.org é a ficha de identificação formal do negócio, escrita em um formato que a máquina entende sem adivinhar. Vai dentro do HTML, invisível para quem visita, e responde de uma vez nome, tipo de negócio, endereço, telefone e horário.

É o item que mais muda o resultado por hora de trabalho, porque transforma texto solto em fato conferível. Um bloco básico de negócio local:

<script type="application/ld+json"> { "@context": "https://schema.org", "@type": "LocalBusiness", "name": "Clínica Exemplo", "url": "https://seusite.com.br", "telephone": "+55-31-3333-4444", "address": { "@type": "PostalAddress", "streetAddress": "Rua Exemplo, 100", "addressLocality": "Belo Horizonte", "addressRegion": "MG", "addressCountry": "BR" }, "openingHours": "Mo-Fr 08:00-18:00" } </script>

Depois vem o bloco de perguntas frequentes, o FAQPage, que é o que faz a resposta pronta virar candidata a citação. Uma regra importante: o texto marcado ali precisa ser o mesmo texto que aparece na tela. Marcar pergunta que o visitante não vê é penalizado pelo Google e não engana modelo nenhum.

llms.txt: o resumo que a máquina lê primeiro?

O llms.txt é um arquivo de texto, também na raiz do site, escrito para ser lido por modelo de linguagem. Ele resume em uma página quem é a empresa, o que ela faz, onde fica, quanto custa e como citar. A proposta é recente e ainda não é adotada por todos, o que a torna barata: são vinte minutos de trabalho para uma vantagem que quase nenhum concorrente local tem.

# Clínica Exemplo > Clínica odontológica em Belo Horizonte (MG), no Belvedere, > especializada em implante e ortodontia. Atende de segunda a sexta. ## Serviços - Implante dentário - Ortodontia - Clareamento ## Contato Telefone: +55 31 3333-4444 Endereço: Rua Exemplo, 100, Belvedere, Belo Horizonte, MG Site: https://seusite.com.br

Por que o conteúdo precisa estar no HTML?

Porque muitos robôs leem a página como ela chega do servidor, antes de qualquer script rodar. Se o seu texto é montado por JavaScript depois que a página abre, o visitante vê tudo e o robô pode ver uma casca vazia.

O teste é simples e não custa nada: abra a página, aperte Ctrl+U e procure um trecho do seu texto principal dentro do que aparecer. Se você não achar, o robô também não acha. Isso pega em cheio site feito em construtor visual com carregamento tardio, e é a causa silenciosa de muita página boa que nunca foi citada.

Como conferir se deu certo?

Confira cada peça no lugar dela, em vez de esperar o resultado final aparecer sozinho.

  • robots.txt: abra o endereço no navegador e leia. Se abrir e liberar, está feito.
  • schema.org: use o Teste de Resultados Aprimorados do Google, que aponta o erro linha a linha.
  • llms.txt: abra o endereço no navegador. Ele precisa aparecer como texto puro.
  • HTML: Ctrl+U e busque o seu texto principal.

Depois disso, o resto é tempo. Os motores precisam reler o site, o que leva de duas a seis semanas, e só então a mudança começa a aparecer no que eles respondem.

Rodar essas verificações no meu site de graça →

Perguntas frequentes

Preciso dos três arquivos ou dá para escolher?

A ordem de prioridade é robots.txt, schema.org e llms.txt. O primeiro é obrigatório, porque bloqueio anula todo o resto. O segundo é o que mais rende por hora de trabalho. O terceiro é rápido e ainda pouco disputado.

Onde eu coloco o robots.txt e o llms.txt?

Na raiz do site, no mesmo nível do endereço principal, para que abram em seusite.com.br/robots.txt e seusite.com.br/llms.txt. No WordPress, plugins de SEO editam o robots.txt pelo painel; o llms.txt costuma exigir subir o arquivo pelo gerenciador da hospedagem.

Liberar os robôs de IA deixa meu conteúdo desprotegido?

É uma decisão de negócio legítima e há quem prefira bloquear. Para uma PME local que quer ser recomendada, o cálculo costuma ser simples: o conteúdo do site já é público, e ficar de fora das respostas custa cliente. Para quem vive de vender o próprio conteúdo, a conta pode ser outra.

O llms.txt já é reconhecido pelas IAs?

É uma proposta recente, adotada por parte dos motores e ignorada por outros. O custo de publicar é de minutos e o arquivo não atrapalha nada, então vale mais como aposta barata do que como item essencial.

Leia também

Por que a minha empresa não aparece nas respostas das IAs → Quanto custa aparecer nas respostas de IA → Ver todos os conteúdos →
Diagnóstico gratuito

Veja o que as IAs respondem sobre a sua empresa

45 verificações no seu site, em menos de um minuto, com os concorrentes que aparecem quando alguém pergunta por um serviço como o seu.

Ver os dois formatos de trabalho da CRIVA →