---
title: "llms.txt faz sua empresa aparecer no ChatGPT? O que Google e OpenAI dizem"
url: https://samambai.com/pt/blog/llms-txt-funciona/
date: 2026-10-03
author: samambai
---

llms.txt não coloca a empresa no ChatGPT, no Gemini nem na IA do Google. O Google declara que ignora o arquivo. A OpenAI manda liberar o OAI-SearchBot e os IPs publicados. O arquivo ainda serve como índice para agente de código e documentação.

Não. Publicar um `llms.txt` não faz a empresa aparecer no ChatGPT, no Gemini nem na IA do Google. O Google declara que o Search não usa o arquivo e que mantê-lo não ajuda nem atrapalha visibilidade ou ranking [1] [2]. A OpenAI, na página em que explica como um site entra na busca do ChatGPT, documenta outra coisa: liberar o robô OAI-SearchBot e os endereços IP publicados. Essa página não lista o `llms.txt` como condição de citação [4]. O arquivo continua útil num caso estreito, o de agente de código e de documentação. É por isso que a samambai mantém o seu.

Quem vende o arquivo como atalho de citação está vendendo um índice. Índice não é resposta, não é prova de terceiro e não é posição num motor.

## O que o arquivo é

`llms.txt` é uma proposta, não um padrão obrigatório de busca. Jeremy Howard publicou a versão inicial em 3 de setembro de 2024 e atualizou para a v2 em 10 de agosto de 2026 [3]. A ideia é dar a um agente um mapa curto, em Markdown, no lugar de obrigá-lo a ler o HTML inteiro, com menu, anúncio e script.

O formato, na especificação, é simples. A única seção obrigatória é um título H1 com o nome do projeto ou do site. Em seguida pode haver um blockquote com um resumo, texto livre sem novos títulos, e seções H2 com listas de links. Cada item da lista é um link e, se fizer falta, uma nota depois de dois-pontos. Há uma seção chamada Optional, por convenção, para o que o agente pode pular quando o contexto está curto [3].

O arquivo pode ficar na raiz (`/llms.txt`) ou em qualquer caminho, e cobre as URLs debaixo desse caminho. Se dois arquivos se aplicam, a especificação manda usar o mais específico. Ela convive com `robots.txt` e com sitemap. Não os substitui. O `robots.txt` diz o que um robô pode buscar. O sitemap lista páginas para indexação. O `llms.txt` é lido sob demanda, quando um agente precisa de um assunto enquanto ajuda uma pessoa. A expectativa do autor é uso em inferência, não em treino, embora um treino possa aproveitar o texto [3].

O próprio texto da proposta diz onde o arquivo é mais usado: documentação de software, em que um agente de código segue os links até a referência de API e o tutorial. A mesma estrutura serve, segundo o autor, para uma empresa descrever a própria organização, um site pessoal ou uma escola. Isso é um uso possível. Não é uma promessa de que o ChatGPT vá citar a empresa [3].

A proposta também recomenda uma versão Markdown limpa das páginas importantes, no mesmo URL com `.md` no fim, e links `rel="alternate"` ou um cabeçalho HTTP `Link`. Chrome Lighthouse, segundo a especificação, audita a presença do arquivo dentro das checagens de navegação agentiva [3]. Auditoria de ferramenta de desenvolvedor não é critério de ranking do Google. O guia do Google, na seção de mitos, manda ignorar arquivos de texto feitos para IA [1].

## O que o Google declarou

O guia "Optimizing your website for generative AI features on Google Search" foi atualizado em 10 de julho de 2026. A seção de mitos diz, em tradução direta do trecho: você não precisa criar arquivos legíveis por máquina, arquivos de texto para IA, markup ou Markdown para aparecer no Google Search, inclusive nas capacidades de IA generativa, porque o Google Search em si não os usa. Descobrir, rastrear e indexar um arquivo não significa tratá-lo de modo especial [1].

O mesmo parágrafo fecha o ponto que interessa a quem tem medo de apagar o arquivo: é completamente aceitável criar e manter `llms.txt` (ou arquivo parecido) para outros serviços ou sistemas que usem esses arquivos. Fazer isso não prejudica nem ajuda a visibilidade ou o ranking no Google Search, porque o Google Search os ignora [1].

A nota entrou no guia em 15 de junho de 2026. O changelog do Search Central registra o motivo com as mesmas palavras: os arquivos não são necessários para o Google Search e não afetam de forma negativa nem positiva a visibilidade ou o ranking. Mantê-los para outros serviços ou sistemas está bem [2]. Não é uma frase de bastidor. É a página oficial de atualizações da documentação.

O mesmo guia manda ignorar, junto com o arquivo, o hábito de fatiar a página em pedaços ("chunking"), reescrever o texto só para sistemas de IA, correr atrás de menção inautêntica e tratar schema especial como requisito da busca generativa. Schema continua útil para rich results clássicos. Não há markup schema.org especial para AI Overviews ou Modo IA [1]. Quem quiser o modelo completo de citação, com índice, página, confiança e frescor, encontra em [o que faz uma empresa ser citada](/pt/blog/o-que-faz-uma-empresa-ser-citada-pelas-ias/).

Em 15 de maio de 2026 o mesmo changelog esclareceu que as políticas de spam já existentes também valem para respostas de IA generativa no Google Search [2]. Encher o `llms.txt` de instrução escondida, ou publicar dezenas de páginas só para variações de pergunta, não vira "otimização de arquivo". Cai na regra de spam que o Google diz já valer para a resposta gerada. O guia avisa que criar conteúdo separado para cada variação de busca, com o fim de manipular ranking ou resposta generativa, viola a política de abuso de conteúdo em escala [1].

## O que um estudo de logs mostrou

Declaração oficial responde "o Google usa?". Log responde "alguém busca o arquivo?". As duas perguntas são diferentes. A segunda tem um estudo de vendor, não uma medição do Google.

Em 15 de junho de 2026, Louise Linehan e Xibeijia Guan, da Ahrefs, publicaram uma leitura dos próprios produtos Web Analytics e Bot Analytics [6]. O recorte foi todo domínio dessa base com tráfego em maio de 2026: 137.210 domínios. A Ahrefs avisou que esses clientes são mais técnicos e mais atentos a SEO do que a web em geral, então a taxa de adoção é um teto, não uma média da internet.

Eles procuraram `/llms.txt` na raiz com HTTP 200, confirmaram que o corpo era Markdown e não uma página de erro em HTML, e contaram os pedidos àquele caminho. Não checaram se o arquivo seguia a especificação à risca. O estudo mede o arquivo de índice, só o arquivo de índice [6].

O que acharam:

| Medida | Número no estudo da Ahrefs | Leitura |
| --- | --- | --- |
| Domínios com tráfego em maio de 2026 | 137.210 | Base do vendor, enviesada para cliente técnico |
| Publicam um `llms.txt` válido | 28% (38.360) | Teto, não média da web |
| Arquivos sem nenhum pedido em maio de 2026 | 97% | Nem bot, nem pessoa |
| Pedidos que chegaram e vieram de bots | 96% | Os 4% restantes foram pessoas |
| Pedidos de ferramentas de IA nomeadas, entre os que chegaram | 19,5% | GPTBot em primeiro, Claude-Code em segundo |
| Bots de recuperação de busca de IA (OAI-SearchBot, PerplexityBot, busca do Claude) | 1,1% dos pedidos | A busca que cita quase não lê o índice |
| Pedidos de quem estuda o próprio arquivo (ferramenta de GEO, scanner, pesquisa) | cerca de 12% | Auditoria, não citação |
| Pedidos de bot de IA a um `/llms.txt` que responde 404 | zero | Ninguém sai procurando o arquivo ausente |

O gráfico da Ahrefs marca 38.360 domínios com arquivo válido, 28% da base de 137.210. O complemento desenhado no mesmo gráfico, 98.640, soma 137 mil com os 38.360. É arredondamento do gráfico, não uma segunda contagem. Os cerca de 3% que receberam algum pedido concentram o tráfego medido, na ordem de 1,1 mil domínios e cerca de 22 mil pedidos. Dentro desse grupo pequeno, a auditoria de `llms.txt` do Lighthouse respondeu por cerca de 1 em cada 1.000 buscas (22 pedidos) [6].

Dois detalhes mudam a decisão de um comprador. O primeiro: "buscou" não é "usou". A Ahrefs escreve que muitos bots podem ter baixado o arquivo sem agir sobre o conteúdo, então cada percentual de IA é um teto [6]. O segundo: o bot de preview do Slack buscou o arquivo mais vezes do que o PerplexityBot. Um preview de link em chat não é uma citação.

A Ahrefs também separa quem lê. Agentes e infraestrutura agentiva foram 10,5% dos pedidos. Rastreadores de treino, 5,3%, com GPTBot sozinho em 4,51% e ClaudeBot em 0,8%. Assistentes acionados por uma pessoa, 2,5%. Bots de recuperação, 1,1%, e nesse grupo o OAI-SearchBot liderou com 0,74%. Claude-Code, o agente de código da Anthropic, superou cada bot de recuperação, cada assistente e cada rastreador de treino, fora o GPTBot e um indexador chamado statespace-indexer, cujo operador a Ahrefs identifica sem confirmar as faixas de IP [6].

O Googlebot apareceu cerca de 900 vezes em maio. A leitura da Ahrefs é a mesma do guia: o Googlebot busca URL que descobre, do mesmo jeito que busca um sitemap. Essas buscas não mostram interesse especial pelo `llms.txt`, e o estudo não vê se algum byte depois alimenta o Gemini [6]. Isso combina com o guia: indexar um tipo de arquivo a mais não cria tratamento especial [1].

Nos caminhos que responderam 404, a divisão inverteu. Arquivo válido atraiu 96% de bot. Arquivo ausente atraiu 98% de gente, e a fatia de bot de IA nesses 404 foi zero. Quem testa o URL no navegador, em geral para olhar o concorrente, é pessoa. Sistema de IA não sai à caça de um `llms.txt` que não foi publicado [6].

Há um achado de segurança que convém ler sem teatro. Entre os bots de pesquisa (2,7% dos pedidos), o maior se identificou como `prompt-injection-survey/1.0`. Alguém varre o arquivo como superfície de injeção de prompt, porque agente é feito para confiar no que o índice diz [6]. Motivo para tratar o arquivo como texto público e curto. Não é motivo para esconder instrução nele.

Estudo de vendor mede o log do vendor. Não mede quantas vezes o ChatGPT citou uma marca. Não prova que apagar o arquivo derruba citação, nem que publicar o arquivo sobe citação. Prova uma coisa mais simples: em maio de 2026, quase ninguém pediu o arquivo, e quem pediu quase não era o robô da busca que cita.

## O que a OpenAI documenta de fato

A página "Overview of OpenAI crawlers", lida em 2 de outubro de 2026, separa quatro agentes. Cada um se controla sozinho [4].

| Agente | Para que a OpenAI diz que serve | O que não é |
| --- | --- | --- |
| OAI-SearchBot | Trazer sites para os resultados de busca do ChatGPT. Site que bloqueia o robô não aparece nas respostas de busca, embora ainda possa surgir como link de navegação. | Não é o arquivo `llms.txt` |
| GPTBot | Rastrear conteúdo que pode entrar no treino dos modelos de fundação. Bloquear indica que o conteúdo não deve treinar esses modelos. | Não decide a busca |
| ChatGPT-User | Visita disparada por uma pessoa no ChatGPT ou num GPT personalizado. Como a ação começa no usuário, a regra de `robots.txt` pode não valer. | A OpenAI diz que ele não decide o que entra na busca |
| OAI-AdsBot | Visita só páginas enviadas como anúncio, para checar a página e a relevância do anúncio. O dado não treina modelo de fundação. | Não é presença orgânica |

Para a busca, a recomendação escrita é direta: permitir o OAI-SearchBot no `robots.txt` e permitir os pedidos que vêm das faixas de IP publicadas em `https://openai.com/searchbot.json` [4]. Há listas separadas para GPTBot, ChatGPT-User e OAI-AdsBot. Se o site permite os dois primeiros, a OpenAI pode usar um único rastreio para os dois fins, para não rastrear duas vezes. Mudança no `robots.txt` leva cerca de 24 horas para os sistemas deles ajustarem [4].

O exemplo de user-agent do OAI-SearchBot, na mesma página, termina em `OAI-SearchBot/1.4` e no URL `https://openai.com/searchbot`. Quando buscam o `robots.txt`, podem acrescentar o marcador `robots.txt` no user-agent, para o log distinguir essa busca das outras [4]. Versão no user-agent pode mudar. A página avisa isso.

Nada nessa página diz "publique um llms.txt". O que a página diz sobre o arquivo está no cabeçalho da documentação, e o sentido é outro: "For the complete documentation index, see llms.txt" [4]. É um índice da documentação de desenvolvedor. O arquivo em `https://developers.openai.com/llms.txt`, lido no mesmo dia, confirma. O H1 é "OpenAI Developers". O blockquote descreve o hub de API, Ads, Codex e o restante. As seções H2 apontam para outros `llms.txt` de produto e para guias em `.md`: quickstart, referência, evals, comércio agentivo [5]. É o formato da especificação, usado para um agente achar a página certa da doc. Não é um arquivo dizendo ao ChatGPT para citar a OpenAI quando alguém pergunta por um fornecedor.

Confundir os quatro robôs é o erro que mais custa. Bloquear o GPTBot não é o mesmo que sair da busca. Permitir o GPTBot não coloca a página na resposta. O ChatGPT-User pode visitar uma URL que a pessoa pediu, e isso não é o `llms.txt` sendo "lido pelo ChatGPT". Anúncio tem robô próprio e, pela documentação, não treina modelo de fundação. Quem quiser aparecer na resposta de busca segue a linha do OAI-SearchBot e dos IPs, e ainda assim a presença não está garantida: isso depende de a página ser recuperada e de o modelo usá-la. O arquivo de índice não entra nessa frase.

## Quando o arquivo ainda faz sentido

Faz sentido quando alguém já vai apontar um agente para o site e esse agente precisa de um mapa. A especificação descreve esse caso: documentação de biblioteca, referência de API, tutorial [3]. A OpenAI faz exatamente isso na documentação de desenvolvedor [4] [5]. A proposta cita o mesmo hábito em docs da Anthropic e do Gemini, com URLs na página da especificação [3]. Não abrimos esses dois arquivos nesta leitura. O que está verificado é o da OpenAI e o texto da proposta.

Também faz sentido como índice interno. Um agente de código que mantém o site, ou um agente da própria operação, gasta menos contexto se começa por uma lista curta de páginas Markdown do que se começa pelo HTML. A especificação recomenda testar o arquivo fazendo perguntas a um agente que só recebeu aquele `llms.txt` de partida [3]. Esse teste mede se o mapa está claro. Não mede citação.

Não faz sentido como projeto de visibilidade. A base do estudo de vendor é dura: 97% dos arquivos existentes não tiveram leitor nenhum num mês inteiro, e os bots que citam resposta foram 1,1% dos pedidos que existiram [6]. Publicar o arquivo não coloca o domínio num radar. Os 404 provam o contrário [6].

### Por que a samambai mantém um

O estúdio publica `https://samambai.com/llms.txt`. O arquivo é um mapa curto: o que a empresa faz, preço público em dólar, como funciona o trabalho, contato e links para versões Markdown de páginas centrais. O motivo é o mesmo da documentação da OpenAI. Um agente que já foi mandado ao site consegue ler serviço, prazo e preço sem adivinhar o HTML. A operação da samambai é AI-first: pessoas mais agentes no próprio processo de construir, testar e auditar, sempre com revisão humana. Esse agente interno é leitor plausível do índice. O comprador que cola o URL num agente de código também é.

O arquivo não existe para ganhar citação. O Google diz que mantê-lo para outros sistemas não muda o Search [1] [2]. O estudo de vendor diz que, quando há leitor, ele se parece mais com agente de código do que com robô de busca [6]. Tratar o nosso arquivo como prova de GEO seria repetir o mito que esta página desmonta.

Se o mapa ficar velho, ele passa a mentir para o único leitor que importa. Preço, prazo e escopo no `llms.txt` têm de ser os mesmos do site. A especificação pede linguagem curta e descrição nos links [3]. Um índice desatualizado é pior do que índice nenhum, porque o agente que confia nele repete o erro.

## O que fazer no lugar

Citação segue outro caminho. O texto longo está em [o que faz uma empresa ser citada pelo ChatGPT, Gemini e pela IA do Google](/pt/blog/o-que-faz-uma-empresa-ser-citada-pelas-ias/). Aqui fica a versão operacional, na ordem em que o trabalho trava.

1. Acesso ao índice do motor que importa. No Google, a página precisa poder ser indexada e exibida com snippet, e o site precisa estar incluído no controle de IA generativa do Search Console. O guia diz que cumprir requisito não garante indexação nem exibição [1]. No ChatGPT, a busca pede OAI-SearchBot liberado e as faixas de IP de `searchbot.json` liberadas no firewall ou na CDN [4]. Bloquear o Googlebot para "evitar treino" e esperar citação na IA do Google é contradizer o guia: a busca generativa do Google parte do índice do Search [1].
2. Uma página que responde a pergunta de compra. Preço, prazo, o que está incluso e a data em que aquilo vale. O guia pede conteúdo que não seja commodity: experiência própria, não um resumo do que já está em todo lugar [1]. "Soluções de IA para o seu negócio" não responde "quanto custa um sprint de automação".
3. Confiança que não nasce no próprio site. Menção fabricada, rede de site satélite e texto escondido num botão "resumir com IA" estão do lado errado da política que o Google diz valer para a resposta gerativa desde o esclarecimento de 15 de maio de 2026 [2]. O guia diz que correr atrás de menção inautêntica não ajuda, porque ranking e filtro de spam continuam valendo para a função generativa [1].
4. Frescor de fato, não de carimbo. Se o preço mudou, a página muda. Carimbar a data de hoje em texto velho não é atualização.

Medir sem se enganar: presença ao longo de muitas execuções da mesma pergunta, e impressões no relatório de IA generativa do Search Console. O guia aponta esse relatório. Ele mostra descoberta, não um ranking [1]. Um print de uma resposta é anedota. Ferramenta de terceiro que promete métrica interna do Google não tem esse acesso. O guia diz isso com todas as letras [1].

O serviço de GEO da samambai é esse trabalho: diagnóstico do que já está no índice, página que responde, corroboração real e rotina de atualização. Não é a instalação de um `llms.txt`. O preço público do estúdio está em [preços](/pt/precos/): Sprint de US$ 1.200 por duas semanas, com cancelamento quando quiser; Projeto a partir de US$ 3.000, com escopo, prazo e preço fechados; Parceria a partir de US$ 900 por mês. A primeira conversa dura 30 minutos e não cria compromisso. GEO de um site específico é orçado depois dessa conversa, porque depende do que já está indexado. A página do serviço está em [GEO](/pt/geo/).

## Erros comuns

| Erro | Por que falha |
| --- | --- |
| Publicar o arquivo e esperar citação em uma semana | 97% dos arquivos do estudo não receberam pedido nenhum num mês. Bot de busca foi 1,1% do que chegou [6]. |
| Achar que o Google penaliza ou premia o arquivo | O guia e o changelog de 15 de junho de 2026 dizem o oposto: ignora, não ajuda e não atrapalha [1] [2]. |
| Bloquear o GPTBot e concluir que saiu do ChatGPT | Os controles são independentes. Busca é OAI-SearchBot. Treino é GPTBot [4]. |
| Liberar só o ChatGPT-User | A OpenAI diz que esse agente não decide inclusão na busca [4]. |
| Copiar um gerador de plugin e não manter o texto | O leitor plausível é um agente que confia no mapa. Mapa velho repete preço errado. |
| Contar fetch no log como vitória | A Ahrefs avisa que fetch não é uso [6]. |
| Uma página por variação de pergunta, listada no arquivo | O guia trata volume feito para manipular a resposta como abuso de conteúdo em escala [1]. |
| Esconder instrução para o modelo gravar memória | O arquivo é público. O estudo já viu crawler tratado como pesquisa de injeção [6]. |

## O que não fazer

Não trocar a página que responde por um arquivo de índice. Não comprar menção. Não montar rede de domínio só para "citar" a marca. Não prometer, e não contratar quem prometa, a primeira posição no ChatGPT. Não usar o `llms.txt` como lugar de instrução ao modelo. Não tratar schema, chunking ou reescrita cosmética como substituto de índice e de prova [1].

Não apague o arquivo por medo de punição do Google. Não há punição documentada, nem prêmio [1] [2]. Apague ou deixe de criar se ninguém vai apontar um agente para ele e se o custo de mantê-lo atualizado for real. Um arquivo de 15 linhas que mente o preço custa mais do que zero linhas.

Não leia o estudo da Ahrefs como se fosse o Google. É log de um vendor, numa base de cliente técnico, num mês (maio de 2026). Serve para derrubar a fantasia de que "todo mundo já lê llms.txt". Não serve para cravar uma taxa de citação.

## Quando não contratar a samambai

Não contrate o estúdio se o pedido for um destes:

- Garantir o primeiro lugar no ChatGPT, no Gemini ou no Modo IA. Ninguém que lê a documentação oferece isso. O guia do Google diz que indexar não garante exibição [1].
- Mídia paga. Gestão de anúncio não faz parte do que a samambai vende. OAI-AdsBot é um produto da OpenAI para quem anuncia no ChatGPT, e não faz parte do trabalho daqui [4].
- Uma rede de sites, um pacote de menções ou um botão "resumir com IA" que tenta gravar memória no assistente. Isso é o tipo de manipulação que a política de spam do Google alcança na resposta gerativa [2].
- Um projeto cujo entregável é o `llms.txt`, um schema especial ou uma página fatiada em chunks. O Google manda ignorar os três [1].
- Resultado em poucos dias num site que não está no índice e não tem nenhuma corroboração de terceiro. Sem o primeiro portão, o arquivo não cria o segundo.
- Uma URL nova para cada jeito de fazer a mesma pergunta. O guia chama isso de estratégia fraca e, quando o objetivo é manipular, de abuso de conteúdo em escala [1].

Faz sentido escrever para [contato@samambai.com](mailto:contato@samambai.com) quando a página de venda ainda não responde preço e prazo, quando o robô certo está bloqueado, ou quando a marca é citada por um concorrente e não por quem faz o trabalho. A conversa de 30 minutos serve para dizer qual portão está fechado. Se o portão fechado for "falta um llms.txt", a resposta honesta é que esse não é o portão.
