• geo
  • llms-txt

llms.txt faz sua empresa aparecer no ChatGPT? O que Google e OpenAI dizem

Em resumo

llms.txt não coloca a empresa no ChatGPT, no Gemini nem na IA do Google. O Google declara que ignora o arquivo. A OpenAI manda liberar o OAI-SearchBot e os IPs publicados. O arquivo ainda serve como índice para agente de código e documentação.

Não. Publicar um llms.txt não faz a empresa aparecer no ChatGPT, no Gemini nem na IA do Google. O Google declara que o Search não usa o arquivo e que mantê-lo não ajuda nem atrapalha visibilidade ou ranking Fonte [1] Fonte [2]. A OpenAI, na página em que explica como um site entra na busca do ChatGPT, documenta outra coisa: liberar o robô OAI-SearchBot e os endereços IP publicados. Essa página não lista o llms.txt como condição de citação Fonte [4]. O arquivo continua útil num caso estreito, o de agente de código e de documentação. É por isso que a samambai mantém o seu.

Quem vende o arquivo como atalho de citação está vendendo um índice. Índice não é resposta, não é prova de terceiro e não é posição num motor.

O que o arquivo é

llms.txt é uma proposta, não um padrão obrigatório de busca. Jeremy Howard publicou a versão inicial em 3 de setembro de 2024 e atualizou para a v2 em 10 de agosto de 2026 Fonte [3]. A ideia é dar a um agente um mapa curto, em Markdown, no lugar de obrigá-lo a ler o HTML inteiro, com menu, anúncio e script.

O formato, na especificação, é simples. A única seção obrigatória é um título H1 com o nome do projeto ou do site. Em seguida pode haver um blockquote com um resumo, texto livre sem novos títulos, e seções H2 com listas de links. Cada item da lista é um link e, se fizer falta, uma nota depois de dois-pontos. Há uma seção chamada Optional, por convenção, para o que o agente pode pular quando o contexto está curto Fonte [3].

O arquivo pode ficar na raiz (/llms.txt) ou em qualquer caminho, e cobre as URLs debaixo desse caminho. Se dois arquivos se aplicam, a especificação manda usar o mais específico. Ela convive com robots.txt e com sitemap. Não os substitui. O robots.txt diz o que um robô pode buscar. O sitemap lista páginas para indexação. O llms.txt é lido sob demanda, quando um agente precisa de um assunto enquanto ajuda uma pessoa. A expectativa do autor é uso em inferência, não em treino, embora um treino possa aproveitar o texto Fonte [3].

O próprio texto da proposta diz onde o arquivo é mais usado: documentação de software, em que um agente de código segue os links até a referência de API e o tutorial. A mesma estrutura serve, segundo o autor, para uma empresa descrever a própria organização, um site pessoal ou uma escola. Isso é um uso possível. Não é uma promessa de que o ChatGPT vá citar a empresa Fonte [3].

A proposta também recomenda uma versão Markdown limpa das páginas importantes, no mesmo URL com .md no fim, e links rel="alternate" ou um cabeçalho HTTP Link. Chrome Lighthouse, segundo a especificação, audita a presença do arquivo dentro das checagens de navegação agentiva Fonte [3]. Auditoria de ferramenta de desenvolvedor não é critério de ranking do Google. O guia do Google, na seção de mitos, manda ignorar arquivos de texto feitos para IA Fonte [1].

O que o Google declarou

O guia "Optimizing your website for generative AI features on Google Search" foi atualizado em 10 de julho de 2026. A seção de mitos diz, em tradução direta do trecho: você não precisa criar arquivos legíveis por máquina, arquivos de texto para IA, markup ou Markdown para aparecer no Google Search, inclusive nas capacidades de IA generativa, porque o Google Search em si não os usa. Descobrir, rastrear e indexar um arquivo não significa tratá-lo de modo especial Fonte [1].

O mesmo parágrafo fecha o ponto que interessa a quem tem medo de apagar o arquivo: é completamente aceitável criar e manter llms.txt (ou arquivo parecido) para outros serviços ou sistemas que usem esses arquivos. Fazer isso não prejudica nem ajuda a visibilidade ou o ranking no Google Search, porque o Google Search os ignora Fonte [1].

A nota entrou no guia em 15 de junho de 2026. O changelog do Search Central registra o motivo com as mesmas palavras: os arquivos não são necessários para o Google Search e não afetam de forma negativa nem positiva a visibilidade ou o ranking. Mantê-los para outros serviços ou sistemas está bem Fonte [2]. Não é uma frase de bastidor. É a página oficial de atualizações da documentação.

O mesmo guia manda ignorar, junto com o arquivo, o hábito de fatiar a página em pedaços ("chunking"), reescrever o texto só para sistemas de IA, correr atrás de menção inautêntica e tratar schema especial como requisito da busca generativa. Schema continua útil para rich results clássicos. Não há markup schema.org especial para AI Overviews ou Modo IA Fonte [1]. Quem quiser o modelo completo de citação, com índice, página, confiança e frescor, encontra em o que faz uma empresa ser citada.

Em 15 de maio de 2026 o mesmo changelog esclareceu que as políticas de spam já existentes também valem para respostas de IA generativa no Google Search Fonte [2]. Encher o llms.txt de instrução escondida, ou publicar dezenas de páginas só para variações de pergunta, não vira "otimização de arquivo". Cai na regra de spam que o Google diz já valer para a resposta gerada. O guia avisa que criar conteúdo separado para cada variação de busca, com o fim de manipular ranking ou resposta generativa, viola a política de abuso de conteúdo em escala Fonte [1].

O que um estudo de logs mostrou

Declaração oficial responde "o Google usa?". Log responde "alguém busca o arquivo?". As duas perguntas são diferentes. A segunda tem um estudo de vendor, não uma medição do Google.

Em 15 de junho de 2026, Louise Linehan e Xibeijia Guan, da Ahrefs, publicaram uma leitura dos próprios produtos Web Analytics e Bot Analytics Fonte [6]. O recorte foi todo domínio dessa base com tráfego em maio de 2026: 137.210 domínios. A Ahrefs avisou que esses clientes são mais técnicos e mais atentos a SEO do que a web em geral, então a taxa de adoção é um teto, não uma média da internet.

Eles procuraram /llms.txt na raiz com HTTP 200, confirmaram que o corpo era Markdown e não uma página de erro em HTML, e contaram os pedidos àquele caminho. Não checaram se o arquivo seguia a especificação à risca. O estudo mede o arquivo de índice, só o arquivo de índice Fonte [6].

O que acharam:

MedidaNúmero no estudo da AhrefsLeitura
Domínios com tráfego em maio de 2026137.210Base do vendor, enviesada para cliente técnico
Publicam um llms.txt válido28% (38.360)Teto, não média da web
Arquivos sem nenhum pedido em maio de 202697%Nem bot, nem pessoa
Pedidos que chegaram e vieram de bots96%Os 4% restantes foram pessoas
Pedidos de ferramentas de IA nomeadas, entre os que chegaram19,5%GPTBot em primeiro, Claude-Code em segundo
Bots de recuperação de busca de IA (OAI-SearchBot, PerplexityBot, busca do Claude)1,1% dos pedidosA busca que cita quase não lê o índice
Pedidos de quem estuda o próprio arquivo (ferramenta de GEO, scanner, pesquisa)cerca de 12%Auditoria, não citação
Pedidos de bot de IA a um /llms.txt que responde 404zeroNinguém sai procurando o arquivo ausente

O gráfico da Ahrefs marca 38.360 domínios com arquivo válido, 28% da base de 137.210. O complemento desenhado no mesmo gráfico, 98.640, soma 137 mil com os 38.360. É arredondamento do gráfico, não uma segunda contagem. Os cerca de 3% que receberam algum pedido concentram o tráfego medido, na ordem de 1,1 mil domínios e cerca de 22 mil pedidos. Dentro desse grupo pequeno, a auditoria de llms.txt do Lighthouse respondeu por cerca de 1 em cada 1.000 buscas (22 pedidos) Fonte [6].

Dois detalhes mudam a decisão de um comprador. O primeiro: "buscou" não é "usou". A Ahrefs escreve que muitos bots podem ter baixado o arquivo sem agir sobre o conteúdo, então cada percentual de IA é um teto Fonte [6]. O segundo: o bot de preview do Slack buscou o arquivo mais vezes do que o PerplexityBot. Um preview de link em chat não é uma citação.

A Ahrefs também separa quem lê. Agentes e infraestrutura agentiva foram 10,5% dos pedidos. Rastreadores de treino, 5,3%, com GPTBot sozinho em 4,51% e ClaudeBot em 0,8%. Assistentes acionados por uma pessoa, 2,5%. Bots de recuperação, 1,1%, e nesse grupo o OAI-SearchBot liderou com 0,74%. Claude-Code, o agente de código da Anthropic, superou cada bot de recuperação, cada assistente e cada rastreador de treino, fora o GPTBot e um indexador chamado statespace-indexer, cujo operador a Ahrefs identifica sem confirmar as faixas de IP Fonte [6].

O Googlebot apareceu cerca de 900 vezes em maio. A leitura da Ahrefs é a mesma do guia: o Googlebot busca URL que descobre, do mesmo jeito que busca um sitemap. Essas buscas não mostram interesse especial pelo llms.txt, e o estudo não vê se algum byte depois alimenta o Gemini Fonte [6]. Isso combina com o guia: indexar um tipo de arquivo a mais não cria tratamento especial Fonte [1].

Nos caminhos que responderam 404, a divisão inverteu. Arquivo válido atraiu 96% de bot. Arquivo ausente atraiu 98% de gente, e a fatia de bot de IA nesses 404 foi zero. Quem testa o URL no navegador, em geral para olhar o concorrente, é pessoa. Sistema de IA não sai à caça de um llms.txt que não foi publicado Fonte [6].

Há um achado de segurança que convém ler sem teatro. Entre os bots de pesquisa (2,7% dos pedidos), o maior se identificou como prompt-injection-survey/1.0. Alguém varre o arquivo como superfície de injeção de prompt, porque agente é feito para confiar no que o índice diz Fonte [6]. Motivo para tratar o arquivo como texto público e curto. Não é motivo para esconder instrução nele.

Estudo de vendor mede o log do vendor. Não mede quantas vezes o ChatGPT citou uma marca. Não prova que apagar o arquivo derruba citação, nem que publicar o arquivo sobe citação. Prova uma coisa mais simples: em maio de 2026, quase ninguém pediu o arquivo, e quem pediu quase não era o robô da busca que cita.

O que a OpenAI documenta de fato

A página "Overview of OpenAI crawlers", lida em 2 de outubro de 2026, separa quatro agentes. Cada um se controla sozinho Fonte [4].

AgentePara que a OpenAI diz que serveO que não é
OAI-SearchBotTrazer sites para os resultados de busca do ChatGPT. Site que bloqueia o robô não aparece nas respostas de busca, embora ainda possa surgir como link de navegação.Não é o arquivo llms.txt
GPTBotRastrear conteúdo que pode entrar no treino dos modelos de fundação. Bloquear indica que o conteúdo não deve treinar esses modelos.Não decide a busca
ChatGPT-UserVisita disparada por uma pessoa no ChatGPT ou num GPT personalizado. Como a ação começa no usuário, a regra de robots.txt pode não valer.A OpenAI diz que ele não decide o que entra na busca
OAI-AdsBotVisita só páginas enviadas como anúncio, para checar a página e a relevância do anúncio. O dado não treina modelo de fundação.Não é presença orgânica

Para a busca, a recomendação escrita é direta: permitir o OAI-SearchBot no robots.txt e permitir os pedidos que vêm das faixas de IP publicadas em https://openai.com/searchbot.json Fonte [4]. Há listas separadas para GPTBot, ChatGPT-User e OAI-AdsBot. Se o site permite os dois primeiros, a OpenAI pode usar um único rastreio para os dois fins, para não rastrear duas vezes. Mudança no robots.txt leva cerca de 24 horas para os sistemas deles ajustarem Fonte [4].

O exemplo de user-agent do OAI-SearchBot, na mesma página, termina em OAI-SearchBot/1.4 e no URL https://openai.com/searchbot. Quando buscam o robots.txt, podem acrescentar o marcador robots.txt no user-agent, para o log distinguir essa busca das outras Fonte [4]. Versão no user-agent pode mudar. A página avisa isso.

Nada nessa página diz "publique um llms.txt". O que a página diz sobre o arquivo está no cabeçalho da documentação, e o sentido é outro: "For the complete documentation index, see llms.txt" Fonte [4]. É um índice da documentação de desenvolvedor. O arquivo em https://developers.openai.com/llms.txt, lido no mesmo dia, confirma. O H1 é "OpenAI Developers". O blockquote descreve o hub de API, Ads, Codex e o restante. As seções H2 apontam para outros llms.txt de produto e para guias em .md: quickstart, referência, evals, comércio agentivo Fonte [5]. É o formato da especificação, usado para um agente achar a página certa da doc. Não é um arquivo dizendo ao ChatGPT para citar a OpenAI quando alguém pergunta por um fornecedor.

Confundir os quatro robôs é o erro que mais custa. Bloquear o GPTBot não é o mesmo que sair da busca. Permitir o GPTBot não coloca a página na resposta. O ChatGPT-User pode visitar uma URL que a pessoa pediu, e isso não é o llms.txt sendo "lido pelo ChatGPT". Anúncio tem robô próprio e, pela documentação, não treina modelo de fundação. Quem quiser aparecer na resposta de busca segue a linha do OAI-SearchBot e dos IPs, e ainda assim a presença não está garantida: isso depende de a página ser recuperada e de o modelo usá-la. O arquivo de índice não entra nessa frase.

Quando o arquivo ainda faz sentido

Faz sentido quando alguém já vai apontar um agente para o site e esse agente precisa de um mapa. A especificação descreve esse caso: documentação de biblioteca, referência de API, tutorial Fonte [3]. A OpenAI faz exatamente isso na documentação de desenvolvedor Fonte [4] Fonte [5]. A proposta cita o mesmo hábito em docs da Anthropic e do Gemini, com URLs na página da especificação Fonte [3]. Não abrimos esses dois arquivos nesta leitura. O que está verificado é o da OpenAI e o texto da proposta.

Também faz sentido como índice interno. Um agente de código que mantém o site, ou um agente da própria operação, gasta menos contexto se começa por uma lista curta de páginas Markdown do que se começa pelo HTML. A especificação recomenda testar o arquivo fazendo perguntas a um agente que só recebeu aquele llms.txt de partida Fonte [3]. Esse teste mede se o mapa está claro. Não mede citação.

Não faz sentido como projeto de visibilidade. A base do estudo de vendor é dura: 97% dos arquivos existentes não tiveram leitor nenhum num mês inteiro, e os bots que citam resposta foram 1,1% dos pedidos que existiram Fonte [6]. Publicar o arquivo não coloca o domínio num radar. Os 404 provam o contrário Fonte [6].

Por que a samambai mantém um

O estúdio publica https://samambai.com/llms.txt. O arquivo é um mapa curto: o que a empresa faz, preço público em dólar, como funciona o trabalho, contato e links para versões Markdown de páginas centrais. O motivo é o mesmo da documentação da OpenAI. Um agente que já foi mandado ao site consegue ler serviço, prazo e preço sem adivinhar o HTML. A operação da samambai é AI-first: pessoas mais agentes no próprio processo de construir, testar e auditar, sempre com revisão humana. Esse agente interno é leitor plausível do índice. O comprador que cola o URL num agente de código também é.

O arquivo não existe para ganhar citação. O Google diz que mantê-lo para outros sistemas não muda o Search Fonte [1] Fonte [2]. O estudo de vendor diz que, quando há leitor, ele se parece mais com agente de código do que com robô de busca Fonte [6]. Tratar o nosso arquivo como prova de GEO seria repetir o mito que esta página desmonta.

Se o mapa ficar velho, ele passa a mentir para o único leitor que importa. Preço, prazo e escopo no llms.txt têm de ser os mesmos do site. A especificação pede linguagem curta e descrição nos links Fonte [3]. Um índice desatualizado é pior do que índice nenhum, porque o agente que confia nele repete o erro.

O que fazer no lugar

Citação segue outro caminho. O texto longo está em o que faz uma empresa ser citada pelo ChatGPT, Gemini e pela IA do Google. Aqui fica a versão operacional, na ordem em que o trabalho trava.

  1. Acesso ao índice do motor que importa. No Google, a página precisa poder ser indexada e exibida com snippet, e o site precisa estar incluído no controle de IA generativa do Search Console. O guia diz que cumprir requisito não garante indexação nem exibição Fonte [1]. No ChatGPT, a busca pede OAI-SearchBot liberado e as faixas de IP de searchbot.json liberadas no firewall ou na CDN Fonte [4]. Bloquear o Googlebot para "evitar treino" e esperar citação na IA do Google é contradizer o guia: a busca generativa do Google parte do índice do Search Fonte [1].
  2. Uma página que responde a pergunta de compra. Preço, prazo, o que está incluso e a data em que aquilo vale. O guia pede conteúdo que não seja commodity: experiência própria, não um resumo do que já está em todo lugar Fonte [1]. "Soluções de IA para o seu negócio" não responde "quanto custa um sprint de automação".
  3. Confiança que não nasce no próprio site. Menção fabricada, rede de site satélite e texto escondido num botão "resumir com IA" estão do lado errado da política que o Google diz valer para a resposta gerativa desde o esclarecimento de 15 de maio de 2026 Fonte [2]. O guia diz que correr atrás de menção inautêntica não ajuda, porque ranking e filtro de spam continuam valendo para a função generativa Fonte [1].
  4. Frescor de fato, não de carimbo. Se o preço mudou, a página muda. Carimbar a data de hoje em texto velho não é atualização.

Medir sem se enganar: presença ao longo de muitas execuções da mesma pergunta, e impressões no relatório de IA generativa do Search Console. O guia aponta esse relatório. Ele mostra descoberta, não um ranking Fonte [1]. Um print de uma resposta é anedota. Ferramenta de terceiro que promete métrica interna do Google não tem esse acesso. O guia diz isso com todas as letras Fonte [1].

O serviço de GEO da samambai é esse trabalho: diagnóstico do que já está no índice, página que responde, corroboração real e rotina de atualização. Não é a instalação de um llms.txt. O preço público do estúdio está em preços: Sprint de US$ 1.200 por duas semanas, com cancelamento quando quiser; Projeto a partir de US$ 3.000, com escopo, prazo e preço fechados; Parceria a partir de US$ 900 por mês. A primeira conversa dura 30 minutos e não cria compromisso. GEO de um site específico é orçado depois dessa conversa, porque depende do que já está indexado. A página do serviço está em GEO.

Erros comuns

ErroPor que falha
Publicar o arquivo e esperar citação em uma semana97% dos arquivos do estudo não receberam pedido nenhum num mês. Bot de busca foi 1,1% do que chegou Fonte [6].
Achar que o Google penaliza ou premia o arquivoO guia e o changelog de 15 de junho de 2026 dizem o oposto: ignora, não ajuda e não atrapalha Fonte [1] Fonte [2].
Bloquear o GPTBot e concluir que saiu do ChatGPTOs controles são independentes. Busca é OAI-SearchBot. Treino é GPTBot Fonte [4].
Liberar só o ChatGPT-UserA OpenAI diz que esse agente não decide inclusão na busca Fonte [4].
Copiar um gerador de plugin e não manter o textoO leitor plausível é um agente que confia no mapa. Mapa velho repete preço errado.
Contar fetch no log como vitóriaA Ahrefs avisa que fetch não é uso Fonte [6].
Uma página por variação de pergunta, listada no arquivoO guia trata volume feito para manipular a resposta como abuso de conteúdo em escala Fonte [1].
Esconder instrução para o modelo gravar memóriaO arquivo é público. O estudo já viu crawler tratado como pesquisa de injeção Fonte [6].

O que não fazer

Não trocar a página que responde por um arquivo de índice. Não comprar menção. Não montar rede de domínio só para "citar" a marca. Não prometer, e não contratar quem prometa, a primeira posição no ChatGPT. Não usar o llms.txt como lugar de instrução ao modelo. Não tratar schema, chunking ou reescrita cosmética como substituto de índice e de prova Fonte [1].

Não apague o arquivo por medo de punição do Google. Não há punição documentada, nem prêmio Fonte [1] Fonte [2]. Apague ou deixe de criar se ninguém vai apontar um agente para ele e se o custo de mantê-lo atualizado for real. Um arquivo de 15 linhas que mente o preço custa mais do que zero linhas.

Não leia o estudo da Ahrefs como se fosse o Google. É log de um vendor, numa base de cliente técnico, num mês (maio de 2026). Serve para derrubar a fantasia de que "todo mundo já lê llms.txt". Não serve para cravar uma taxa de citação.

Quando não contratar a samambai

Não contrate o estúdio se o pedido for um destes:

  • Garantir o primeiro lugar no ChatGPT, no Gemini ou no Modo IA. Ninguém que lê a documentação oferece isso. O guia do Google diz que indexar não garante exibição Fonte [1].
  • Mídia paga. Gestão de anúncio não faz parte do que a samambai vende. OAI-AdsBot é um produto da OpenAI para quem anuncia no ChatGPT, e não faz parte do trabalho daqui Fonte [4].
  • Uma rede de sites, um pacote de menções ou um botão "resumir com IA" que tenta gravar memória no assistente. Isso é o tipo de manipulação que a política de spam do Google alcança na resposta gerativa Fonte [2].
  • Um projeto cujo entregável é o llms.txt, um schema especial ou uma página fatiada em chunks. O Google manda ignorar os três Fonte [1].
  • Resultado em poucos dias num site que não está no índice e não tem nenhuma corroboração de terceiro. Sem o primeiro portão, o arquivo não cria o segundo.
  • Uma URL nova para cada jeito de fazer a mesma pergunta. O guia chama isso de estratégia fraca e, quando o objetivo é manipular, de abuso de conteúdo em escala Fonte [1].

Faz sentido escrever para contato@samambai.com quando a página de venda ainda não responde preço e prazo, quando o robô certo está bloqueado, ou quando a marca é citada por um concorrente e não por quem faz o trabalho. A conversa de 30 minutos serve para dizer qual portão está fechado. Se o portão fechado for "falta um llms.txt", a resposta honesta é que esse não é o portão.

Perguntas frequentes

Publicar llms.txt faz a empresa ser citada no ChatGPT?

Não, pelo que a OpenAI documenta. A citação na busca do ChatGPT depende de liberar o OAI-SearchBot e os IPs publicados em openai.com/searchbot.json. A página de bots não trata o llms.txt como requisito de busca.

O Google penaliza quem publica o arquivo?

Não. O guia de 10 de julho de 2026 diz que o Google Search não usa o arquivo e que mantê-lo não ajuda nem atrapalha visibilidade ou ranking, inclusive nas funções de IA generativa.

Se o arquivo não recebe visita, ele está errado?

Na maior parte dos casos, ninguém foi buscá-lo. No estudo de vendor da Ahrefs, 97% dos arquivos válidos não receberam nenhum pedido em maio de 2026. Ausência de log não é prova de que o texto está mal escrito.

Por que a samambai mantém um llms.txt?

Porque é um índice curto do site para agente que já foi apontado para a documentação: serviços, preço público e páginas em Markdown. Não é um pedido de citação no ChatGPT.

O que substitui o arquivo se o objetivo é ser citado?

Os quatro portões: entrar no índice, responder à pergunta com preço e data, ter corroboração de terceiros e manter a página atual. O caminho está em o que faz uma empresa ser citada.

Fontes

  1. Optimizing your website for generative AI features on Google Search. Google Search Central. . voltar ao texto
  2. Clarifying guidance on llms.txt files. Google Search Central. . voltar ao texto
  3. The /llms.txt file, v2. Jeremy Howard, llmstxt.org. . voltar ao texto
  4. Overview of OpenAI crawlers. OpenAI. . voltar ao texto
  5. OpenAI Developers llms.txt. OpenAI. . voltar ao texto
  6. We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read. Ahrefs. . voltar ao texto

Descubra se a IA já indica a sua empresa.

Uma conversa de 30 minutos, sem compromisso.

ou escreva para contato@samambai.com