1001Ferramentas
🤖Geradores

Gerador de meta robots

Monta a meta tag robots com diretivas (index/noindex, follow/nofollow, noarchive, nosnippet etc).


  

A tag meta robots: controle cirúrgico sobre como buscadores indexam suas páginas

A tag <meta name="robots"> mora dentro do <head> de um documento HTML e diz aos crawlers do Google, Bing, Yandex, assistentes de IA e demais bots como eles podem usar aquela página. É o instrumento mais cirúrgico do SEO técnico porque atua por URL e por bot — diferente do robots.txt, que age por diretório e só bloqueia o rastreamento. Configurar certo significa que páginas promocionais desaparecem do SERP no momento certo, staging nunca vaza e scrapers de IA recebem exatamente a política que você decidiu. Configurar errado derruba seções inteiras do site do Google em silêncio.

Sintaxe, padrões e combinações comuns de diretivas

A sintaxe básica é <meta name="robots" content="...">, onde o atributo content recebe uma lista de diretivas separadas por vírgula. Os dois padrões implícitos são index (a página pode aparecer no SERP) e follow (o link equity é repassado pelos links de saída). Só é preciso declarar o oposto quando você quer divergir do padrão. Combinações frequentes: noindex, follow (típica para arquivos paginados que não devem ranquear mas precisam distribuir equity aos filhos), index, nofollow (páginas indexáveis cheias de links UGC não confiáveis), noindex, nofollow (opt-out mais forte), noarchive (indexar mas sem cache) e nosnippet (sem preview de texto no SERP).

<meta name="robots" content="index, follow, max-image-preview:large">
<meta name="robots" content="noindex, follow">
<meta name="robots" content="noindex, nofollow, noarchive">
<meta name="robots" content="max-snippet:160, max-image-preview:large, max-video-preview:30">
<meta name="robots" content="noindex, unavailable_after:2026-12-31T23:59:59-03:00">

Overrides específicos por bot: googlebot, bingbot e crawlers de IA

Você pode mirar um crawler específico trocando robots pelo token user-agent do bot. Uma diretiva <meta name="googlebot" content="..."> sobrescreve a tag genérica robots só para o Google; o mesmo truque vale para bingbot, slurp (Yahoo), msnbot, applebot e os novos crawlers de IA. Desde 2023, GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Google-Extended (dados de treino para o Gemini), PerplexityBot e Bytespider viraram fontes de tráfego relevantes. Alguns publishers querem indexar nas buscas tradicionais mas bloquear treino de modelos; meta robots é um dos dois pontos de controle.

<meta name="googlebot" content="noindex, nofollow">
<meta name="bingbot" content="noarchive">
<meta name="GPTBot" content="noindex">
<meta name="ClaudeBot" content="noindex">
<meta name="Google-Extended" content="noindex">

Cabeçalho HTTP X-Robots-Tag para arquivos não-HTML

A meta robots só funciona em HTML, então PDFs, imagens, vídeos, feeds JSON e qualquer outro binário precisam do equivalente em cabeçalho HTTP, o X-Robots-Tag. Configure no servidor (Nginx, Apache, Cloudflare Workers) e você consegue noindex em massa uma pasta inteira /downloads/ sem tocar em arquivo nenhum. O cabeçalho aceita todas as diretivas da meta tag e também suporta sintaxe por bot, tipo X-Robots-Tag: googlebot: noindex.

# Nginx
location ~* \.(pdf|docx)$ {
  add_header X-Robots-Tag "noindex, nofollow" always;
}

# Apache .htaccess
<FilesMatch "\.(pdf|docx)$">
  Header set X-Robots-Tag "noindex, nofollow"
</FilesMatch>

Robots.txt vs meta robots: a armadilha clássica

Uma página que está ao mesmo tempo Disallow'd no robots.txt E com noindex na meta tag, paradoxalmente, ainda aparece nos resultados do Google — geralmente com o famoso snippet "Não há informações disponíveis para esta página". O motivo é mecânico: se o robots.txt proíbe o rastreamento, o Google nunca baixa o HTML, nunca vê o noindex e portanto nunca remove a URL do índice quando ela foi descoberta por backlinks. O workflow correto é: primeiro publicar a página com noindex, esperar o próximo crawl e só então adicionar o disallow se também quiser economizar crawl budget.

Erros comuns que destroem o tráfego orgânico

  • Deixar noindex depois do deploy — a causa número um de queda repentina de tráfego. Audite os templates de staging antes do merge para produção.
  • Usar nofollow em navegação interna — isso é PageRank sculpting e o Google desencoraja explicitamente desde 2009.
  • Colocar noindex em páginas alvo de canonical — o Google às vezes interpreta como sinal contraditório e pode ignorar o canonical.
  • Combinar disallow no robots.txt com noindex na meta, como discutido acima.
  • Esquecer de max-image-preview:large — sem isso, cards ricos em Discover e SERP caem para miniaturas pequenas por padrão.

Perguntas frequentes

Quanto tempo até uma página com noindex sumir do Google? Em média sete dias, às vezes mais rápido em sites de alta autoridade e mais lento em URLs órfãs. Dá para acelerar pedindo reindexação no Google Search Console.

O cabeçalho HTTP X-Robots-Tag é equivalente à meta tag? Sim, totalmente equivalente em diretivas e em targeting por bot. Use o cabeçalho para arquivos não-HTML ou quando não puder editar o HTML.

Como bloquear bots de IA de treinarem com meu conteúdo? Em duas camadas: adicione User-agent: GPTBot seguido de Disallow: / no robots.txt (e repita para ClaudeBot, CCBot, Google-Extended, PerplexityBot), e adicione meta robots com o token de cada bot nas páginas HTML.

noindex também impede o repasse de link equity? Não diretamente. O Google declarou que noindex, follow a longo prazo se comporta como noindex, nofollow porque a URL é removida do índice. Para arquivos paginados, prefira canonical + páginas filhas indexáveis.

Ferramentas Relacionadas