SEO

robots.txt ou noindex : ce que fait chacun et quand les utiliser

robots.txt contrôle l’exploration, noindex contrôle l’indexation. Ce qui arrive quand on les combine mal, comment traiter recherche interne et filtres.

robots.txt contrôle quelles URL un moteur de recherche peut explorer ; noindex contrôle quelles URL il peut indexer (afficher dans les résultats). Ce sont deux choses différentes et leur confusion produit l’erreur la plus classique du SEO technique : une page bloquée dans robots.txt peut continuer d’apparaître dans Google, et une page en noindex ne disparaît que si Google peut l’explorer pour lire la balise.

Cet article explique ce que fait chaque mécanisme, comment les combiner et quoi utiliser dans les cas habituels : recherche interne, filtres, pages d’administration et contenu en construction.

Ce que fait robots.txt

C’est un fichier texte à la racine du domaine (https://exemple.com/robots.txt) avec des règles par agent utilisateur indiquant quels chemins ne doivent pas être demandés :

User-agent: *
Allow: /
Disallow: /recherche/
Disallow: /*?q=

Sitemap: https://exemple.com/sitemap.xml

Points clés de la documentation de Google :

  • Il sert à gérer l’exploration : éviter que le robot perde du temps sur des pages sans valeur ou surcharge le serveur.
  • Il n’empêche pas l’indexation. Si d’autres pages lient une URL bloquée, Google peut l’indexer sans la visiter, en n’affichant que l’URL et un texte du type « aucune information n’est disponible pour cette page ».
  • Il est public : n’importe qui peut le lire. N’y mettez pas de chemins que vous voulez garder secrets.
  • Depuis septembre 2019, Google ne prend plus en charge noindex dans robots.txt ; cette règle est ignorée.
  • La ligne Sitemap: est la façon la plus simple de déclarer le sitemap et peut figurer même si vous l’envoyez aussi via Search Console.

Ce que fait noindex

noindex indique au moteur de ne pas inclure la page dans ses résultats. Il se déclare de deux façons :

<!-- Dans le <head> d’une page HTML -->
<meta name="robots" content="noindex, follow" />
# En en-tête HTTP, pour tout type de fichier (PDF, images, JSON...)
X-Robots-Tag: noindex

Deux nuances importantes :

  • Pour fonctionner, le robot doit pouvoir explorer la page et lire la balise. Si vous la bloquez aussi dans robots.txt, il ne verra jamais le noindex.
  • follow (la valeur par défaut) permet aux liens de la page de continuer à transmettre des signaux. noindex, nofollow coupe aussi cela ; ne l’utilisez que si vous ne voulez pas que les liens soient suivis.

Avec le temps, Google traite un noindex prolongé comme un signal pour explorer cette URL moins souvent, mais c’est une conséquence, pas l’objectif.

La mauvaise combinaison

Configuration Résultat
Bloquée dans robots.txt, sans noindex Peut apparaître dans les résultats (URL seule), car Google ne peut pas lire la page mais sait qu’elle existe grâce aux liens.
Bloquée dans robots.txt et avec noindex Comme ci-dessus : le noindex n’est jamais lu.
Explorable, avec noindex Disparaît des résultats dès que Google la réexplore. Correct pour désindexer.
Explorable, sans noindex Indexée normalement.

Conclusion pratique : si vous voulez qu’une URL n’apparaisse pas dans Google, utilisez noindex et laissez-la explorable. Ce n’est qu’après sa disparition qu’il a un sens, pour économiser le budget d’exploration, de la bloquer dans robots.txt.

Quoi utiliser dans chaque cas

Cas Recommandation
Résultats de recherche interne (/recherche/?q=...) noindex sur la page. En option, Disallow dans robots.txt une fois désindexées, pour ne pas explorer des combinaisons infinies.
Filtres et tris avec paramètres (?tri=prix) rel="canonical" vers l’URL sans paramètres ; s’ils génèrent beaucoup de combinaisons, noindex.
Page d’administration ou de connexion noindex + vraie protection par authentification. robots.txt n’est pas une mesure de sécurité.
Pages vides ou en construction noindex tant qu’elles n’ont pas de contenu ; retirez-le à la publication.
Fichiers à exclure des résultats (PDF internes, JSON) En-tête X-Robots-Tag: noindex.
Ressources dont le robot n’a pas besoin (scripts d’un panneau interne) Disallow dans robots.txt. Ne bloquez jamais le CSS et le JS dont la page publique a besoin pour s’afficher.
Environnement de test (staging) Authentification HTTP. Sinon, noindex sur toutes les pages ; ne comptez pas seulement sur robots.txt.

Erreurs fréquentes

  1. Bloquer le CSS ou le JavaScript dans robots.txt. Google rend les pages ; s’il ne peut pas charger leurs ressources, il les jugera cassées.
  2. Oublier de retirer le noindex au passage en production. La cause la plus fréquente de « mon nouveau site n’apparaît pas ». Vérifiez le gabarit et les en-têtes du serveur.
  3. Utiliser robots.txt pour « effacer » des pages de Google. Ça ne marche pas ; utilisez noindex ou, si la page n’existe plus, renvoyez 404 ou 410.
  4. Bloquer le sitemap ou la page d’accueil par un Disallow: / oublié de la phase de développement.
  5. Mettre noindex sur des pages importantes (catégories, auteur, accueil) en appliquant les règles génériques d’un plugin.

Comment vérifier

  • Inspection d’URL dans Search Console : indique si l’URL est bloquée par robots.txt, si elle a un noindex et si elle est indexée.
  • Rapport sur les pages (Indexation) : regroupe les URL exclues par motif (« Bloquée par robots.txt », « Exclue par la balise noindex », « Indexée malgré le blocage par robots.txt »). Cette dernière catégorie est exactement le symptôme de la mauvaise combinaison.
  • Rapport robots.txt dans Search Console : montre quelle version du fichier Google possède et s’il contient des erreurs de syntaxe.

Conclusion

robots.txt dit « n’entre pas ici » ; noindex dit « ne m’affiche pas ». Pour qu’une chose n’apparaisse pas dans Google, elle doit être explorable et porter un noindex. Réservez robots.txt à l’économie d’exploration sur les zones sans valeur et à la déclaration du sitemap, et vérifiez dans Search Console qu’il n’y a pas de pages « indexées malgré le blocage » : c’est le signe que les deux mécanismes se marchent dessus.

Sources et références

  1. Google Search Central : introduction au fichier robots.txt developers.google.com
  2. Google Search Central : écrire et envoyer un fichier robots.txt developers.google.com
  3. Google Search Central : bloquer l’indexation avec noindex developers.google.com
  4. Google Search Central : spécifications de la balise meta robots et de X-Robots-Tag developers.google.com
  5. Google Search Central Blog : A note on unsupported rules in robots.txt (2019) developers.google.com
Articles de SEO