LimpiVOTRE SITE, AU CLAIR
Indexation & exploration

Robots.txt : le fichier qui guide (ou bloque) les robots

L'essentiel
  • Le robots.txt dit aux robots où ils peuvent aller : il gère l’exploration, pas la confidentialité.
  • Une page bloquée par robots.txt peut quand même apparaître dans Google si d’autres sites la lient — pour la cacher, c’est noindex.
  • Le danger n°1 : un Disallow: / qui bloque tout le site par accident.

À l’entrée de votre site, il y a un petit panneau que lisent tous les robots des moteurs de recherche avant d’entrer : le fichier robots.txt. Il leur dit où ils ont le droit d’aller. Bien réglé, il vous fait gagner en efficacité. Mal réglé, il peut rendre votre site entier invisible. Voici comment le comprendre et le corriger sans risque.

Robots.txt, c’est quoi ?

Le robots.txt est un simple fichier texte placé à la racine de votre site (à l’adresse votresite.fr/robots.txt). Il indique aux robots d’exploration quelles parties de votre site ils peuvent parcourir, et lesquelles ils doivent laisser de côté. Son rôle principal : gérer le trafic des robots pour éviter de surcharger votre serveur, et leur éviter de perdre du temps sur des pages sans intérêt.

Ce que le robots.txt fait — et ne fait PAS

C’est le malentendu le plus courant, alors soyons clairs. Le robots.txt contrôle l’exploration (le crawl), pas l’indexation ni la confidentialité. Conséquence importante, confirmée par Google : une page bloquée par robots.txt peut quand même apparaître dans les résultats de recherche si d’autres sites pointent vers elle. Google ne lira pas son contenu, mais l’adresse peut s’afficher.

Donc si votre objectif est de cacher une page (la sortir des résultats), le robots.txt n’est pas le bon outil : il faut une balise noindex ou une protection par mot de passe. Et ce n’est pas non plus une mesure de sécurité : les robots malveillants ignorent tout simplement le fichier.

À quoi ressemble un robots.txt

Il fonctionne par règles simples. Les principales :

  • User-agent: à quel robot s’adresse la règle (* = tous).
  • Disallow: un chemin que le robot ne doit pas explorer.
  • Allow: une exception, un chemin autorisé à l’intérieur d’une zone interdite.
  • Sitemap: l’adresse de votre sitemap, pour aider Google à le trouver.

Par exemple, bloquer l’accès au dossier d’administration pour tous les robots s’écrit : User-agent: * puis Disallow: /admin/.

Le piège n°1 : bloquer tout son site par erreur

La ligne la plus dangereuse au monde dans un robots.txt est Disallow: / sous User-agent: * : elle interdit l’exploration de tout le site. On la retrouve souvent par accident, copiée depuis un site de préproduction (où elle est normale) vers le site en production. Résultat : Google cesse d’explorer, et votre référencement s’effondre. C’est l’une des toutes premières choses à vérifier.

Comment lire le vôtre

  1. Tapez son adresse : votresite.fr/robots.txt. Vous verrez son contenu directement.
  2. Cherchez les lignes Disallow: et vérifiez qu’aucune ne bloque une partie importante du site (et surtout pas un Disallow: / tout seul).
  3. Utilisez la Search Console (rapport robots.txt) ou Limpi, qui repère les pages stratégiques bloquées par erreur.

Les bonnes pratiques

  • À la racine exacte du domaine : un robots.txt dans un sous-dossier est ignoré.
  • Un fichier par domaine (et par sous-domaine) : les règles ne valent que pour l’hôte où le fichier est posé.
  • Déclarez-y votre sitemap : une ligne Sitemap: aide Google à le trouver.
  • Ne vous en servez pas pour la sécurité : pour du vraiment privé, mot de passe obligatoire.

Comment le corriger sans rien casser

Sur un CMS comme Wix ou Shopify, vous ne modifiez pas toujours le fichier directement : passez par les réglages SEO de votre plateforme. Sur WordPress, les extensions SEO permettent de l’éditer proprement. Si vous y touchez à la main, testez toujours le résultat avant de le laisser en place. Et dans le doute, un robots.txt minimal qui autorise tout est parfaitement valable : User-agent: * suivi de Allow: /.

À vérifier en priorité

Ouvrez votresite.fr/robots.txt et assurez-vous qu’il n’y a pas de Disallow: / qui traîne. Cette seule ligne peut rendre tout votre site invisible à Google.

Le robots.txt dit aux robots où aller, pas quoi cacher. Pour qu’une page disparaisse des résultats, c’est le noindex qu’il vous faut.

Un exemple concret, commenté

Voici à quoi ressemble un robots.txt très courant : User-agent: * (la règle vaut pour tous les robots), Disallow: /wp-admin/ (on interdit l’accès à l’administration), Allow: /wp-admin/admin-ajax.php (sauf ce fichier précis, nécessaire au bon fonctionnement), et enfin Sitemap: https://votresite.fr/sitemap.xml (on indique où se trouve le plan du site). Rien d’ésotérique : on autorise tout par défaut, on protège la zone technique, et on tend le sitemap. C’est suffisant pour l’immense majorité des sites.

Et les robots des IA ?

Bonne nouvelle : les robots des intelligences artificielles (GPTBot, ClaudeBot, PerplexityBot…) se gèrent dans ce même fichier, exactement comme celui de Google. Vous décidez, robot par robot, de les autoriser ou non. C’est un sujet à part entière — autorisation, visibilité dans ChatGPT et Perplexity — que nous détaillons dans un autre article du blog, mais retenez que tout part du robots.txt.

Que se passe-t-il si je n’ai pas de robots.txt ?

Rien de grave : en l’absence de robots.txt, les robots considèrent qu’ils peuvent tout explorer. C’est un comportement parfaitement valable pour un petit site qui n’a rien à cacher. La Search Console peut afficher un message indiquant que le fichier est introuvable (erreur 404 sur le robots.txt) — ce n’est pas un problème, et l’avertissement disparaît de lui-même au bout d’un moment. Vous n’êtes donc pas obligé d’en créer un ; faites-le surtout si vous voulez guider l’exploration ou déclarer votre sitemap.

Robots.txt et « budget de crawl »

Google ne consacre qu’un temps limité à explorer chaque site. En bloquant les zones sans intérêt — recherche interne, pages de filtres qui se multiplient à l’infini, espaces purement techniques — vous évitez que les robots y gaspillent ce temps, et vous les orientez vers les pages qui comptent vraiment. Sur un petit site, l’effet reste marginal ; mais sur un site qui génère beaucoup d’URLs automatiques, c’est un vrai levier d’efficacité. Une précaution toutefois : ne bloquez que ce dont vous êtes certain. Dans le doute, mieux vaut laisser Google explorer que de risquer de cacher une page utile.

En résumé

Le robots.txt est un petit fichier à fort pouvoir : il guide l’exploration de votre site par les moteurs. Il gère le crawl, pas la confidentialité ni l’indexation — une page bloquée peut quand même apparaître si elle est liée ailleurs. Vérifiez régulièrement le vôtre, traquez le redoutable Disallow: /, déclarez-y votre sitemap, et ne comptez jamais dessus pour protéger des données sensibles.

Questions fréquentes

Un fichier robots.txt est-il obligatoire ?

Non. Sans lui, les robots considèrent qu’ils peuvent tout explorer. Mais il est utile pour guider l’exploration et déclarer votre sitemap.

Le robots.txt cache-t-il une page de Google ?

Non. Il empêche l’exploration, pas l’affichage : une page bloquée peut quand même apparaître si elle est liée depuis d’autres sites. Pour la cacher, utilisez noindex.

Où doit se trouver le fichier ?

À la racine exacte du domaine (votresite.fr/robots.txt). Placé dans un sous-dossier, il est ignoré par les moteurs.

Comment bloquer seulement un dossier ?

Avec une règle du type Disallow: /dossier/ sous le bon User-agent. Le reste du site reste explorable.

J’ai un « Disallow: / » dans mon fichier, c’est grave ?

Oui, très : cette ligne bloque l’exploration de tout le site. Si elle n’est pas volontaire, corrigez-la en urgence.

Sources et références

  1. Google Search CentralIntroduction au fichier robots.txt (mis à jour déc. 2025)
  2. Google for DevelopersCréer et envoyer un fichier robots.txt (mis à jour nov. 2025)

Vous voulez savoir ce qu'il en est sur VOTRE site ?

Limpi analyse votre site et vous dit, en clair, ce qui cloche et comment le corriger. Sans jargon.

Analyser mon site gratuitement