SEO technique • Crawl et indexation

Comment utiliser X-Robots-Tag pour contrôler l’indexation d’un PDF ?

Vérifiez les en-têtes X-Robots-Tag d’un PDF, comprenez comment appliquer noindex aux fichiers non HTML et contrôlez que le crawler peut lire la directive.

Par l’équipe Limpi. Les faits externes sont distingués des méthodes Limpi et aucune visibilité, position ou citation automatique n’est garantie.

Comprendre le problème

Un PDF ne possède pas de head HTML dans lequel placer une meta robots. X-Robots-Tag permet d’envoyer une directive dans les en-têtes HTTP d’une ressource, ce qui convient notamment aux fichiers non HTML. Pour qu’une directive noindex soit lue, le crawler doit toutefois pouvoir accéder à la réponse qui la contient.

Inspecter le comportement réellement servi

Demandez le PDF avec un outil qui affiche les en-têtes de la réponse finale. Relevez le statut, Content-Type, X-Robots-Tag, éventuelles redirections et règles robots.txt applicables à l’URL. Vérifiez la réponse réellement servie par le CDN ou le stockage public, pas seulement la configuration déclarée dans l’application.

Distinguer les mécanismes proches

X-Robots-Tag contrôle l’indexation selon les directives reconnues ; il ne chiffre pas le fichier et ne remplace pas une authentification. robots.txt agit sur l’exploration, tandis qu’une redirection change la ressource atteinte. Gardez ces mécanismes séparés afin de diagnostiquer correctement un PDF public mais volontairement non indexable.

Identifier les causes probables

L’en-tête peut manquer parce que le PDF est servi directement par un CDN ou un bucket qui contourne l’application. Une règle Nginx peut s’appliquer à HTML mais pas aux fichiers statiques, ou l’en-tête peut disparaître après une redirection. Une configuration globale peut également appliquer noindex à des PDF qui devraient rester indexables.

Corriger à la bonne couche

Ajoutez X-Robots-Tag sur la couche qui sert réellement le fichier et limitez la règle au périmètre voulu. Vérifiez le header après toutes les redirections. Si le PDF contient une information privée, ne vous contentez pas de noindex : protégez l’accès. Si le document doit être indexable, retirez la directive qui contredit cet objectif.

Traiter les cas limites sans automatisme

Un même fichier peut être accessible par plusieurs URLs, avec ou sans paramètres. Vérifiez chacune des variantes publiques importantes et la stratégie de canonicalisation ou redirection applicable. Si robots.txt bloque entièrement l’URL, le crawler peut ne pas récupérer l’en-tête ; évitez donc une combinaison contradictoire lorsque noindex est votre mécanisme choisi.

Valider sur des cas réels

Après configuration, effectuez un GET sur l’URL finale et confirmez le statut, le Content-Type et la valeur exacte de X-Robots-Tag. Testez aussi un PDF qui ne doit pas recevoir la règle afin d’éviter une portée globale accidentelle. Contrôlez la configuration du CDN après déploiement, car il peut mettre en cache les anciens en-têtes.

Conserver une preuve reproductible

Conservez la commande ou capture montrant l’URL finale et les en-têtes, ainsi que la règle serveur qui les génère. Notez l’objectif d’indexation du fichier. Une preuve avant/après doit démontrer que la directive est portée par la réponse du PDF lui-même et qu’elle n’a pas été seulement ajoutée à une page HTML de téléchargement.

Prévenir la régression

Gérez les règles X-Robots-Tag dans une configuration versionnée et testez un échantillon de fichiers à chaque changement de CDN ou stockage. Un inventaire des documents publics peut indiquer ceux qui sont indexables, noindex ou privés. Évitez d’utiliser l’extension seule si la même route peut servir des contenus de politiques différentes.

Clôturer le diagnostic

X-Robots-Tag est adapté aux ressources non HTML lorsqu’une directive d’indexation doit voyager dans la réponse HTTP. Vérifiez l’accès du crawler, la portée de la règle et la réponse finale. Pour la confidentialité, utilisez toujours un vrai contrôle d’accès plutôt qu’une instruction destinée aux moteurs.

Construire une matrice de contrôle

Pour X-Robots-Tag sur un PDF, construisez une matrice qui sépare constat, intention, couche propriétaire et preuve finale. Le périmètre documentaire de cette page est volontairement borné : Présenter X-Robots-Tag comme un moyen de transmettre des règles aux ressources non HTML et rappeler que le crawler doit pouvoir accéder à la réponse pour lire l’en-tête. Ajoutez au minimum le contexte de test, la valeur observée, le résultat attendu, l'origine technique supposée puis confirmée, et la méthode de revalidation. Quand plusieurs gabarits partagent le même composant, échantillonnez des cas représentatifs plutôt que de multiplier des constats identiques. Une anomalie ambiguë doit rester en revue jusqu'à ce qu'une preuve distingue clairement configuration, contenu et comportement réellement servi. Cette matrice permet aussi de vérifier qu'une correction locale ne masque pas un problème global et qu'un changement d'infrastructure n'est pas confondu avec une décision éditoriale.

Relier ce contrôle au reste du diagnostic

Ce sujet ne doit pas être traité isolément. Vérifiez les pages et contrôles liés /seo/indexation-crawl, /seo/x-robots-tag, /seo/meta-robots-noindex-nofollow, puis comparez leurs conclusions avec l'intention « x robots tag pdf noindex ». Les sources officielles associées à cette page sont google_robots_meta; elles bornent les affirmations externes et doivent être revalidées si leur documentation évolue. Ne transformez pas une recommandation Limpi en règle universelle : distinguez ce qui est imposé par une spécification, ce qui dépend d'un moteur ou navigateur et ce qui relève d'un choix d'implémentation. Terminez par un contrôle de cohérence entre title, H1, contenu visible, canonical, maillage et données structurées. Si deux signaux se contredisent, conservez le cas en revue au lieu de conclure sur la base d'un seul outil. Consignez enfin la date du contrôle, le gabarit concerné et le propriétaire de la correction afin de pouvoir rejouer exactement le même scénario après une évolution du site. Pour isoler ce diagnostic, relevez aussi Content-Type application/pdf, réponse HEAD et GET, configuration Nginx add_header, bucket objet, CDN edge, règle par extension, chemin de stockage, X-Robots-Tag HTTP, cache des en-têtes, variante de fichier et éventuel Link header. Cette nomenclature permet d'attribuer la directive au serveur du document plutôt qu'à une page HTML voisine ou à une règle d'exploration distincte. Ajoutez MIME, disposition inline, téléchargement attachment, stockage S3, règle location, proxy_cache, header always, object metadata, signed URL, query string, version de fichier, purge CDN, curl -I, curl -D, redirection 302, ressource binaire, cache-control, content-length, accept-ranges, etag et last-modified.

Sources officielles

Les règles des moteurs et des fournisseurs de crawlers peuvent évoluer. Les affirmations techniques de cette page sont bornées par les documentations officielles ci-dessous.