GEO • Crawlers et contrôles

Comment contrôler PerplexityBot avec robots.txt ?

Comprenez le rôle documenté de PerplexityBot, comment robots.txt peut contrôler son accès et quelles limites distinguer du trafic utilisateur Perplexity.

Par l’équipe Limpi. Les faits externes sont distingués des méthodes Limpi et aucune visibilité, position ou citation automatique n’est garantie.

Quel est le rôle documenté de PerplexityBot ?

Perplexity présente PerplexityBot comme un robot automatique destiné à faire remonter et relier des sites dans ses résultats de recherche. La documentation actuelle précise qu’il n’est pas utilisé pour crawler du contenu destiné à l’entraînement de modèles fondamentaux. Pour un propriétaire de site, la décision robots doit donc être reliée à l’objectif de visibilité dans la recherche Perplexity, sans promettre de citation.

PerplexityBot et Perplexity-User

Perplexity-User sert aux actions déclenchées par un utilisateur. Lorsqu’une personne pose une question, le service peut visiter une page afin de produire une réponse plus précise et éventuellement inclure un lien. La documentation indique que ce fetch initié par l’utilisateur ignore généralement robots.txt. Il est donc incorrect de résumer toute la politique Perplexity à une seule ligne User-agent.

Comment agir avec robots.txt ?

Perplexity publie les noms d’agents à utiliser dans robots.txt. Une règle ciblée sur PerplexityBot permet de définir les chemins accessibles ou interdits à ce crawler. Vérifiez toujours la portée de la règle et le groupe auquel elle appartient. La documentation précise que les réglages fonctionnent indépendamment et qu’un changement peut prendre jusqu’à vingt-quatre heures à être reflété.

Robots et WAF sont différents

robots.txt exprime une préférence de crawl. Un pare-feu applicatif décide si la requête peut atteindre le site. Perplexity publie des plages IP pour ses agents et propose des recommandations WAF combinant User-Agent et plages officielles. Autoriser dans robots.txt ne suffit donc pas si Cloudflare ou un autre WAF renvoie ensuite 403.

Vérifier le trafic

Analysez les logs serveur en recherchant les User-Agents documentés. Si la vérification doit être stricte, comparez aussi les adresses source aux plages publiées par Perplexity. Observez les statuts HTTP, les chemins visités et la fréquence. Cette méthode permet de distinguer une règle robots, un blocage réseau et une erreur applicative.

Autoriser ne garantit pas une citation

Le crawl n’est pas une promesse de présence dans une réponse. La page doit encore être accessible, utile et pertinente. Les systèmes de réponse peuvent tenir compte de nombreuses informations sans qu’un score public unique permette de prédire l’inclusion. Une page sur le crawler doit donc rester séparée des guides sur l’autorité, les entités ou le contenu extractible.

Décider d’autoriser ou de bloquer

Commencez par l’objectif. Si vous souhaitez permettre la découverte de pages publiques par PerplexityBot, un blocage global est contradictoire avec ce but. Si certaines zones ne doivent pas être explorées, une règle ciblée est préférable. Les zones privées ne doivent jamais dépendre de robots.txt pour leur sécurité : authentification et autorisation restent indispensables.

Méthode d’audit

Vérifiez successivement robots.txt, statut HTTP, WAF, logs et accessibilité du contenu. Documentez PerplexityBot et Perplexity-User séparément. Après un changement, attendez le délai annoncé par le fournisseur avant de tirer une conclusion. Ne confondez pas absence de requêtes et absence de visibilité : le crawl n’est qu’un maillon du système.

Fraîcheur de la documentation

Les noms d’agents, plages IP et comportements peuvent évoluer. Utilisez la documentation officielle et les endpoints IP publiés comme sources de vérité. Évitez de copier durablement une liste trouvée dans un article tiers. Cette page doit donc être revue de manière event-driven lorsqu’une documentation Perplexity change.

Questions fréquentes

PerplexityBot sert-il au training des modèles fondamentaux ? La documentation actuelle dit non pour ce bot. Perplexity-User respecte-t-il robots.txt comme un crawler classique ? Perplexity dit que les fetchs initiés par l’utilisateur l’ignorent généralement. Autoriser PerplexityBot garantit-il une citation ? Non.

Checklist de diagnostic

Commencez par télécharger le robots.txt public et vérifier la règle qui s’applique réellement à PerplexityBot. Contrôlez ensuite une URL représentative dans les logs : User-Agent, adresse source, statut HTTP et éventuelle intervention du WAF. Si la requête n’atteint jamais l’application, une modification robots ne résoudra pas le problème. Si elle atteint la page mais reçoit un statut inattendu, cherchez la règle réseau ou applicative responsable avant de conclure à un problème de crawler.

Séparer politique de crawl et politique de contenu

Une organisation peut accepter le crawl de pages publiques tout en protégeant strictement les espaces privés. La décision robots doit donc être prise chemin par chemin lorsque les objectifs diffèrent. Ne placez jamais une donnée confidentielle derrière robots.txt comme seule protection. À l’inverse, un blocage global d’un bot public peut être excessif si l’objectif marketing est précisément de permettre la découverte de contenus éditoriaux ou de documentation.

Comment mesurer après un changement

Après avoir modifié une règle, laissez le délai annoncé par le fournisseur puis observez de nouveaux hits dans les logs. Comparez la fréquence, les statuts et les chemins parcourus avant et après. Ne déduisez pas une amélioration de visibilité à partir du seul retour du bot : la présence dans une réponse dépend de nombreux facteurs non publics. Le bon indicateur technique est d’abord que la politique d’accès choisie soit effectivement respectée et que les pages autorisées soient servies correctement.

Quand revoir la politique ?

Réexaminez la configuration lorsque Perplexity modifie sa documentation, lorsqu’un WAF ou CDN est remplacé ou lorsqu’une nouvelle zone du site devient publique. Conservez la date du dernier contrôle et la source officielle utilisée. Cela permet de distinguer une règle historique d’une décision encore valide et évite de recopier indéfiniment une configuration devenue obsolète.

Cas d’un blocage involontaire

Si le bot reçoit des 403 alors que robots.txt l’autorise, inspectez le WAF, les règles anti-bot, le CDN et les limitations de fréquence. À l’inverse, si robots.txt le bloque volontairement mais que des requêtes apparaissent encore dans les logs, distinguez PerplexityBot de Perplexity-User avant de conclure à un non-respect. Les deux agents n’ont pas la même fonction documentée.

Critère de validation

Le contrôle est satisfaisant lorsque la règle publique correspond à la décision de l’organisation, que les requêtes observées reçoivent les statuts attendus et que les zones privées restent protégées par de vrais contrôles d’accès. Le résultat technique ne doit pas être confondu avec une promesse de citation ou de visibilité.

Sources officielles

Les règles des moteurs et des fournisseurs de crawlers peuvent évoluer. Les affirmations techniques de cette page sont bornées par les documentations officielles ci-dessous.