Testeur et Validateur de Robots.txt - Vérificateur Gratuit
Testeur de Robots.txt
Validez vos directives d'exploration instantanément
Contrôle des Robots
Gérez la façon dont les robots des moteurs de recherche perçoivent et parcourent la structure de votre site web.
Confidentialité des Données
Identifiez et bloquez les répertoires sensibles (comme /admin ou /prive) pour qu'ils n'apparaissent pas dans les résultats de recherche.
Regex et Caractères Génériques
Notre testeur prend en charge des motifs de correspondance avancés, y compris * (caractère générique) et $ (ancrage de fin).
Retour Instantané
Validation en temps réel de vos règles sans avoir besoin de d'abord téléverser le fichier sur votre serveur.
Comprendre les Règles de Robots.txt
Le fichier `robots.txt` est la première chose qu'un robot recherche en visitant votre site. Il contient un ensemble de « directives » qui indiquent à des robots spécifiques quelles parties de votre site web ils ne doivent pas visiter. Bien que la plupart des robots suivent ces règles, elles ne constituent pas une mesure de sécurité — elles s'apparentent davantage à un panneau « Défense d'entrer ».
Grâce à notre Testeur de Robots.txt, vous pouvez déboguer des ensembles de règles complexes et vous assurer que des pages importantes ne sont pas accidentellement bloquées de l'indexation par Google ou Bing.
Directives Courantes
- User-agent : Spécifie à quel robot s'appliquent les règles suivantes (ex., `*` pour tous, `Googlebot`).
- Disallow : Spécifie un chemin qui ne doit PAS être exploré.
- Allow : Remplace spécifiquement une règle Disallow pour un sous-chemin.
- Sitemap : Fournit l'URL complète de votre plan de site XML.
Questions fréquemment posées
- Collez le contenu complet de votre fichier robots.txt dans la zone de texte, ou utilisez les règles d'exemple déjà chargées.
- Saisissez le robot que vous voulez vérifier, comme Googlebot, ou un astérisque pour tester tous les robots.
- Saisissez le chemin d'URL que vous voulez vérifier, par exemple /blog/mon-article.
- Cliquez sur Tester la Directive pour voir si ce chemin est autorisé ou bloqué pour ce user-agent.
- Consultez le champ Règle Correspondante pour voir exactement quelle ligne de votre fichier a produit ce résultat.
Un fichier robots.txt est une liste de directives en texte brut regroupées sous des en-têtes User-agent. Lorsqu'un robot visite votre site, il demande d'abord /robots.txt et lit le groupe de règles correspondant à son propre nom de user-agent, avec un repli sur le groupe générique si aucune correspondance spécifique n'existe. Au sein de ce groupe, le vérificateur compare le chemin demandé à chaque règle Allow et Disallow et applique la correspondance la plus spécifique (la plus longue), en utilisant la longueur du motif correspondant pour départager les égalités. Les caractères génériques comme l'astérisque et les ancrages de fin comme le symbole dollar permettent à une seule directive de correspondre à de nombreuses URL à la fois, c'est pourquoi tester une règle directement est plus sûr que de la lire à l'œil nu.
Disallow indique à un robot de ne pas demander un chemin correspondant, tandis qu'Allow sert à créer une exception au sein d'une règle Disallow plus large, comme autoriser un fichier dans un dossier par ailleurs bloqué. Si un chemin correspond à la fois à une règle Allow et à une règle Disallow, la plupart des robots appliquent la règle dont le motif de chemin est le plus spécifique (le plus long), quel que soit l'ordre d'apparition des lignes dans le fichier.
Non. Robots.txt est une instruction volontaire destinée aux robots bien élevés, et non un mécanisme de contrôle d'accès. Il ne peut pas protéger une page par mot de passe, et les robots malveillants l'ignorent fréquemment. N'importe qui peut consulter directement votre fichier robots.txt, donc y lister des chemins sensibles peut en réalité révéler leur existence. Utilisez l'authentification, une balise meta noindex ou des règles d'accès au niveau du serveur pour véritablement protéger ou masquer du contenu.
Une règle large comme Disallow: /assets/ ou Disallow: /*.js, écrite pour bloquer d'anciens scripts d'administration, peut involontairement capturer les fichiers CSS et JavaScript dont vos pages ont besoin pour s'afficher. Lorsque Google ne peut pas récupérer ces ressources, il peut indexer une version de votre page qui paraît cassée et mal évaluer l'ergonomie mobile. Testez toujours les chemins de ressources clés, comme /static/style.css, après avoir modifié vos règles.
Robots.txt doit être placé à la racine de votre domaine, comme https://exemple.com/robots.txt, et ne s'applique qu'à cet hôte, ce protocole et ce port exacts. Un fichier situé à /blog/robots.txt ou sur un sous-domaine différent n'a aucun effet sur le reste de votre site. Chaque sous-domaine nécessitant des règles d'exploration doit avoir son propre fichier robots.txt à sa propre racine.