Règles des robots
À propos de ce générateur robots.txt
Le fichier robots.txt donne des instructions aux robots avant leur visite d’un site. C’est un texte simple placé à la racine, par exemple https://example.com/robots.txt. Les règles peuvent autoriser le site, demander de ne pas visiter certains chemins ou bloquer toute l’exploration.
Ce sont des demandes pour les robots coopératifs, pas un contrôle d’accès. Le fichier est public, certains bots peuvent l’ignorer et une URL bloquée peut encore apparaître dans la recherche sans le texte de la page. Ne protégez jamais des mots de passe, données clients ou zones privées avec robots.txt.
La ligne Sitemap indique l’emplacement du plan XML. Elle ne remplace pas son envoi dans le compte du moteur, mais donne un autre moyen fiable de le trouver.
La signification des lignes
Sur de nombreux serveurs, la casse change le chemin. Vérifiez le fichier avant publication.
| Ligne | Signification |
|---|---|
| User-agent: * | Les règles suivantes concernent tous les robots. |
| Allow: / | Les robots peuvent visiter tout le site. |
| Disallow: /path/ | Demande de ne pas visiter ce chemin ni les URL qu’il contient. |
| Sitemap: | Donne l’adresse publique complète du sitemap XML. |
Comment créer un fichier robots.txt
- Choisissez l’accès: Autorisez le site, listez les chemins ou bloquez tout uniquement si c’est voulu.
- Ajoutez le sitemap: Utilisez l’URL publique complète de sitemap.xml et vérifiez les règles.
- Publiez à la racine: Téléchargez ou copiez le fichier et placez-le à /robots.txt sur le même hôte.
Questions fréquentes
Robots.txt peut-il cacher des informations privées ?
Non. Il est public et demande seulement de ne pas explorer. Protégez les pages privées par authentification et avec les bonnes permissions serveur.
Disallow retire-t-il une page de Google ?
Pas de façon fiable. Une URL bloquée peut rester listée si elle reçoit des liens. Pour la retirer, laissez le robot voir noindex ou utilisez l’outil de suppression du moteur.
Où faut-il placer robots.txt ?
À la racine du protocole et de l’hôte exacts, par exemple https://example.com/robots.txt. Un fichier dans /dossier/robots.txt ne contrôle pas tout le site.
Faut-il ajouter Crawl-delay ?
En général non. Google ne prend pas en charge Crawl-delay dans robots.txt et les autres robots l’interprètent différemment. Utilisez les réglages du moteur ou du serveur.