Robots.txt
Définition courte
Robots.txt est un simple fichier texte à la racine d'un site qui indique aux moteurs de recherche et autres robots les pages qu'ils peuvent explorer.
Un site peut fermer aux robots des sections qui n'ont rien à faire dans les résultats de recherche, comme un panneau d'administration ou une page de panier, via robots.txt. Le fichier est une directive plutôt qu'une règle ; les robots bien élevés la respectent, mais ce n'est pas une barrière imposée.
Écrivez robots.txt de travers et un site entier peut se retrouver bloqué par accident, disparaissant complètement des résultats de recherche. Plus récemment, le fichier sert aussi à indiquer si les robots d'IA peuvent collecter le contenu comme données d'entraînement.
Robots.txt est souvent confondu avec la balise noindex, alors que les deux jouent des rôles différents : une règle disallow empêche l'exploration d'une page, mais si une autre page pointe vers elle, un moteur de recherche peut quand même la lister sans description, retirer réellement une page de l'index exige une balise noindex ou une demande de suppression. Cela se vérifie via l'outil d'inspection d'URL de Google Search Console.
Pourquoi c'est important
Un robots.txt mal configuré peut rendre un site entier, ou ses pages les plus importantes, invisible pour un moteur de recherche. Bien le configurer garde cachées les pages qui doivent l'être et garantit l'exploration de celles qui comptent.
Exemple illustratif
Lors d'une mise à jour logicielle, une entreprise a laissé par erreur une ligne robots.txt bloquant tout le site, qui a disparu des résultats de recherche pendant une semaine.
