SEO

Robots.txt

Définition courte

Robots.txt est un simple fichier texte à la racine d'un site qui indique aux moteurs de recherche et autres robots les pages qu'ils peuvent explorer.

Un site peut fermer aux robots des sections qui n'ont rien à faire dans les résultats de recherche, comme un panneau d'administration ou une page de panier, via robots.txt. Le fichier est une directive plutôt qu'une règle ; les robots bien élevés la respectent, mais ce n'est pas une barrière imposée.

Écrivez robots.txt de travers et un site entier peut se retrouver bloqué par accident, disparaissant complètement des résultats de recherche. Plus récemment, le fichier sert aussi à indiquer si les robots d'IA peuvent collecter le contenu comme données d'entraînement.

Robots.txt est souvent confondu avec la balise noindex, alors que les deux jouent des rôles différents : une règle disallow empêche l'exploration d'une page, mais si une autre page pointe vers elle, un moteur de recherche peut quand même la lister sans description, retirer réellement une page de l'index exige une balise noindex ou une demande de suppression. Cela se vérifie via l'outil d'inspection d'URL de Google Search Console.

Pourquoi c'est important

Un robots.txt mal configuré peut rendre un site entier, ou ses pages les plus importantes, invisible pour un moteur de recherche. Bien le configurer garde cachées les pages qui doivent l'être et garantit l'exploration de celles qui comptent.

Exemple illustratif

Lors d'une mise à jour logicielle, une entreprise a laissé par erreur une ligne robots.txt bloquant tout le site, qui a disparu des résultats de recherche pendant une semaine.

Termes liés

Article lié

Si vous ne savez pas par où commencer, ce n’est pas un problème ; vous êtes au bon endroit.

Le projet que vous avez en tête peut être déjà clair, ou encore une simple idée. Les deux nous conviennent. En un court appel, nous parlons ensemble d’où vous en êtes et où vous pouvez aller.

Fixons un appel
Parlons du projet