Qu'est-ce que llms.txt et comment en rédiger un ?
llms.txt est un fichier texte qui présente un site aux modèles d'IA. Voici ce qu'il fait et comment en construire un correctement.
Équipe rabbitclipPublié: 5 min de lecture
En bref
Llms.txt est un fichier texte placé à la racine d'un site qui liste ses pages les plus importantes avec de courtes descriptions. Son rôle est de faciliter le travail des grands modèles de langage pour comprendre ce qui compte sur un site pendant qu'ils l'explorent.
Proposé en 2024 par Jeremy Howard d'Answer.AI, ce format n'est pas une norme officielle du W3C ou de l'IETF, il s'est plutôt répandu comme une proposition communautaire. Des entreprises comme Anthropic, Stripe et Cloudflare l'utilisent malgré tout sur leurs propres sites, et la définition canonique se trouve sur llmstxt.org.
Quel problème llms.txt résout-il vraiment ?
Un modèle de langage ne navigue pas sur un site via un menu comme le ferait une personne, il prend le HTML brut, avec tout l'encombrement de navigation. llms.txt lui donne une carte de contenu simplifiée qu'il peut consulter directement.
Cela ressemble par principe à la façon dont robots.txt gère les autorisations d'exploration ou dont sitemap.xml liste les pages, mais son rôle est différent : il ne dit pas ce qui peut être exploré, il dit ce qui compte et de quoi il s'agit.
Comment le fichier est-il structuré ?
La spécification définit deux fichiers. /llms.txt est un court résumé de navigation en markdown : un titre, une description en une phrase, puis des liens regroupés sous des titres de section. /llms-full.txt est la version plus complète, rassemblant toute une documentation dans un seul fichier.
Un petit site d'entreprise n'a généralement besoin que du premier. Un produit logiciel avec une documentation dense peut garder les deux.
Comment en rédige-t-on un concrètement ?
Le fichier est du markdown pur, placé à la racine. Le nom du site ou de la marque figure en haut comme H1, suivi immédiatement d'une phrase de résumé. Des titres de section commençant par « ## » regroupent ensuite les pages les plus importantes, chacune avec une description courte et exacte.
- Un H1 avec le nom du site ou de la marque
- Un paragraphe de résumé en une phrase
- Des titres de section (## Services, ## Blog, et ainsi de suite)
- Une description courte et exacte pour chaque lien
- Uniquement des pages vraiment importantes, pas un plan de site complet
Quelles erreurs rendent le fichier inutile ?
La plus fréquente consiste à copier intégralement un plan de site automatisé et à lister des centaines de liens, ce qui va à l'encontre de l'idée même de priorisation. Une autre est de rédiger les descriptions en langage marketing, un modèle cherche une définition courte et exacte, pas un slogan.
Rédiger le fichier une fois puis l'oublier crée aussi un décalage. À mesure que le site évolue, notamment quand un nouveau service ou produit est ajouté, le fichier doit lui aussi être mis à jour.
Un site est-il cassé sans ce fichier ?
Non. Ce n'est pas une exigence officielle, c'est une proposition qui gagne encore en adoption. Les fonctions de recherche propres à Google, OpenAI et Perplexity ne recherchent pas spécifiquement llms.txt actuellement, les modèles continuent d'explorer le contenu standard des pages malgré tout.
Cela reste néanmoins une étape peu coûteuse. Quelques heures de travail donnent à un site riche en documentation ou en pages une carte claire à remettre à un modèle.
Erreurs fréquentes
Une erreur typique, vue sur le site de documentation d'un produit logiciel, consiste à générer llms.txt automatiquement et à le publier sans relecture. Le résultat est une copie quasi conforme de sitemap.xml qui perd tout l'intérêt de la priorisation.
Une autre consiste à copier un modèle sans en adapter la langue ; si le contenu propre à une marque est rédigé dans une langue alors que le fichier reste dans une autre, cela crée une incohérence qui n'aide personne.
Un test utile : chaque lien du fichier devrait passer le test « cette page explique-t-elle vraiment ce sujet à un visiteur ». Si non, il devrait sortir de la liste.
Comment mettre en place un llms.txt, étape par étape ?
Construire le fichier à partir de zéro ne prend pas plus d'un après-midi, à condition que les étapes se déroulent dans le bon ordre.
- Lister les dix à vingt pages les plus visitées et les plus interrogées du site.
- Rédiger pour chacune une description en une phrase, sans langage marketing.
- Regrouper les pages sous des titres de section pertinents (## Services, ## Blog, ## FAQ, et ainsi de suite).
- Téléverser le fichier à la racine sous /llms.txt et vérifier qu'il s'ouvre directement dans un navigateur.
- Ajouter un rappel dans un calendrier pour revoir le fichier chaque fois qu'un nouveau service ou une nouvelle page est ajouté.
llms.txt est un court résumé qu'un site remet à un modèle plutôt qu'à une personne. Le rédiger prend un après-midi, mais cela force aussi une certaine clarté sur la propre structure du site, ce qui en fait une petite mais réelle partie du travail de GEO. Pour une équipe qui suit ces étapes, le fichier cesse d'être un projet ponctuel et devient une petite habitude d'entretien qui grandit avec le site. rabbitclip peut examiner la structure actuelle d'un site et déterminer ensemble ce que ce fichier devrait vraiment dire.
Questions fréquentes
llms.txt est-il une norme officielle ?
Non. Il s'est répandu comme une proposition communautaire, la définition canonique se trouve sur llmstxt.org, sans approbation du W3C ni de l'IETF.
L'IA ne peut-elle pas explorer un site sans llms.txt ?
Si, elle le peut. Le fichier ne conditionne pas l'exploration, il facilite seulement la priorisation.
llms.txt fait-il le même travail que sitemap.xml ?
Non. sitemap.xml liste chaque page, llms.txt ne présente que les plus importantes avec une courte description.
À quelle fréquence le fichier doit-il être mis à jour ?
Chaque fois que la structure du site change de façon notable, par exemple lors de l'ajout d'un nouveau service, produit ou d'une nouvelle section.
