llms.txt : à quoi ça sert vraiment
Le fichier llms.txt est un sommaire en Markdown, posé à la racine d'un site, censé dire aux modèles de langage quelles pages lire en priorité. L'idée est propre. Le problème est qu'au moment où j'écris, aucun grand moteur d'IA ne déclare le lire, et que la mesure le confirme.
Ce barème lui donne donc 0 point sur 86. Il le détecte, te le signale, et ne te le facture pas. Cette page explique pourquoi, et pourquoi ce site en publie quand même un.
C'est quoi, un fichier llms.txt ?
Une proposition publiée en septembre 2024 par Jeremy Howard, d'Answer.AI. Le constat de départ est juste : une fenêtre de contexte est petite, une page web est pleine de menus, de scripts et de publicités, et un modèle qui doit répondre vite gagne du temps si quelqu'un lui a préparé la lecture.
Le format est volontairement simple. Un fichier texte à l'adresse /llms.txt, écrit en Markdown : un titre de premier niveau avec le nom du site, un court résumé en citation, puis des sections de liens, chacun suivi d'une ligne qui dit ce qu'on trouve derrière. Une variante, llms-full.txt, contient le texte entier des pages plutôt que leurs liens.
C'est ce qui le distingue de robots.txt, qu'on confond souvent avec lui. Le robots.txt dit à un robot où il n'a pas le droit d'aller. Le llms.txt dit à un modèle ce qui mérite d'être lu. L'un est une interdiction, honorée par convention. L'autre est une recommandation, que personne n'est tenu de suivre. Le robots.txt face aux robots d'IA a sa propre page.
Source : llmstxt.org · la proposition d'origine
Qui lit réellement les fichiers llms.txt ?
C'est la seule question qui compte, et elle a une réponse mesurée. En mai 2026, une étude indépendante a relevé les journaux de 36 000 sites qui publient un llms.txt. 97 % de ces fichiers n'avaient reçu aucune requête d'un robot d'IA. L'adoption côté éditeurs avait pourtant été multipliée par près de neuf en un an. Beaucoup de monde écrit le fichier, presque personne ne vient le chercher.
Côté moteurs, la position est publique. Google écrit dans sa documentation qu'aucun fichier destiné aux IA n'est nécessaire pour apparaître dans ses fonctionnalités d'IA générative, et l'un de ses porte-parole l'a comparé à la balise meta keywords : une déclaration que l'éditeur fait sur lui-même, donc que personne n'a de raison de croire. OpenAI, Anthropic et Perplexity documentent leurs robots et le respect du robots.txt ; aucun ne documente une lecture du llms.txt.
Là où il est réellement utilisé, c'est dans un usage plus étroit : la documentation technique. Des outils de documentation le génèrent automatiquement, et un développeur qui branche un assistant de code sur la doc d'une bibliothèque lui donne volontiers ce fichier à lire. C'est un usage réel, choisi, où l'humain décide de fournir le fichier au modèle. Ça ne dit rien de ce qui se passe quand un inconnu pose une question à ChatGPT sur ton métier.
Sources : ppc.land · adoption mesurée de llms.txt (36 000 sites)Google · optimiser pour les fonctionnalités d'IA générative
Pourquoi ce barème lui donne zéro point
Parce qu'un barème ne doit noter que ce dont l'effet est établi. La règle vaut dans les deux sens : elle interdit de pénaliser un site qui n'a pas de llms.txt, et elle interdit tout autant de récompenser celui qui en a un. Sinon je te ferais travailler dix minutes pour une case verte qui ne change rien à ce qu'une IA lit de toi.
Le contraste avec le reste de la grille est volontaire. Le texte présent dans le HTML brut pèse vingt points, parce que les robots de ChatGPT, Claude et Perplexity n'exécutent pas le JavaScript et que c'est mesuré sur des centaines de millions de requêtes. Les chiffres, listes et sources pèsent quatorze points, parce qu'une expérimentation contrôlée leur attribue 30 à 40 % de visibilité en plus. Le llms.txt pèse zéro, parce que la seule mesure disponible dit que personne ne le lit. Les trois partis pris du barème sont détaillés dans la méthode.
Trois vérifications le concernent quand même, toutes informatives : sa présence, sa bonne forme (un titre en #, des liens Markdown) et l'existence de la version longue. Le rapport te les montre, sans les compter. Si le jour vient où un moteur annonce s'en servir, le poids changera, la version du barème aussi, et cette page sera réécrite.
Alors pourquoi ce site en publie un ?
Parce qu'il coûte dix minutes, qu'il ne peut pas nuire, et qu'un outil qui parle de lisibilité par les IA se doit d'avoir essayé. Celui de Luparlia est à luparlia.fr/llms.txt. Il n'est pas écrit à la main : il est généré depuis les mêmes constantes que les pages, donc les chiffres qu'il annonce sont ceux du banc, à la virgule. Une première version, écrite à la main, annonçait « 28 vérifications » pour une grille qui en comptait 29. C'est la raison pour laquelle il est généré.
C'est un pari, présenté comme tel. Pas une optimisation.
Si tu veux quand même l'écrire
Voici la forme minimale que le rapport reconnaît comme « bien structuré ». Le nom du site en titre, une phrase de résumé, puis les pages qui comptent, chacune expliquée en une ligne : c'est cette ligne qui a de la valeur, pas le lien.
# Nom du site
> Une phrase qui dit ce que fait le site, pour qui, et où.
## Pages
- [Nos tarifs](https://exemple.fr/tarifs) : prix affichés par prestation, mis à jour en 2026
- [Qui sommes-nous](https://exemple.fr/a-propos) : l'équipe, l'adresse, les horaires
- [Contact](https://exemple.fr/contact)Deux règles pour ne pas perdre ton temps. D'abord, ne mets dedans que des pages dont le texte existe déjà dans le HTML brut : un llms.txt qui pointe vers une page vide sans JavaScript n'aide personne, et c'est cette page-là que le scan te signalera. Ensuite, si tu n'as que dix minutes, passe-les plutôt à mettre un chiffre, une liste et une source sur ta page d'accueil : sur les sites français que j'ai mesurés, c'est là que se perd l'essentiel des points, et c'est le seul levier dont le gain soit prouvé.
Vérifier ce que ton site a déjà
Le scan te dit si un llms.txt est présent et lisible, et surtout ce qui compte autour : les robots que tu laisses passer, le texte réellement servi, la matière citable. Dix secondes, sans inscription.
Les autres questions de la série
- Faut-il bloquer les robots d'IA (GPTBot, ClaudeBot) sur son site ?
- Comment être cité par ChatGPT : trois conditions, dans l'ordre
- Le référencement IA (GEO) : ce que c'est, ce qui marche vraiment
Page mise à jour le La grille complèteTester un site