Aller au contenu
Universal Commerce Protocol Hub de marque · fr

Fichiers de découverte

llms.txt : le fichier qui guide les agents IA sur un site.

Un fichier Markdown à la racine d'un site, censé donner aux modèles de langage une carte des pages qui comptent. Beaucoup d'enthousiasme, des contre-arguments nets de Google, et une utilité réelle mais circonscrite. Voici ce que llms.txt est, ce qu'il fait, ce qu'il ne fait pas, et où il se situe dans la couche de découverte du commerce agentique.

L'essentiel en 30 secondes

  • llms.txt : un fichier Markdown à /llms.txt qui liste, en texte propre, les pages d'un site les plus utiles à un LLM. Proposé en septembre 2024 par Jeremy Howard (Answer.AI).
  • Trois fichiers, trois rôles : robots.txt gère l'accès, sitemap.xml vise l'exhaustivité, llms.txt vise la curation pour les modèles.
  • Ce n'est pas un standard ni un signal de ranking. Google déclare ne pas l'utiliser et oriente vers WebMCP.
  • Sa valeur : le grounding des assistants à l'inférence et les outils de développement. Adopté par Anthropic, Cloudflare, Stripe, Mintlify, Vercel, Perplexity.

Qu'est-ce que llms.txt ?

llms.txt est un fichier en Markdown placé à la racine d'un domaine (https://exemple.com/llms.txt) qui fournit aux grands modèles de langage une carte courte et curée des pages et ressources les plus utiles du site. Il a été proposé le 3 septembre 2024 par Jeremy Howard, cofondateur d'Answer.AI et de fast.ai, et sa spécification vit sur llmstxt.org. Établi

L'argument d'origine est concret : les fenêtres de contexte des modèles sont étroites par rapport à un site web typique, et convertir des pages HTML (navigation, scripts, publicités) en contenu propre pour un LLM est difficile et imprécis. Plutôt que de laisser un modèle crawler un site entier à chaque question, l'auteur du site lui tend une liste lisible des pages qui comptent. Le choix du Markdown, et non d'un format structuré comme XML, est délibéré : ces fichiers sont d'abord destinés à être lus par des modèles et des agents. La vidéo ci-dessous en donne un aperçu accessible.

Vidéo : « Inside LLMs.txt », Tech Edge AI (YouTube). Source tierce, à titre pédagogique. L'analyse de l'état réel figure plus bas, sourcée.

Comment c'est structuré

La spécification définit une grammaire minimale, parsable en quelques lignes de code : un seul titre H1 (le nom du projet), un résumé optionnel en bloc de citation, puis des sections H2 contenant des listes de liens, chaque item de la forme - [nom](url) : note. Seul le H1 est strictement requis.

Anatomie d'un fichier llms.txt Un fichier llms.txt commence par un titre H1, suivi d'un résumé en bloc de citation, puis de sections H2 contenant des listes de liens avec une courte note. # Universal Commerce Protocol H1, requis > Le hub de reference du commerce agentique. resume (blockquote) ## Pages principales section H2 - [Concept](https://...) : la grille de lecture. - [Framework](https://...) : les quatre couches. liste de liens ## Ressources - [llms.txt du hub](https://...) : dogfooding.
Structure type. Un compagnon optionnel, /llms-full.txt, concatène le contenu entier des pages liées pour une ingestion en un seul fetch (convention popularisée par Mintlify avec Anthropic).

llms.txt, robots.txt, sitemap.xml : trois fichiers, trois rôles

La confusion la plus fréquente consiste à voir llms.txt comme un remplaçant du sitemap ou du robots.txt. Ce sont trois conventions de racine, complémentaires, qui répondent à des questions différentes. Établi

FichierQuestionAudienceLogique
robots.txtOù le bot a-t-il le droit d'aller ?CrawlersPermission (allow / disallow)
sitemap.xmlQuelles sont toutes les pages ?Moteurs de rechercheExhaustivité
llms.txtQue faut-il lire en priorité ?Modèles de langageCuration
Trois fichiers à la racine, trois finalités robots.txt pour l'accès des crawlers, sitemap.xml pour l'exhaustivité des moteurs, llms.txt pour la curation à destination des modèles de langage. robots.txt Accès allow / disallow pour les crawlers sitemap.xml Exhaustivité toutes les URLs pour les moteurs llms.txt Curation les pages qui comptent pour les modèles
Pour un comparatif détaillé, voir la page dédiée de llmtxt.info.

Est-ce que ça marche ? L'état réel en 2026

C'est ici que l'honnêteté épistémique compte. llms.txt est porté par un fort enthousiasme, mais les faits demandent de la nuance. Du côté de l'adoption, plusieurs plateformes de documentation publient le fichier : Anthropic, Cloudflare, Stripe, Mintlify, Vercel, Perplexity. Publier un fichier n'est toutefois pas la même chose que confirmer le consommer côté réception. Émergent

Du côté des moteurs, la position de Google est explicite et répétée. En juin 2025, John Mueller écrivait : « FWIW no AI system currently uses llms.txt » (aucun système d'IA n'utilise llms.txt à ce jour), ajoutant que les logs serveur le montrent : les chatbots récupèrent les pages, pas le fichier llms.txt. Gary Illyes a confirmé que Google ne le crawle pas et n'a pas prévu de le faire, et le guide officiel d'optimisation pour l'IA de Google recommande de l'ignorer pour Search. Établi

En 2026, Mueller a précisé l'argument de fond sur le podcast Search Off the Record : un fichier auto-déclaré ne peut pas aider un LLM à différencier les sites entre eux, puisque chacun peut y affirmer être le meilleur. Pour la découverte, il renvoie aux pages HTML et au maillage interne. Il réserve une exception nette : « si un agent est déjà sur votre site, un système automatisé peut être utile ». La distinction est précieuse : llms.txt relève davantage de la navigation (un annuaire pour l'agent déjà entré) que de la découverte (le choix du site à visiter). Google met d'ailleurs en avant WebMCP pour l'interaction agentique. Émergent

Où llms.txt a de la valeur aujourd'hui

La lecture sobre n'est pas un rejet. llms.txt a des cas d'usage réels, du moment qu'on les nomme pour ce qu'ils sont.

  • Le grounding à l'inférence. Quand un utilisateur soumet votre domaine à Claude, ChatGPT, Perplexity ou un pipeline RAG maison, plusieurs de ces outils cherchent /llms.txt en premier. Un fichier curé leur donne les pages sur lesquelles ancrer la réponse, au lieu de ce que le web ouvert remonte.
  • Les outils de développement. Cursor, Windsurf et plusieurs intégrations MCP récupèrent explicitement le fichier pour charger une documentation à jour comme contexte.
  • Les sites de documentation et d'API. ROI le plus élevé, surtout couplé à /llms-full.txt : un canal propre pour les développeurs et leurs assistants.
  • Le bénéfice interne. Écrire le fichier force une équipe à s'accorder sur la dizaine de pages qui représentent vraiment le projet. Cet exercice de curation a, à lui seul, de la valeur.

llms.txt dans le cadre UCP

Situer llms.txt dans le framework en quatre couches évite l'erreur de catégorie. C'est une brique de la couche de découverte, aux côtés du sitemap, du robots.txt et des surfaces d'agent comme agent-card.json. Il relève de la navigation : aider un agent déjà présent à se repérer.

Il ne touche ni à la couche sémantique (rendre la donnée de catalogue machine-adressable, via schema.org), ni à la couche transaction (rendre l'offre achetable par un agent, via UCP ou WebMCP). C'est la limite que pointe le débat actuel : un fichier de découverte indique où regarder, il ne rend pas l'offre récupérable ni transigeable. Pour la lisibilité et la citation du catalogue, c'est le travail de readiness GEO qui compte ; pour l'achat délégué, c'est l'implémentation d'UCP.

Dogfooding

Ce hub publie son propre fichier à /llms.txt : une carte courte des pages de référence sur le commerce agentique, pour les clients LLM qui voudraient s'y appuyer.

Créer et valider son llms.txt

La création est volontairement triviale : un éditeur de texte suffit. Le plus petit fichier valide est un H1 suivi d'une section. Pour la plupart des stacks (Astro, Next.js, Cloudflare Pages), il suffit de déposer le fichier dans le dossier public/ ; il est servi tel quel à /llms.txt en text/plain. La difficulté n'est pas technique, elle est éditoriale : choisir les bonnes pages et garder les URLs à jour.

Ressource de référence

llmtxt.info est une référence neutre et open source sur llms.txt. Elle propose un guide de définition, un pas à pas par stack, et surtout deux outils gratuits : un validateur qui vérifie la conformité d'un fichier à la spec, et un générateur qui en produit un à partir d'un sitemap ou d'un formulaire.

Bon réflexe : faire passer le fichier au validateur en intégration continue, pour détecter les régressions (H1 manquant, liens mal formés, URLs relatives).

Questions fréquentes

01

Qu'est-ce que le fichier llms.txt ?

llms.txt est un fichier Markdown placé à la racine d'un site (/llms.txt) qui propose aux grands modèles de langage une carte courte et curée des pages les plus utiles. Il a été proposé en septembre 2024 par Jeremy Howard (Answer.AI). Ce n'est pas un standard W3C ou IETF, mais une convention communautaire documentée sur llmstxt.org.

02

Quelle différence avec robots.txt et sitemap.xml ?

Les trois vivent à la racine du domaine mais ont des rôles distincts. robots.txt contrôle l'accès des crawlers (allow / disallow). sitemap.xml vise l'exhaustivité pour les moteurs (toutes les URLs). llms.txt vise la curation pour les LLM (la dizaine de pages qui comptent le plus, en texte propre). Ils sont complémentaires, pas substituables.

03

Google utilise-t-il llms.txt ?

Non. En juin 2025, John Mueller (Google) a écrit qu'aucun système d'IA n'utilise llms.txt à ce jour. Gary Illyes a confirmé que Google ne le crawle pas et n'a pas prévu de le faire, et le guide d'optimisation IA de Google recommande de l'ignorer pour Search. Google oriente plutôt vers WebMCP pour l'interaction agentique.

04

Publier llms.txt améliore-t-il mon référencement ?

Non, ce n'est pas un signal de ranking. À ce jour, aucune preuve publique qu'un llms.txt améliore le classement en recherche classique ou dans les AI Overviews. Sa valeur est ailleurs : le grounding des assistants LLM à l'inférence (quand un utilisateur soumet votre domaine à Claude, ChatGPT, Perplexity ou un pipeline RAG) et l'usage par certains outils de développement.

05

Faut-il créer un llms.txt pour un site e-commerce ?

C'est un geste à faible coût et à bénéfice surtout interne et prospectif : il force à clarifier les pages qui comptent et expose un contrat lisible côté machine. Mais il ne structure ni l'offre, ni la transaction. Pour rendre un catalogue achetable par un agent, ce sont les couches sémantique et transaction (schema.org, UCP) qui font le travail, pas un fichier de découverte.

Aller plus loin

llms.txt est une brique de découverte. Pour la lisibilité du catalogue et l'achat par agent, voir les couches du cadre.