NewsSEO et GEO

llms.txt : à quoi sert ce fichier, et qui le lit

Par

Le 3 septembre 2024, Jeremy Howard publie une proposition : déposer à la racine d'un site un fichier /llms.txt, rédigé en Markdown, qui résume le contenu du site à l'intention des modèles de langage. Deux ans après, ce fichier est présent sur de nombreux sites, sans que les moteurs de recherche en fassent un critère de classement, ni même de lecture systématique. Ce site en publie un. Voici ce qu'il contient, qui le lit, et ce qui compte davantage pour être trouvé.

L'origine et le format

La proposition de Jeremy Howard est simple : un fichier texte en Markdown, accessible à l'adresse /llms.txt, qui donne en quelques lignes le titre du site, un résumé et des liens vers ses pages principales. Une version longue, /llms-full.txt, peut détailler le contenu de chaque page.

Ce format n'est pas un standard du W3C ni une spécification reconnue par les moteurs de recherche. C'est une convention adoptée volontairement, publiée sur llmstxt.org, dont la page a été modifiée en dernier le 10 août 2026. Son usage reste libre et sans garantie de traitement.

Fichier texte llms.txt ouvert sur un écran

Ce que chaque moteur documente

Google Search

Google a publié le 15 mai 2026 un guide sur l'optimisation pour ses fonctions d'IA générative. Il précise que cette optimisation reste du SEO classique : mêmes fondamentaux, aucun fichier ni balisage spécifique requis. Google Search n'utilise pas llms.txt et ne prévoit pas de le faire. Gary Illyes l'a indiqué lors du Search Central Deep Dive Asie-Pacifique ; le guide, mis à jour le 10 juillet 2026, confirme cette position par écrit.

Par ailleurs, le rapport "IA générative" de Search Console, introduit le 3 juin 2026 et ouvert à tous les sites le 31 août 2026, compte les impressions des pages dans les aperçus IA et le mode IA de Google. Il repose sur l'index existant, pas sur un fichier tiers.

Chrome et Lighthouse

Lighthouse 13.3, publié le 7 mai 2026, introduit une catégorie expérimentale intitulée "Agentic Browsing". Elle inclut un audit de présence du fichier llms.txt. Cette catégorie est sans note sur 100 et sans lien avec le classement dans Google Search. Chrome vérifie la présence de ce fichier dans le contexte des agents de navigation, pas de la recherche.

OpenAI

OpenAI publie la liste de ses robots sur developers.openai.com. OAI-SearchBot alimente la recherche de ChatGPT, GPTBot sert à l'entraînement des modèles, ChatGPT-User ouvre une page à la demande d'un utilisateur. OpenAI indique environ 24 heures pour la prise en compte d'un changement de robots.txt. La documentation ne mentionne pas llms.txt comme source de lecture.

Anthropic

Anthropic publie sa liste de robots sur support.claude.com, mise à jour le 7 avril 2026. Claude-SearchBot sert la recherche de Claude, ClaudeBot l'entraînement, Claude-User les pages consultées à la demande d'un utilisateur. Les trois respectent robots.txt. La documentation ne mentionne pas llms.txt.

Perplexity

Perplexity publie sa documentation sur docs.perplexity.ai. PerplexityBot fait apparaître les pages dans les résultats de Perplexity et est réservé à la recherche, pas à l'entraînement des modèles. Perplexity-User ouvre une page à la demande d'un utilisateur. La documentation ne mentionne pas llms.txt.

En résumé : aucune des documentations officielles relevées le 11 septembre 2026 ne mentionne llms.txt comme source de lecture pour les moteurs de recherche ou les moteurs de réponse. Le fichier reste une convention utile pour les agents de navigation au sens de Chrome, pas un levier de classement.

Plusieurs robots d'exploration qui lisent une même page web

Ce qui compte davantage

La question posée par le GEO (Generative Engine Optimization) ne se résout pas par un fichier supplémentaire. Google le précise dans son guide de mai 2026 : ce sont les fondations du SEO classique qui déterminent la lisibilité d'une page par ses fonctions d'IA générative.

Deux points pratiques pèsent plus que llms.txt.

Le texte servi dans la page. Googlebot exécute le JavaScript. Les robots d'OpenAI, d'Anthropic et de Perplexity lisent la page telle que le serveur l'envoie, d'après une analyse publiée par Vercel et MERJ en décembre 2024. Un rendu côté serveur avec Next.js garantit que titres, textes et liens sont présents dès le premier chargement, quelle que soit la nature du robot.

Un accès réglé robot par robot. Chaque moteur envoie un robot pour sa recherche et souvent un autre pour entraîner ses modèles. Ces deux usages se règlent séparément dans robots.txt. Un fichier générique qui admet tous les robots sans les nommer ne distingue pas les robots de recherche des robots d'entraînement. C'est l'une des premières vérifications d'une mission SEO et GEO.

Baie de serveurs qui envoie une page web

Sources