SEO & GEO

Robots.txt et sitemap : les vérifier et régler les robots IA

Robots.txt et sitemap : à quoi ils servent, le contrôle en 5 minutes, et comment régler GPTBot, ClaudeBot ou Google-Extended sans perdre Google.

Par InlevenMis à jour le 29 septembre 202613 min de lecture
Couverture en relief 3D rétro sur fond bleu marine, titre orange Robots.txt et sitemap et mention Régler les robots IA, pour un guide sur le contrôle de ces deux fichiers.

Le fichier robots.txt sert à indiquer aux robots des moteurs de recherche quelles pages de votre site ils peuvent explorer ; le sitemap sert à leur proposer la liste des pages à connaître. Ce sont deux petits fichiers texte que personne ne regarde, et une seule ligne oubliée dans le premier suffit à fermer tout un site à Google. Voici le contrôle à faire en cinq minutes, puis les trois réglages possibles face aux robots des IA.

À quoi sert le fichier robots.txt ?

Le robots.txt règle la circulation des robots sur votre site : il leur dit quelles adresses ils peuvent visiter et lesquelles leur sont fermées. Google le résume dans son introduction au fichier robots.txt : « Son objectif principal est d’éviter de surcharger votre site de demandes. » Ce n’est donc ni un moyen de retirer une page de Google, ni un cadenas.

Concrètement, le fichier se trouve à la racine du site, à une adresse du type https://www.votre-site.fr/robots.txt. Un site n’en compte qu’un seul, encodé en UTF-8, et ses règles ne valent que pour l’adresse exacte où il est publié : la version avec www et la version sans www, comme la version en http et celle en https, se règlent chacune de leur côté (page Créer un fichier robots.txt). Il s’écrit avec trois mots-clés :

  • User-agent désigne le robot visé, ou tous les robots avec * ;
  • Disallow ferme un dossier ou une page ;
  • Allow rouvre un sous-dossier à l’intérieur d’une zone fermée.

Le sitemap joue un autre rôle. C’est un fichier, le plus souvent sitemap.xml, qui liste les pages que vous proposez aux moteurs. Google est net sur sa portée dans sa page Créer et envoyer un sitemap : « l’envoi d’un sitemap n’est qu’une suggestion. Cela ne garantit pas que Google va le télécharger ». Chaque fichier est plafonné à 50 Mo non compressés ou 50 000 URL. Le site d’un plombier de huit pages en est très loin ; une PME qui met en ligne un catalogue de plusieurs milliers de références doit seulement vérifier que chaque fichier reste sous la barre, et en ajouter un second si besoin. Inutile, en revanche, de soigner les balises priority et changefreq : Google les ignore.

Le robots.txt protège-t-il des pages privées ou confidentielles ?

Non. Le robots.txt est une consigne adressée à des robots bien élevés, pas une serrure. La norme qui le décrit, la RFC 9309 publiée en septembre 2022, l’écrit sans ambiguïté : « Ces règles ne constituent pas une forme d’autorisation d’accès » (traduit de l’anglais). Google ajoute que ces instructions « ne peuvent pas obliger le robot d’exploration à respecter les règles de votre site ». Un contenu confidentiel se protège par un mot de passe.

Il y a pire : le fichier est public, n’importe qui peut l’ouvrir. Un cabinet de kinésithérapie qui écrirait Disallow: /documents-patients/ pour tenir un dossier à l’écart ne ferme rien ; il indique simplement le chemin à toute personne curieuse qui lit le fichier. Les comptes rendus d’un patient, le devis d’un client chez un artisan, la grille tarifaire réservée aux revendeurs d’une PME : tout cela relève d’un accès par identifiant, réglé côté hébergement.

Et si vous voulez seulement qu’une page publique n’apparaisse pas dans Google, trois voies existent : la règle noindex, la protection par mot de passe ou la suppression de la page. Nous revenons plus bas sur la première.

Comment voir le robots.txt d’un site ?

Tapez l’adresse du site suivie de /robots.txt, par exemple https://www.votre-site.fr/robots.txt, dans une fenêtre de navigation privée. Le fichier s’affiche en texte brut. Pour savoir ce que Google en a réellement lu, ouvrez ensuite le rapport robots.txt de la Search Console. Le contrôle complet suit cinq étapes, toutes gratuites.

  1. Ouvrez le fichier. Fenêtre privée, adresse du site, puis /robots.txt à la fin.
  2. Cherchez la ligne qui ferme tout. Un groupe User-agent: * suivi de Disallow: /, sans rien après la barre oblique, ferme le site entier. Si vous le voyez, lisez la section suivante avant toute chose.
  3. Vérifiez la ligne Sitemap. Elle doit donner l’adresse complète, en https, par exemple Sitemap: https://www.votre-site.fr/sitemap.xml. Collez cette adresse dans le navigateur : le fichier doit s’ouvrir.
  4. Ouvrez le rapport robots.txt. Dans la Search Console, depuis les paramètres de la propriété. Il affiche le fichier trouvé par Google, la date de la dernière exploration, les éventuels avertissements et erreurs. Après une correction, le menu placé à côté du fichier propose « Demander une nouvelle exploration ». Ce rapport ne s’affiche pas pour une propriété limitée à un sous-dossier.
  5. Contrôlez l’état du sitemap. Dans le rapport Sitemaps, l’état attendu est « Opération effectuée ». Les mentions « Impossible de récupérer le sitemap » ou « Le sitemap contenait X erreurs », X étant le nombre d’erreurs trouvées, appellent une correction.

Fiches cartonnées vierges disposées en arborescence sur un bureau en chêne et reliées par un fil bleu, image de la liste de pages qu’un sitemap propose aux moteurs de recherche.

Où déclarer son sitemap ?

À deux endroits qui se complètent : dans le robots.txt, avec une ligne Sitemap: suivie de l’adresse complète du fichier, et dans la Search Console, avec le rapport Sitemaps. La ligne du robots.txt est trouvée sans démarche de votre part, puisque les robots de Google découvrent ce fichier seuls. L’envoi en Search Console vous donne en plus l’état du traitement par Google, date et erreurs comprises.

Trois détails font la différence :

  • L’adresse doit être complète. Google « ne déduit pas les variantes (http, https, www, non www, etc.) ni ne les vérifie », précise sa page sur la création du robots.txt. Écrivez donc exactement la version de votre site, en https.
  • Le sitemap se range à la racine. Placé à la racine, il peut couvrir tout le site ; rangé dans un dossier, il ne couvre que ce dossier, sauf s’il est envoyé par la Search Console.
  • Les adresses listées sont absolues, https://www.votre-site.fr/contact/ et non /contact/.

Pour l’envoyer, collez son adresse dans le champ « Ajouter un sitemap » du rapport Sitemaps, puis cliquez sur « Envoyer ». Si votre site en compte plusieurs, déclarez-les tous : le robots.txt accepte plusieurs lignes Sitemap, une par fichier. Dans notre méthode, cette étape fait partie du jour de mise en ligne : le sitemap est soumis à Google en même temps que les redirections et les données structurées sont posées.

Un robots.txt mal réglé peut-il faire disparaître un site de Google ?

Oui, en pratique. Une ligne Disallow: / placée sous User-agent: * ferme tout le site aux robots, Googlebot compris. Google ne peut alors plus lire vos pages. Au mieux, leurs adresses restent dans les résultats, mais sans description, ce qui revient à disparaître aux yeux d’un client.

Le piège se tend pendant la préparation du site. Prenons un menuisier qui fait refaire son site d’artisan. Pendant le chantier, la version d’essai est fermée aux robots, et c’est sain : personne ne veut voir un brouillon dans Google. Le jour de la mise en ligne, le robots.txt de la version d’essai part en production avec le reste. Le site s’affiche parfaitement pour ceux qui ont son adresse, le menuisier est content, et Google ne peut plus en lire une seule page. Rien ne clignote, rien ne casse à l’écran.

La réparation est simple : supprimez la ligne Disallow: / du groupe User-agent: *, puis demandez une nouvelle exploration depuis le rapport robots.txt. La prévention aussi : si vous faites refaire votre site, ajoutez au cahier des charges une ligne simple, « robots.txt de production relu et sitemap envoyé en Search Console le jour du lancement ». La règle vaut pour tout projet, par exemple un commerçant qui lance la création de son site internet à Brest : la vérification se fait le jour même de la mise en ligne.

Quelle différence entre robots.txt et balise noindex ?

Le robots.txt décide si un robot peut lire une page ; la règle noindex décide si une page lue peut figurer dans les résultats. Les deux ne s’additionnent pas. Pour que noindex soit efficace, la page « ne doit pas être bloquée par un fichier robots.txt », rappelle la page de Google sur noindex ; sinon la règle n’est jamais lue. Pour retirer une page de Google, on la laisse donc ouverte aux robots et on pose un noindex.

Cette confusion joue dans les deux sens :

  • Bloquer ne retire pas. Si une page est bloquée par le robots.txt, Google prévient que « son URL peut tout de même apparaître dans les résultats de recherche. Toutefois, le résultat ne contiendra pas de description ».
  • Bloquer et noindex en même temps annule le noindex. Dans ce cas, « la règle noindex n’est pas détectée par le robot d’exploration. La page peut donc continuer à s’afficher dans les résultats de recherche, par exemple si d’autres pages contiennent des liens vers celle-ci ».

Un exemple concret sur un site de cabinet de kinésithérapie : la page de confirmation qui s’affiche après une demande de rendez-vous n’a rien à faire dans Google. Le bon réglage est un noindex sur cette page, et surtout aucune ligne Disallow qui la vise.

Ce que vous voulez Le bon outil
Limiter la circulation des robots dans une zone du site robots.txt, ligne Disallow
Retirer une page publique des résultats de Google noindex, page laissée ouverte aux robots
Protéger un contenu confidentiel mot de passe

Armoire à clés murale en bois où une main choisit une clé en laiton, image du réglage des accès des robots des IA, famille par famille, dans le fichier robots.txt.

Faut-il bloquer les robots des IA dans le robots.txt ?

Pas en bloc. Les robots des IA forment trois familles aux rôles différents : ceux qui collectent des pages pour entraîner des modèles, ceux qui alimentent la recherche des assistants, et ceux qui visitent une page à la demande d’un utilisateur. Bloquer la première famille relève d’un choix éditorial ; bloquer la deuxième vous éloigne des réponses de ces assistants. La décision vous appartient, famille par famille.

Famille Robots Ce que change un blocage
Entraînement GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) Vos pages ne servent plus à entraîner les futurs modèles de ces éditeurs
Recherche et réponse OAI-SearchBot (OpenAI), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity) Votre site n’est plus exploré pour la recherche de ces assistants
Visite demandée par un utilisateur ChatGPT-User, Claude-User, Perplexity-User Variable selon l’éditeur, voir ci-dessous

Ce que chaque éditeur documente :

  • OpenAI. Sa page consacrée à ses robots indique qu’interdire GPTBot signale que le contenu du site ne doit pas servir à entraîner ses modèles d’IA générative, tandis qu’OAI-SearchBot « sert à faire apparaître des sites dans les résultats des fonctions de recherche de ChatGPT » (traduit de l’anglais). Bloquer GPTBot ne vous retire donc pas de la recherche de ChatGPT. Pour ChatGPT-User, OpenAI prévient : « comme ces actions sont lancées par un utilisateur, les règles du robots.txt peuvent ne pas s’appliquer » (traduit de l’anglais).
  • Anthropic. D’après sa page d’aide sur ses robots, bloquer ClaudeBot exclut les contenus futurs du site de ses données d’entraînement, bloquer Claude-SearchBot l’empêche d’indexer vos pages pour sa recherche, et bloquer Claude-User l’empêche de les récupérer en réponse à la question d’un utilisateur. Ses robots respectent le robots.txt.
  • Perplexity. Sa documentation sur ses robots précise que PerplexityBot sert à faire apparaître des sites dans ses résultats et ne collecte pas de contenu pour entraîner des modèles d’IA. Perplexity-User, déclenché par un utilisateur, « ignore en général les règles du robots.txt » (traduit de l’anglais).
  • Google. Google-Extended n’est pas un robot à part : c’est un simple nom à inscrire dans le robots.txt, que Google applique à ses robots habituels. Il couvre deux usages : l’entraînement des futurs modèles Gemini, et l’ancrage, c’est-à-dire les pages que Gemini reçoit au moment de répondre pour appuyer ses réponses dans les applications Gemini.

Pour savoir lesquels passent chez vous, demandez à votre hébergeur les journaux du serveur : chaque robot y apparaît sous son nom, sauf Google-Extended, qui passe par les robots habituels de Google. Voici trois modèles prêts à copier. Remplacez l’adresse du sitemap par la vôtre, et ne touchez jamais au groupe User-agent: * pour y écrire Disallow: /.

Modèle 1, tout autoriser. Pour être présent partout, sans restriction sur l’usage de vos textes.

User-agent: *
Allow: /

Sitemap: https://www.votre-site.fr/sitemap.xml

Modèle 2, bloquer l’entraînement seulement. Vos textes ne nourrissent plus les modèles d’OpenAI, d’Anthropic et de Google, et vous restez ouvert aux robots de recherche des assistants. Bloquer Google-Extended vous retire aussi de l’ancrage de Gemini : si cette présence compte pour vous, supprimez ce groupe.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

Sitemap: https://www.votre-site.fr/sitemap.xml

Modèle 3, bloquer les robots IA de ces quatre éditeurs. La recherche Google reste ouverte, mais votre site n’est plus exploré pour la recherche de ChatGPT, de Claude et de Perplexity. Les robots déclenchés par un utilisateur peuvent passer outre selon l’éditeur ; pour ceux-là, seul un filtrage au pare-feu de l’hébergement les arrête vraiment. Perplexity publie d’ailleurs les adresses IP de ses robots, ce qui permet ce filtrage.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

Sitemap: https://www.votre-site.fr/sitemap.xml

Les modèles 2 et 3 ne nomment que des robots d’OpenAI, d’Anthropic, de Perplexity et de Google ; ceux d’autres éditeurs demandent chacun leur propre groupe. Et un changement ne joue pas à la minute : Perplexity annonce jusqu’à 24 heures, OpenAI environ 24 heures pour sa recherche.

Comment trancher ? Un électricien dont les clients posent leurs questions à un assistant, du type « quel électricien pour refaire un tableau électrique ? », a intérêt à rester visible dans ces réponses. Une PME dont les guides techniques sont le cœur du savoir-faire peut préférer le modèle 2. Le modèle 3 se défend si la présence dans les assistants ne compte pas pour votre activité, en sachant ce qu’il coûte en visibilité dans les réponses IA.

Porte vitrée grande ouverte sur un atelier de meubles en bois baigné de lumière dorée, image d’un site qui reste accessible à Googlebot et visible dans la recherche Google.

Bloquer GPTBot ou Google-Extended fait-il perdre des places sur Google ?

Non. Google l’écrit dans sa page sur ses robots d’exploration courants : « Google-Extended n’a aucune incidence sur l’inclusion d’un site dans la recherche Google et n’est pas utilisé comme signal de classement dans celle-ci. » Quant à GPTBot, c’est le robot d’entraînement d’OpenAI : une règle qui le nomme ne s’adresse qu’à lui, pas à Googlebot. Pour la recherche Google, l’essentiel est que Googlebot garde l’accès à vos pages.

Là où un blocage peut coûter, c’est ailleurs. Bloquer OAI-SearchBot, Claude-SearchBot ou PerplexityBot vous éloigne des réponses de ChatGPT, de Claude ou de Perplexity. Bloquer Google-Extended vous retire de l’ancrage de Gemini, sans toucher à la recherche Google. Le bon réglage dépend seulement de ce que vous voulez faire de vos textes.

Pour un site déjà en ligne, notre accompagnement SEO et GEO démarre par un audit technique, sitemap et indexation compris, avant de toucher au moindre réglage. Si vous préférez déléguer dès la création, le pack Pro (960 € en une fois la première année) intègre un SEO de base, et le pack Croissance (1 830 € dans les mêmes conditions) ajoute un référencement actif SEO et GEO avec un suivi mensuel des performances : tout le détail est sur notre offre.

Questions fréquentes

Combien de temps faut-il pour qu'un changement de robots.txt soit pris en compte ?

Cela dépend du robot. OpenAI indique qu'il faut environ 24 heures, pour les résultats de recherche, après la mise à jour du robots.txt pour que ses systèmes s'ajustent (traduit de l'anglais) ; Perplexity annonce jusqu'à 24 heures. Côté Google, le rapport robots.txt de la Search Console affiche la date de la dernière exploration du fichier ; après une correction urgente, par exemple un Disallow: / oublié, utilisez « Demander une nouvelle exploration » dans ce même rapport.

Mon site existe avec et sans www : faut-il deux fichiers robots.txt ?

Les règles d'un robots.txt ne valent que pour l'adresse exacte où il est publié. Les versions avec et sans www, en http et en https, sont donc lues séparément. Le plus simple reste de rediriger toutes les variantes vers une seule adresse en https, puis de soigner le robots.txt de cette adresse, avec une ligne Sitemap qui reprend exactement la même version.

Peut-on vraiment empêcher ChatGPT ou Perplexity de lire une page ?

Pas toujours avec le seul robots.txt. OpenAI prévient que, pour ChatGPT-User, les règles du robots.txt peuvent ne pas s'appliquer, et Perplexity indique que Perplexity-User les ignore en général. Anthropic, lui, indique que bloquer Claude-User empêche la récupération de vos pages. Pour un blocage ferme, il faut agir au pare-feu de l'hébergement, sur le nom du robot et sur ses adresses IP ; Perplexity publie ces adresses dans des fichiers officiels. Pour un contenu réellement privé, seul un mot de passe protège.

Le robots.txt peut-il empêcher mes photos d'apparaître dans Google ?

Oui, c'est l'un des usages que Google décrit : pour les fichiers multimédias, images, vidéos et audio, le robots.txt peut les empêcher d'apparaître dans les résultats de recherche. Pour une page web, il ne sert qu'à gérer l'exploration. Prudence avec les fichiers de ressources, comme les feuilles de style et les scripts : Google conseille de ne les bloquer que si leur absence ne complique pas la compréhension de la page par le robot.

Vous avez un projet ?

Un appel de 15 minutes suffit pour démarrer. Rien à signer.