Le fichier robots.txt sert à indiquer aux robots des moteurs de recherche quelles pages de votre site ils peuvent explorer ; le sitemap sert à leur proposer la liste des pages à connaître. Ce sont deux petits fichiers texte que personne ne regarde, et une seule ligne oubliée dans le premier suffit à fermer tout un site à Google. Voici le contrôle à faire en cinq minutes, puis les trois réglages possibles face aux robots des IA.
À quoi sert le fichier robots.txt ?
Le robots.txt règle la circulation des robots sur votre site : il leur dit quelles adresses ils peuvent visiter et lesquelles leur sont fermées. Google le résume dans son introduction au fichier robots.txt : « Son objectif principal est d’éviter de surcharger votre site de demandes. » Ce n’est donc ni un moyen de retirer une page de Google, ni un cadenas.
Concrètement, le fichier se trouve à la racine du site, à une adresse du type https://www.votre-site.fr/robots.txt. Un site n’en compte qu’un seul, encodé en UTF-8, et ses règles ne valent que pour l’adresse exacte où il est publié : la version avec www et la version sans www, comme la version en http et celle en https, se règlent chacune de leur côté (page Créer un fichier robots.txt). Il s’écrit avec trois mots-clés :
User-agentdésigne le robot visé, ou tous les robots avec*;Disallowferme un dossier ou une page ;Allowrouvre un sous-dossier à l’intérieur d’une zone fermée.
Le sitemap joue un autre rôle. C’est un fichier, le plus souvent sitemap.xml, qui liste les pages que vous proposez aux moteurs. Google est net sur sa portée dans sa page Créer et envoyer un sitemap : « l’envoi d’un sitemap n’est qu’une suggestion. Cela ne garantit pas que Google va le télécharger ». Chaque fichier est plafonné à 50 Mo non compressés ou 50 000 URL. Le site d’un plombier de huit pages en est très loin ; une PME qui met en ligne un catalogue de plusieurs milliers de références doit seulement vérifier que chaque fichier reste sous la barre, et en ajouter un second si besoin. Inutile, en revanche, de soigner les balises priority et changefreq : Google les ignore.
Le robots.txt protège-t-il des pages privées ou confidentielles ?
Non. Le robots.txt est une consigne adressée à des robots bien élevés, pas une serrure. La norme qui le décrit, la RFC 9309 publiée en septembre 2022, l’écrit sans ambiguïté : « Ces règles ne constituent pas une forme d’autorisation d’accès » (traduit de l’anglais). Google ajoute que ces instructions « ne peuvent pas obliger le robot d’exploration à respecter les règles de votre site ». Un contenu confidentiel se protège par un mot de passe.
Il y a pire : le fichier est public, n’importe qui peut l’ouvrir. Un cabinet de kinésithérapie qui écrirait Disallow: /documents-patients/ pour tenir un dossier à l’écart ne ferme rien ; il indique simplement le chemin à toute personne curieuse qui lit le fichier. Les comptes rendus d’un patient, le devis d’un client chez un artisan, la grille tarifaire réservée aux revendeurs d’une PME : tout cela relève d’un accès par identifiant, réglé côté hébergement.
Et si vous voulez seulement qu’une page publique n’apparaisse pas dans Google, trois voies existent : la règle noindex, la protection par mot de passe ou la suppression de la page. Nous revenons plus bas sur la première.
Comment voir le robots.txt d’un site ?
Tapez l’adresse du site suivie de /robots.txt, par exemple https://www.votre-site.fr/robots.txt, dans une fenêtre de navigation privée. Le fichier s’affiche en texte brut. Pour savoir ce que Google en a réellement lu, ouvrez ensuite le rapport robots.txt de la Search Console. Le contrôle complet suit cinq étapes, toutes gratuites.
- Ouvrez le fichier. Fenêtre privée, adresse du site, puis
/robots.txtà la fin. - Cherchez la ligne qui ferme tout. Un groupe
User-agent: *suivi deDisallow: /, sans rien après la barre oblique, ferme le site entier. Si vous le voyez, lisez la section suivante avant toute chose. - Vérifiez la ligne Sitemap. Elle doit donner l’adresse complète, en https, par exemple
Sitemap: https://www.votre-site.fr/sitemap.xml. Collez cette adresse dans le navigateur : le fichier doit s’ouvrir. - Ouvrez le rapport robots.txt. Dans la Search Console, depuis les paramètres de la propriété. Il affiche le fichier trouvé par Google, la date de la dernière exploration, les éventuels avertissements et erreurs. Après une correction, le menu placé à côté du fichier propose « Demander une nouvelle exploration ». Ce rapport ne s’affiche pas pour une propriété limitée à un sous-dossier.
- Contrôlez l’état du sitemap. Dans le rapport Sitemaps, l’état attendu est « Opération effectuée ». Les mentions « Impossible de récupérer le sitemap » ou « Le sitemap contenait X erreurs », X étant le nombre d’erreurs trouvées, appellent une correction.

Où déclarer son sitemap ?
À deux endroits qui se complètent : dans le robots.txt, avec une ligne Sitemap: suivie de l’adresse complète du fichier, et dans la Search Console, avec le rapport Sitemaps. La ligne du robots.txt est trouvée sans démarche de votre part, puisque les robots de Google découvrent ce fichier seuls. L’envoi en Search Console vous donne en plus l’état du traitement par Google, date et erreurs comprises.
Trois détails font la différence :
- L’adresse doit être complète. Google « ne déduit pas les variantes (http, https, www, non www, etc.) ni ne les vérifie », précise sa page sur la création du robots.txt. Écrivez donc exactement la version de votre site, en https.
- Le sitemap se range à la racine. Placé à la racine, il peut couvrir tout le site ; rangé dans un dossier, il ne couvre que ce dossier, sauf s’il est envoyé par la Search Console.
- Les adresses listées sont absolues,
https://www.votre-site.fr/contact/et non/contact/.
Pour l’envoyer, collez son adresse dans le champ « Ajouter un sitemap » du rapport Sitemaps, puis cliquez sur « Envoyer ». Si votre site en compte plusieurs, déclarez-les tous : le robots.txt accepte plusieurs lignes Sitemap, une par fichier. Dans notre méthode, cette étape fait partie du jour de mise en ligne : le sitemap est soumis à Google en même temps que les redirections et les données structurées sont posées.
Un robots.txt mal réglé peut-il faire disparaître un site de Google ?
Oui, en pratique. Une ligne Disallow: / placée sous User-agent: * ferme tout le site aux robots, Googlebot compris. Google ne peut alors plus lire vos pages. Au mieux, leurs adresses restent dans les résultats, mais sans description, ce qui revient à disparaître aux yeux d’un client.
Le piège se tend pendant la préparation du site. Prenons un menuisier qui fait refaire son site d’artisan. Pendant le chantier, la version d’essai est fermée aux robots, et c’est sain : personne ne veut voir un brouillon dans Google. Le jour de la mise en ligne, le robots.txt de la version d’essai part en production avec le reste. Le site s’affiche parfaitement pour ceux qui ont son adresse, le menuisier est content, et Google ne peut plus en lire une seule page. Rien ne clignote, rien ne casse à l’écran.
La réparation est simple : supprimez la ligne Disallow: / du groupe User-agent: *, puis demandez une nouvelle exploration depuis le rapport robots.txt. La prévention aussi : si vous faites refaire votre site, ajoutez au cahier des charges une ligne simple, « robots.txt de production relu et sitemap envoyé en Search Console le jour du lancement ». La règle vaut pour tout projet, par exemple un commerçant qui lance la création de son site internet à Brest : la vérification se fait le jour même de la mise en ligne.
Quelle différence entre robots.txt et balise noindex ?
Le robots.txt décide si un robot peut lire une page ; la règle noindex décide si une page lue peut figurer dans les résultats. Les deux ne s’additionnent pas. Pour que noindex soit efficace, la page « ne doit pas être bloquée par un fichier robots.txt », rappelle la page de Google sur noindex ; sinon la règle n’est jamais lue. Pour retirer une page de Google, on la laisse donc ouverte aux robots et on pose un noindex.
Cette confusion joue dans les deux sens :
- Bloquer ne retire pas. Si une page est bloquée par le robots.txt, Google prévient que « son URL peut tout de même apparaître dans les résultats de recherche. Toutefois, le résultat ne contiendra pas de description ».
- Bloquer et noindex en même temps annule le noindex. Dans ce cas, « la règle noindex n’est pas détectée par le robot d’exploration. La page peut donc continuer à s’afficher dans les résultats de recherche, par exemple si d’autres pages contiennent des liens vers celle-ci ».
Un exemple concret sur un site de cabinet de kinésithérapie : la page de confirmation qui s’affiche après une demande de rendez-vous n’a rien à faire dans Google. Le bon réglage est un noindex sur cette page, et surtout aucune ligne Disallow qui la vise.
| Ce que vous voulez | Le bon outil |
|---|---|
| Limiter la circulation des robots dans une zone du site | robots.txt, ligne Disallow |
| Retirer une page publique des résultats de Google | noindex, page laissée ouverte aux robots |
| Protéger un contenu confidentiel | mot de passe |

Faut-il bloquer les robots des IA dans le robots.txt ?
Pas en bloc. Les robots des IA forment trois familles aux rôles différents : ceux qui collectent des pages pour entraîner des modèles, ceux qui alimentent la recherche des assistants, et ceux qui visitent une page à la demande d’un utilisateur. Bloquer la première famille relève d’un choix éditorial ; bloquer la deuxième vous éloigne des réponses de ces assistants. La décision vous appartient, famille par famille.
| Famille | Robots | Ce que change un blocage |
|---|---|---|
| Entraînement | GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) | Vos pages ne servent plus à entraîner les futurs modèles de ces éditeurs |
| Recherche et réponse | OAI-SearchBot (OpenAI), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity) | Votre site n’est plus exploré pour la recherche de ces assistants |
| Visite demandée par un utilisateur | ChatGPT-User, Claude-User, Perplexity-User | Variable selon l’éditeur, voir ci-dessous |
Ce que chaque éditeur documente :
- OpenAI. Sa page consacrée à ses robots indique qu’interdire GPTBot signale que le contenu du site ne doit pas servir à entraîner ses modèles d’IA générative, tandis qu’OAI-SearchBot « sert à faire apparaître des sites dans les résultats des fonctions de recherche de ChatGPT » (traduit de l’anglais). Bloquer GPTBot ne vous retire donc pas de la recherche de ChatGPT. Pour ChatGPT-User, OpenAI prévient : « comme ces actions sont lancées par un utilisateur, les règles du robots.txt peuvent ne pas s’appliquer » (traduit de l’anglais).
- Anthropic. D’après sa page d’aide sur ses robots, bloquer ClaudeBot exclut les contenus futurs du site de ses données d’entraînement, bloquer Claude-SearchBot l’empêche d’indexer vos pages pour sa recherche, et bloquer Claude-User l’empêche de les récupérer en réponse à la question d’un utilisateur. Ses robots respectent le robots.txt.
- Perplexity. Sa documentation sur ses robots précise que PerplexityBot sert à faire apparaître des sites dans ses résultats et ne collecte pas de contenu pour entraîner des modèles d’IA. Perplexity-User, déclenché par un utilisateur, « ignore en général les règles du robots.txt » (traduit de l’anglais).
- Google. Google-Extended n’est pas un robot à part : c’est un simple nom à inscrire dans le robots.txt, que Google applique à ses robots habituels. Il couvre deux usages : l’entraînement des futurs modèles Gemini, et l’ancrage, c’est-à-dire les pages que Gemini reçoit au moment de répondre pour appuyer ses réponses dans les applications Gemini.
Pour savoir lesquels passent chez vous, demandez à votre hébergeur les journaux du serveur : chaque robot y apparaît sous son nom, sauf Google-Extended, qui passe par les robots habituels de Google. Voici trois modèles prêts à copier. Remplacez l’adresse du sitemap par la vôtre, et ne touchez jamais au groupe User-agent: * pour y écrire Disallow: /.
Modèle 1, tout autoriser. Pour être présent partout, sans restriction sur l’usage de vos textes.
User-agent: *
Allow: /
Sitemap: https://www.votre-site.fr/sitemap.xml
Modèle 2, bloquer l’entraînement seulement. Vos textes ne nourrissent plus les modèles d’OpenAI, d’Anthropic et de Google, et vous restez ouvert aux robots de recherche des assistants. Bloquer Google-Extended vous retire aussi de l’ancrage de Gemini : si cette présence compte pour vous, supprimez ce groupe.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Sitemap: https://www.votre-site.fr/sitemap.xml
Modèle 3, bloquer les robots IA de ces quatre éditeurs. La recherche Google reste ouverte, mais votre site n’est plus exploré pour la recherche de ChatGPT, de Claude et de Perplexity. Les robots déclenchés par un utilisateur peuvent passer outre selon l’éditeur ; pour ceux-là, seul un filtrage au pare-feu de l’hébergement les arrête vraiment. Perplexity publie d’ailleurs les adresses IP de ses robots, ce qui permet ce filtrage.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Sitemap: https://www.votre-site.fr/sitemap.xml
Les modèles 2 et 3 ne nomment que des robots d’OpenAI, d’Anthropic, de Perplexity et de Google ; ceux d’autres éditeurs demandent chacun leur propre groupe. Et un changement ne joue pas à la minute : Perplexity annonce jusqu’à 24 heures, OpenAI environ 24 heures pour sa recherche.
Comment trancher ? Un électricien dont les clients posent leurs questions à un assistant, du type « quel électricien pour refaire un tableau électrique ? », a intérêt à rester visible dans ces réponses. Une PME dont les guides techniques sont le cœur du savoir-faire peut préférer le modèle 2. Le modèle 3 se défend si la présence dans les assistants ne compte pas pour votre activité, en sachant ce qu’il coûte en visibilité dans les réponses IA.

Bloquer GPTBot ou Google-Extended fait-il perdre des places sur Google ?
Non. Google l’écrit dans sa page sur ses robots d’exploration courants : « Google-Extended n’a aucune incidence sur l’inclusion d’un site dans la recherche Google et n’est pas utilisé comme signal de classement dans celle-ci. » Quant à GPTBot, c’est le robot d’entraînement d’OpenAI : une règle qui le nomme ne s’adresse qu’à lui, pas à Googlebot. Pour la recherche Google, l’essentiel est que Googlebot garde l’accès à vos pages.
Là où un blocage peut coûter, c’est ailleurs. Bloquer OAI-SearchBot, Claude-SearchBot ou PerplexityBot vous éloigne des réponses de ChatGPT, de Claude ou de Perplexity. Bloquer Google-Extended vous retire de l’ancrage de Gemini, sans toucher à la recherche Google. Le bon réglage dépend seulement de ce que vous voulez faire de vos textes.
Pour un site déjà en ligne, notre accompagnement SEO et GEO démarre par un audit technique, sitemap et indexation compris, avant de toucher au moindre réglage. Si vous préférez déléguer dès la création, le pack Pro (960 € en une fois la première année) intègre un SEO de base, et le pack Croissance (1 830 € dans les mêmes conditions) ajoute un référencement actif SEO et GEO avec un suivi mensuel des performances : tout le détail est sur notre offre.



