Que se passe-t-il quand une IA lit votre site ?
Trois choses différentes, qu'on confond presque toujours sous le mot « IA ».
L'entraînement. Un robot parcourt vos pages et le contenu part alimenter l'apprentissage d'un futur modèle. Vous n'en tirez aucune visite, aucune citation, aucune trace. Votre texte se dissout dans un ensemble de milliards de pages.
L'indexation pour la recherche. Un autre robot lit vos pages pour construire un index qui servira à répondre aux questions des utilisateurs, avec un lien vers vous quand votre page est la bonne réponse. C'est ce mécanisme qui décide si votre entreprise apparaît lorsqu'un prospect demande à une IA qui peut traiter son problème.
La lecture à la demande. Un utilisateur pose une question, l'IA va chercher votre page en direct pour y répondre, et cite généralement sa source. C'est le cas le plus proche d'une visite classique.
Ces trois usages passent par des robots portant des noms différents. Chez OpenAI, l'entraînement, la recherche et la lecture déclenchée par un utilisateur relèvent de trois robots séparés, que l'on peut autoriser ou refuser indépendamment les uns des autres. Les autres fournisseurs ont adopté une logique comparable. Dire « je bloque ChatGPT » n'a donc pas de sens en soi : la seule question utile est de savoir lequel des trois on bloque, et pourquoi.
Faut-il bloquer ou autoriser ces robots ?
Le débat vient du monde de la presse, et il s'y justifie pleinement. Les éditeurs vivent de l'audience de leurs articles. Quand une IA reprend leur contenu sans renvoyer de visite, le modèle économique s'effondre.
Les ordres de grandeur sont parlants. Le 1er juillet 2025, Cloudflare a publié une mesure du rapport entre le nombre de pages lues par chaque plateforme d'IA sur son réseau et le nombre de visites que cette plateforme renvoie en retour. Sur la semaine du 19 au 26 juin 2025, certaines plateformes atteignaient plusieurs dizaines de milliers de pages aspirées pour une seule visite renvoyée. Le même jour, Cloudflare est devenu le premier hébergeur d'infrastructure à bloquer par défaut les robots d'IA sur tout nouveau domaine, et a lancé un système permettant aux éditeurs de facturer cet accès.
Sauf que vous n'êtes pas un éditeur de presse. Votre site ne vend pas des pages vues. Il établit votre crédibilité et il déclenche des prises de contact. Ce que vous perdez en bloquant n'est pas un revenu publicitaire : c'est la possibilité d'être cité au moment précis où un acheteur potentiel demande conseil.
Et cette demande n'a plus rien de marginal. Selon les mesures de Similarweb portant sur la période de juin 2025 à mai 2026, les plateformes d'IA générative totalisent en moyenne 9,5 milliards de visites par mois dans le monde, en hausse de 70 % sur un an. Une part croissante de ce volume consiste en questions que vos prospects posaient hier à un moteur de recherche.
La règle de décision tient donc en une phrase pour une PME : autorisez tout ce qui peut vous citer, et ne vous posez la question de l'entraînement que si votre contenu est lui-même votre produit.
Bloquez-vous déjà sans le savoir ?
C'est le point que la plupart des dirigeants découvrent trop tard. Quand un site est fermé aux IA, ce n'est presque jamais le résultat d'une décision consciente.
Cela vient du prestataire qui a installé une protection anti-robots par défaut, sans distinguer les robots utiles des robots nuisibles. Cela vient de l'hébergeur qui a activé un réglage global sur tout son parc, parfois depuis 2025. Cela vient d'un module de sécurité installé il y a deux ans pour régler un problème de charge serveur et jamais réexaminé depuis. Cela vient parfois d'une simple ligne recopiée d'un article anglophone au moment d'une refonte.
Trois vérifications suffisent à lever le doute, et aucune ne demande de compétence technique de votre part.
Lisez le fichier de règles de votre site. Tapez l'adresse de votre site suivie de /robots.txt dans votre navigateur. Ce fichier est public sur tous les sites. Si vous y voyez des noms comme GPTBot, ClaudeBot, Google-Extended ou PerplexityBot accompagnés d'une interdiction, quelqu'un a pris une décision à votre place.
Interrogez votre hébergeur. Demandez si une protection contre les robots d'IA est active sur votre domaine. Chez certains fournisseurs elle l'est par défaut, et elle n'apparaît nulle part dans les fichiers de votre site.
Testez le résultat. Posez directement la question à plusieurs IA, comme le ferait un client, et regardez si votre entreprise apparaît et si les informations sont exactes. La méthode complète est détaillée dans notre article sur la façon de savoir si les IA parlent de votre entreprise.
Un exemple concret, puisque la transparence vaut mieux que la théorie : le fichier de règles d'eternys.fr autorise explicitement les robots d'indexation et d'entraînement des principaux fournisseurs, et n'en refuse qu'un seul, un aspirateur de contenu qui ne cite jamais ses sources. C'est le réglage que nous recommandons à la plupart des PME, et nous l'appliquons à nous-mêmes.
Refuser l'entraînement sans devenir invisible
C'est la position la plus équilibrée pour une entreprise qui publie du contenu de fond et qui tient à sa propriété intellectuelle.
Le principe est simple : vous refusez les robots dont la mission est de collecter du contenu pour entraîner les modèles, et vous autorisez ceux qui servent à indexer et à citer. Vous gardez la visibilité, vous fermez la porte à l'usage qui ne vous rapporte rien.
Cette distinction existe parce que les fournisseurs l'ont explicitement prévue. Chacun documente publiquement le nom de ses robots et leur rôle, précisément pour permettre ce réglage fin. Un prestataire web sérieux le met en place en moins d'une heure, sans toucher au reste du site.
Une réserve, par honnêteté : ce réglage repose sur la bonne volonté des acteurs. Le fichier de règles est une consigne, pas une serrure. Les acteurs identifiés la respectent, les acteurs opaques s'en moquent. Si votre enjeu réel est de protéger un contenu stratégique, ce n'est pas au niveau du site qu'il faut le traiter. La question rejoint alors celle, plus large, de la protection de vos données quand vos équipes utilisent l'IA.
Que gagne-t-on vraiment à ouvrir son site ?
Soyons précis, parce que la promesse est souvent survendue.
Aujourd'hui, être lisible par les IA ne génère pas un flux de visites comparable à celui d'un moteur de recherche classique. Les mesures de Similarweb pour 2026 montrent que la part des réponses de ChatGPT contenant un lien externe est passée d'environ 1 % à 6,8 % en un an aux États-Unis. La progression est spectaculaire, mais le chiffre dit aussi l'inverse : plus de neuf réponses sur dix ne renvoient encore vers aucun site.
Ce que vous gagnez se joue donc ailleurs, sur trois plans.
La présence dans la réponse elle-même. Même sans clic, être nommé comme une option crédible quand un dirigeant demande à une IA qui peut traiter son problème vaut infiniment mieux que ne pas exister dans cette réponse. La décision se prend souvent à ce moment-là, bien avant la visite du site.
L'exactitude. Une IA qui n'a pas accès à votre site répond quand même. Elle le fait à partir de sources tierces, d'annuaires périmés et de fragments anciens, et elle se trompera sur vos prestations, votre positionnement ou vos coordonnées. Lui donner accès à la source officielle est le moyen le plus simple et le moins coûteux de corriger cela.
L'avance. La part des réponses avec lien a été multipliée par près de sept en un an. Les entreprises qui auront un contenu structuré et accessible le jour où cette part deviendra significative ne se laisseront pas rattraper en quelques semaines. Les délais en jeu sont détaillés dans notre article sur la visibilité dans ChatGPT et les IA.
Que demander à son prestataire web ?
Quatre demandes, formulées en français simple, suffisent à couvrir le sujet.
Un état des lieux écrit. Quels robots d'IA sont actuellement autorisés ou bloqués sur le site, et par quel dispositif. La réponse doit couvrir les trois niveaux : le fichier de règles du site, les réglages de l'hébergeur, et les éventuels modules de sécurité installés.
L'autorisation des robots d'indexation et de citation. C'est le réglage qui décide de votre présence dans les réponses. Il n'a aucun effet négatif sur votre référencement classique.
Un arbitrage explicite sur les robots d'entraînement, avec vous dans la boucle. C'est une décision d'entreprise, pas un paramètre technique à trancher sans vous.
Une revérification après chaque refonte ou changement d'hébergeur. C'est exactement le moment où le réglage saute, silencieusement, et où personne ne s'en aperçoit avant des mois.
Ce qu'il faut retenir
Bloquer les IA est une décision défensive qui a du sens pour un éditeur vivant de son audience, et presque aucun pour une PME qui cherche des clients. Le danger réel n'est pas d'ouvrir son site : c'est de découvrir dans six mois qu'il était fermé depuis deux ans à cause d'un réglage que personne n'avait décidé.
La bonne posture tient en une phrase : autorisez ce qui peut vous citer, arbitrez consciemment ce qui vous entraîne, et revérifiez après chaque changement technique.
Un dernier point d'honnêteté. Ouvrir son site aux IA ne garantit ni mention, ni citation, ni recommandation. Aucun prestataire ne peut le garantir, Eternys pas davantage qu'un autre. Ce que ce réglage garantit, c'est que la porte n'est pas fermée. C'est un préalable, pas un résultat.