Mesure de septembre 2026 · comparaison avec —

Les IA peuvent-elles lire les sites des PME ? Nous avons mesuré 3 054 sites dans 12 pays.

Personne ne publiait le chiffre pour la France. Nous le mesurons, tous les mois, sur un échantillon de sites de commerces, d’artisans, de restaurants et de cabinets tirés au sort dans quinze départements. La première mesure a démenti notre propre accroche — nous écrivions que « beaucoup de sites » s’étaient fermés aux IA sans le savoir. C’est faux, et nous l’avons corrigé le jour même. Voici ce qui est vrai, et comment ça évolue.

1,1 %
des sites ferment la porte à un robot qui répond dans les IA
71,2 %
n’affichent aucun prix en toutes lettres
74,9 %
n’affichent aucune date de mise à jour
1 200
sites lus, aucun injoignable

L’échantillon : des PME, pas des médias

Les adresses viennent d’OpenStreetMap, qui recense le site web de centaines de milliers de commerces, artisans, bureaux et restaurants français. Quinze départements, de Paris au Cantal, pour ne pas mesurer une seule métropole. Surtout : aucun classement de popularité. Un top 1 000 est rempli de médias, et la presse bloque massivement — 49 % de la presse américaine et britannique ferme la porte à OAI-SearchBot, contre 0,2 % des sites d’entreprise ordinaires. En déduire quoi que ce soit sur une boulangerie serait une faute de raisonnement. Tirage aléatoire à graine fixe après dédoublonnage par domaine, pour que la mesure soit rejouable à l’identique. Les pages Facebook, Doctolib et autres plateformes sont écartées : ce sont les sites d’un tiers.

Les résultats, ligne par ligne

Ce qui a été constatéSitesPartÉvolution
Au moins un robot de recherche bloqué — le site ne peut pas être cité13 / 1 2001,1 %
dont OAI-SearchBot (ChatGPT)11 / 1 2000,9 %
dont Claude-SearchBot7 / 1 2000,6 %
dont PerplexityBot11 / 1 2000,9 %
GPTBot bloqué — l’entraînement, sans effet sur les citations42 / 1 2003,5 %
robots.txt illisible : le serveur refuse ou ne répond pas239 / 1 20019,9 %
Balise noindex ou nosnippet sur la page d’accueil11 / 8961,2 %
Contenu qui dépend probablement de JavaScript41 / 8964,6 %
Aucun prix écrit en toutes lettres638 / 89671,2 %
Aucune date de mise à jour lisible671 / 89674,9 %

Deux dénominateurs, et il ne faut pas les mélanger : ce qui se lit dans le robots.txt porte sur tous les sites de l’échantillon, ce qui se lit dans la page ne porte que sur les pages réellement lues. Chaque ligne affiche donc le sien. La colonne « Évolution » est en points de pourcentage depuis la mesure précédente ; elle reste vide au premier mois, faute de comparaison.

Et ailleurs ? La même mesure, pays par pays

Le même diagnostic, sur un échantillon OpenStreetMap propre à chaque pays. Chaque ligne a son mois et son échantillon : on ne mélange pas, on ne compare que ce qui est comparable.

PaysMesureSites lusAu moins un robot de recherche bloqué — le site ne peut pas être citéAucun prix écrit en toutes lettresAucune date de mise à jour lisible
Émirats arabes unisseptembre 20261981,5 %93,6 %79,8 %
Belgiqueseptembre 20261981,0 %71,2 %80,1 %
Suisseseptembre 20261910,5 %94,6 %81,3 %
Égypteseptembre 20261771,7 %86,5 %85,4 %
Jordanieseptembre 20261171,7 %91,5 %85,4 %
Koweïtseptembre 20261420,7 %94,1 %87,1 %
Libanseptembre 20261421,4 %75,6 %77,9 %
Marocseptembre 20262150,0 %82,1 %73,7 %
Qatarseptembre 20261372,2 %90,1 %84,6 %
Arabie saouditeseptembre 20261651,2 %93,8 %87,5 %
Tunisieseptembre 20261721,7 %84,9 %66,7 %

Ce que ça veut dire : le blocage est rare, l’absence d’information est massive

Un site sur cent environ s’est retiré des réponses des IA. C’est rare — mais c’est total, ça dure tant que la ligne reste dans le fichier, et personne n’est jamais prévenu : c’est un argument de gravité, pas de fréquence. Le geste « je bloque les IA », lui, est courant : 3,5 % ferment GPTBot, qui sert à entraîner les modèles et ne coûte aucune citation. Beaucoup de sites croient donc s’être protégés sans avoir rien fermé de ce qui compte. Ce qui est vraiment massif est ailleurs : sept sites sur dix n’écrivent pas leur prix, trois sur quatre n’affichent aucune date. Or l’étude SIGIR 2026, sur 252 000 essais appariés, place le prix explicite parmi les quatre facteurs décisifs de citation, et Ahrefs, sur 17 millions de citations, montre que les IA citent du contenu plus frais que l’organique.

Ce que ça ne veut pas dire

Que d’écrire un prix fera citer votre client. Personne n’a publié d’étude avant/après avec groupe de contrôle qui le démontre, et nous ne le promettrons pas tant que ce sera le cas. Ce que ces chiffres établissent, c’est une fréquence : combien de sites présentent un obstacle vérifiable, documenté par les fournisseurs eux-mêmes ou mesuré avec un groupe de contrôle. Retirer un obstacle vérifiable est un travail utile ; le vendre comme une garantie de citation serait un mensonge.

Les limites, en toutes lettres

1 200 sites ne sont pas un recensement : les intervalles ci-dessus disent la marge. L’échantillon ne contient que des entreprises assez visibles pour avoir été cartographiées avec leur site web — les plus petites en sont absentes. Un site sur cinq n’a pas laissé lire son robots.txt, le plus souvent parce que son hébergeur refuse tout robot inconnu ; ces sites sont comptés comme « inconnus », jamais comme « ouverts ». Seule la page d’accueil a été lue, pas les pages produit. Et c’est une photo prise au moment de la mesure : un robots.txt change en une ligne.

Refaire la mesure

Le diagnostic qui a produit ces chiffres est exactement celui de l’outil gratuit : deux requêtes HTTP par site, aucun appel à un modèle, donc rien qui coûte à personne. Vous pouvez le lancer sur l’adresse de votre choix cinq fois par jour sans compte, sans limite une fois connecté. Les données de l’échantillon viennent de l’API Overpass d’OpenStreetMap, interrogeable librement : la méthode décrite ici est suffisante pour refaire la mesure et nous contredire, ce qui est la seule façon sérieuse de la valider.

Et le site de votre client, il en est où ?

Le même diagnostic, sur l’adresse de votre choix. Gratuit, sans compte, en dix secondes.

Vérifier un site →

← Retour à l’accueil