Skip to content

Guides pratiques/20 Août 2026

Accès des crawlers IALa raison silencieuse pour laquelle votre marque est absente des réponses IA

Robin Pautigny

Robin Pautigny

Co-fondateur, Refine

Accès des crawlers IA : la raison silencieuse pour laquelle votre marque est absente des réponses IA

Résumé

Les assistants IA ne peuvent citer que ce qu’ils peuvent récupérer. Chaque grand fournisseur opère aujourd’hui plusieurs crawlers distincts : un pour collecter des données d’entraînement, un pour construire un index de recherche, un pour aller chercher une page en direct quand un utilisateur pose une question, et ils doivent être traités séparément. Bloquer un crawler d’entraînement est une décision d’entreprise légitime. Bloquer un crawler de récupération vous retire du vivier de sources citables. Ce guide explique la différence, liste les user agents à connaître et propose un audit de 30 minutes.

La réponse courte

Si votre marque est absente des réponses IA, vérifiez l’accès des crawlers avant d’écrire une ligne de contenu supplémentaire. Chaque grand fournisseur sépare désormais ses bots par usage : OpenAI distingue GPTBot (entraînement) de OAI-SearchBot (indexation) et de ChatGPT-User (récupération en direct déclenchée par l’utilisateur) ; Anthropic et Perplexity suivent le même schéma. Une seule règle globale dans robots.txt, un réglage par défaut de bot management chez votre CDN ou une règle WAF qui renvoie 403 aux user agents inconnus peuvent tous les bloquer d’un coup. Refuser l’entraînement tout en restant citable est une configuration parfaitement valable, à condition d’écrire les règles agent par agent.

Les deux familles de crawlers IA (et pourquoi la distinction décide de tout)

Le modèle mental le plus utile en 2026 : les crawlers IA se rangent en deux familles qui rendent à votre marque des services totalement différents.

Les crawlers d’entraînement collectent des pages susceptibles d’alimenter le corpus servant à entraîner ou affiner un modèle. Le bénéfice est lent, diffus et impossible à attribuer : des mois plus tard, un modèle aura peut-être intégré que votre produit existe et ce qu’il fait. Vouloir cela ou non est une vraie question business, et des entreprises raisonnables y répondent différemment : un éditeur avec des revenus de licence en jeu dira souvent non, et c’est défendable.

Les crawlers de récupération sont d’une autre nature. Ils vont chercher des pages pour qu’un assistant puisse fonder la réponse qu’il est en train de générer. Quand quelqu’un demande à ChatGPT ou Perplexity les meilleurs outils de votre catégorie, l’assistant lance une recherche, récupère quelques URL, les lit et synthétise une réponse sourcée. Si vos pages ne peuvent pas être récupérées à cet instant, vous n’êtes pas dans la réponse. Pas de pénalité, pas de déclin progressif, aucun diagnostic dans vos analytics. Vous ne faites simplement pas partie de la matière dont le modèle disposait.

Cette asymétrie explique pourquoi le débat sur « bloquer les bots IA » est si souvent mal posé. La question n’est pas de savoir s’il faut laisser entrer les entreprises d’IA, mais lesquels de leurs agents laisser entrer, et pour quel usage.

Les user agents à connaître en 2026

La liste ci-dessous couvre les agents qui représentent l’essentiel du trafic IA vers un site B2B ou e-commerce classique. Les noms et les comportements évoluent : considérez ceci comme un point de départ et vérifiez la documentation publiée par chaque fournisseur avant de figer une politique.

  • OpenAI : GPTBot collecte des données pouvant servir à l’entraînement. OAI-SearchBot indexe les pages pour la recherche ChatGPT. ChatGPT-User récupère une page précise à la demande d’un utilisateur ou d’une action ChatGPT.
  • Anthropic : ClaudeBot est le crawler d’entraînement. Claude-SearchBot alimente l’indexation de recherche. Claude-User récupère une page en réponse à une demande directe dans Claude.
  • Perplexity : PerplexityBot indexe les pages pour qu’elles puissent être citées dans les réponses. Perplexity-User récupère une page qu’un utilisateur a explicitement demandée.
  • Google : Googlebot reste le crawler derrière Search, les AI Overviews et AI Mode. Google-Extended est un contrôle distinct qui régit l’usage de vos contenus pour l’entraînement et le grounding de Gemini, sans affecter l’indexation Search.
  • Apple : Applebot alimente Siri et Spotlight. Applebot-Extended est le signal d’opt-out spécifique à l’entraînement des modèles génératifs.
  • Autres à surveiller ou autoriser : Meta-ExternalAgent, Amazonbot, MistralAI-User, Bingbot (qui alimente plusieurs assistants en aval) et CCBot, le bot de Common Crawl dont les archives sont bien plus utilisées que la plupart des équipes ne l’imaginent.

Le principe à retenir : chez un même fournisseur, bloquer un agent ne bloque pas les autres, et en autoriser un n’autorise pas les autres. Chaque règle doit viser explicitement un user agent. C’est l’erreur de configuration la plus fréquente que nous voyons, et elle reste invisible tant que personne ne va la chercher.

Pourquoi des sites bien optimisés restent bloqués

La plupart des sites bloqués n’ont jamais choisi de l’être. Le blocage vient d’un endroit de la stack que personne au marketing ne pilote.

  • Réglages par défaut du CDN et du bot management. Plusieurs fournisseurs activent désormais la mitigation des bots IA par défaut ou derrière un simple interrupteur. Un ingénieur soucieux de sécurité l’active, rien ne casse visiblement, et votre taux de citation se dégrade les semaines suivantes.
  • Règles WAF qui rejettent les user agents inconnus. Une règle écrite contre les scrapers renverra volontiers un 403 à OAI-SearchBot, qui ne ressemble en rien à un navigateur.
  • robots.txt hérité. Une ligne « User-agent: GPTBot / Disallow: / » copiée d’un article de 2024, jamais revue, qui bloque un fournisseur pendant que ses agents frères passent tranquillement.
  • Rate limiting trop agressif. Les bots de récupération demandent souvent plusieurs pages en rafale. Si vos limites sont calées sur des sessions humaines, le crawler est étranglé puis abandonne.
  • Rendu côté client. Si le fond de votre page n’apparaît qu’après exécution du JavaScript, un crawler qui récupère le HTML brut ne voit qu’une coquille vide. Il avait le droit d’entrer, il n’a rien trouvé à citer.
  • Interstitiels et murs souples. Bannières cookies bloquantes, redirections géographiques et accès conditionnels réduisent tous ce qu’un agent peut réellement extraire.

Aucun de ces problèmes n’apparaît dans la Search Console, et c’est pour cela qu’ils persistent. Indexation search et récupération IA sont désormais deux pipelines distincts avec deux modes de défaillance distincts, et un seul dispose d’une console de diagnostic mature.

Auditer vos accès crawlers IA en 30 minutes

Nul besoin d’en faire un projet. Déroulez les étapes suivantes dans l’ordre et vous saurez où vous en êtes.

  • Lisez vraiment votre robots.txt. Récupérez-le, listez chaque bloc user-agent et notez ce que chacun autorise. Méfiez-vous des règles avec wildcard qui attrapent plus d’agents que prévu.
  • Simulez chaque crawler. Demandez une page clé, accueil, page produit, page comparatif, en envoyant chaque chaîne de user agent, et notez le code HTTP. Tout ce qui n’est pas 200 est un constat. Un 403 ou un 429 signifie que votre edge les refuse, quoi que dise robots.txt.
  • Vérifiez ce qu’un bot voit réellement. Comparez la réponse HTML brute et la page rendue. Si votre proposition de valeur, vos tarifs ou vos fonctionnalités n’existent que dans la version rendue, ce contenu n’est pas citable.
  • Cherchez ces user agents dans vos logs serveur et CDN sur les 30 derniers jours. Zéro visite d’un fournisseur est un signal fort de blocage, pas de désintérêt.
  • Confirmez que vos pages clés sont accessibles sans JavaScript, sans mur de cookies et sans connexion.
  • Écrivez la politique. Décidez explicitement, fournisseur par fournisseur, ce que vous autorisez pour l’entraînement et pour la récupération, puis documentez-le là où le prochain ingénieur qui touchera au WAF le trouvera.

Comptez une demi-heure pour le premier passage, puis refaites l’exercice chaque trimestre et à chaque changement de CDN, d’hébergeur ou de prestataire sécurité. L’accès n’est pas un réglage définitif : il dérive.

L’accès est l’entrée, la citation est le résultat

Corriger l’accès des crawlers vous dit que la porte est ouverte. Pas que quelqu’un l’a franchie. Le résultat mesurable, c’est de savoir si votre marque est effectivement nommée et citée quand de vrais prompts sont exécutés, ce que Refine suit en continu sur ChatGPT, Gemini, Perplexity, Claude, Copilot et Mistral. Faites l’audit d’accès d’abord, puis observez les taux de mention et de citation sur les quatre à huit semaines suivantes. Si l’accès était le goulot, c’est là que ça se verra.

Quatre politiques de crawl qui tiennent debout

Il n’y a pas de réponse universelle, mais quatre postures cohérentes. Choisissez-en une délibérément plutôt que d’y arriver par accident.

  • Totalement ouverte. Autoriser entraînement et récupération partout. Le meilleur choix pour la plupart des SaaS B2B, des sociétés de services et des challengers, dont le problème est d’être inconnus, pas d’être copiés.
  • Récupération seule. Bloquer les crawlers d’entraînement, autoriser les agents de recherche et de récupération utilisateur. L’équilibre idéal pour les entreprises avec un vrai enjeu de propriété intellectuelle qui veulent rester citables. Cela exige des règles par agent et une revue régulière, car tout nouvel agent hérite de ce que dit votre wildcard.
  • Sélective. Ouvrir la documentation, les pages comparatives, le glossaire et le blog public ; restreindre les études gated, les données clients et tout ce qui est payant. Cohérent avec le fait que les modèles citent bien plus souvent du contenu explicatif que des pages commerciales.
  • Fermée. Tout bloquer. Rationnel uniquement si la licence de contenu est une vraie ligne de revenus et que vous avez le rapport de force pour négocier. Sachez ce que vous échangez : dans votre catégorie, la réponse sera générée quand même, avec quelqu’un d’autre dedans.

Ce que l’accès crawler ne réglera pas

Ce serait pratique si l’accès crawler résumait tout. Ce n’est pas le cas. L’accès est une condition préalable, pas une stratégie : il vous place dans le vivier des sources éligibles, rien de plus.

Une fois qu’un modèle peut vous lire, encore faut-il qu’il vous préfère. Cela vient de ce vers quoi les praticiens du GEO convergent depuis deux ans : un contenu qui répond directement dès le premier paragraphe, une structure propre et extractible, des affirmations précises avec chiffres et dates, et surtout une corroboration ailleurs. Les modèles pondèrent fortement l’accord de tiers. Une affirmation présente sur votre site, sur une plateforme d’avis, dans un fil communautaire et dans un comparatif sectoriel n’a rien à voir avec la même affirmation présente uniquement dans vos propres supports marketing.

L’ordre compte donc. Vérifiez que les agents de récupération peuvent lire vos pages. Vérifiez que ces pages contiennent des réponses factuelles, à jour et extractibles. Construisez ensuite la corroboration tierce qui met un modèle à l’aise pour vous nommer. Sauter directement à la troisième étape explique pourquoi tant de programmes de contenu bien financés ne produisent rien de mesurable dans les réponses IA, alors que vérifier la première prend un après-midi.

Peu de temps ? Faites résumer cette page par un assistant.