Résumé
Un audit de sentiment IA répond à une question qu’un score de visibilité ne peut pas traiter : quand ChatGPT, Gemini ou Perplexity mentionnent votre marque, que disent-ils réellement d’elle ? Ce guide couvre le jeu de prompts à construire, le nombre d’échantillons nécessaire avant qu’une lecture soit fiable, une échelle de notation volontairement grossière qui résiste au bruit, et la façon de remonter une formulation négative jusqu’à la source qui l’a provoquée.
La réponse courte
Un audit de sentiment IA mesure la manière dont ChatGPT, Gemini, Perplexity et les autres assistants décrivent votre marque lorsqu’ils la mentionnent. On le réalise en figeant un jeu de prompts, en interrogeant chaque moteur plusieurs fois par prompt, en notant chaque réponse sur cinq axes (présence, position, formulation, exactitude, sources), puis en remontant chaque formulation négative jusqu’à la page qui l’a produite. Le sentiment est bien plus souvent un problème de sources qu’un problème de wording.
Ce que mesure vraiment un audit de sentiment IA
La plupart des programmes de visibilité IA s’arrêtent à la présence : l’assistant nous cite-t-il, oui ou non. C’est une première métrique utile, et superficielle. Une marque peut apparaître dans neuf réponses sur dix et perdre malgré tout chaque deal influencé par ces réponses, parce que la mention se lit « une option moins chère pour les petites équipes » plutôt que « l’outil sur lequel la plupart des équipes du secteur se standardisent ».
Un audit de sentiment sépare la mention de sa formulation. Sur chaque réponse collectée, vous notez cinq choses distinctes.
- Présence — la marque est-elle nommée, et apparaît-elle spontanément ou seulement après que l’utilisateur l’a citée ?
- Position — première recommandation, noyée dans une liste de huit, ou simple figurante dans la dernière phrase.
- Formulation — les adjectifs et les réserves attachés à la mention. « Puissant mais complexe », « correct pour des besoins simples » et « le choix par défaut des équipes sérieuses » sont trois issues très différentes pour une même marque.
- Exactitude — la description correspond-elle à la réalité ? Un tarif erroné, une fonctionnalité abandonnée ou un positionnement périmé restent un problème de sentiment, même sur un ton élogieux.
- Sources — quelles pages l’assistant cite ou paraphrase. C’est le champ qui transforme un diagnostic en plan d’action.
La formulation est la dimension que les équipes sous-estiment. Les modèles de langage disent rarement quelque chose d’ouvertement négatif sur une marque. Le sentiment négatif dans les réponses IA prend presque toujours la forme d’un compliment tiède : une réserve, une nuance, un « idéal pour » qui exclut discrètement votre vrai acheteur.
Pourquoi le sentiment diverge entre ChatGPT, Gemini et Perplexity
Lancer le même prompt sur trois assistants produit souvent trois opinions différentes de votre entreprise. Ce n’est pas un défaut de votre mesure : cela reflète la façon dont ces systèmes fabriquent une réponse.
- ChatGPT s’appuie fortement sur ce que le modèle a absorbé pendant l’entraînement, mêlé à de la recherche web quand la question paraît sensible à l’actualité. Le sentiment y est inerte : il reflète la façon dont votre marque était décrite sur le web il y a plusieurs mois, pas la semaine dernière.
- Perplexity fonctionne d’abord par récupération de sources et cite au fil de la réponse. Le sentiment y suit les cinq à dix pages effectivement récupérées, ce qui signifie qu’un seul avis critique bien positionné peut dominer le ton de toute la réponse.
- Gemini se situe entre les deux et s’appuie sur les signaux de l’index Google : votre visibilité Search et votre sentiment IA y sont plus étroitement liés que partout ailleurs.
- Claude et Copilot ajoutent leurs propres mécaniques de récupération. Copilot hérite en particulier de l’indexation Bing, et une page que Bing n’a jamais indexée ne peut pas influencer la réponse, aussi bonne soit-elle.
Conséquence pratique : ne moyennez jamais le sentiment en un chiffre unique avant de l’avoir regardé moteur par moteur. Une marque peut être décrite chaleureusement par ChatGPT et de façon dédaigneuse par Perplexity, et les correctifs pour ces deux problèmes n’ont presque rien en commun.
Un score unique masque le problème
Un chiffre de sentiment IA agrégé sur tous les moteurs est confortable à présenter et quasiment inexploitable. Refine conserve chaque réponse brute, par moteur et par exécution : vous pouvez relire la phrase que Perplexity a réellement produite et voir quelle page citée l’a orientée. Le score vous dit que quelque chose a bougé. Le texte de la réponse vous dit quoi corriger.
Construire un jeu de prompts qui révèle le sentiment
Le suivi de présence se contente très bien de prompts de catégorie. Le sentiment, non. Si vous demandez seulement « quels sont les meilleurs outils pour X », vous récolterez des descriptions polies d’une ligne et n’apprendrez pas grand-chose. Le sentiment apparaît quand la question autorise le modèle à être critique.
Un jeu d’audit exploitable compte 25 à 60 prompts, répartis en cinq familles.
- Prompts de catégorie : « meilleurs outils X en 2026 », « principales alternatives à Y ». Ils établissent la présence et la position de référence.
- Prompts de comparaison : « Marque A vs Marque B », « comment A se compare à B pour une équipe mid-market ». La comparaison force le modèle à énoncer des arbitrages, et c’est là que la formulation devient explicite.
- Prompts d’objection : « la Marque A vaut-elle son prix », « quels sont les défauts de la Marque A », « avis négatifs Marque A ». C’est la famille la plus actionnable, et celle que la plupart des équipes oublient.
- Prompts d’adéquation : « la Marque A convient-elle à une agence de 15 personnes », « une ETI doit-elle utiliser la Marque A ». Ils révèlent si le modèle s’est trompé sur votre cible.
- Prompts de réputation : « la Marque A est-elle fiable », « la Marque A est-elle toujours active », « qui est derrière la Marque A ». Ils font remonter les faits périmés ou faux qui plafonnent discrètement toutes les autres réponses.
Rédigez les prompts avec les mots que vos acheteurs emploient réellement. La source la plus rapide reste vos appels commerciaux et votre boîte support, pas un outil de mots-clés. Un prompt que personne ne pose est un prompt dont le sentiment n’a aucune importance.
L’audit en cinq étapes
La méthode est simple. La difficulté tient à la faire toujours de la même manière.
- Figez le jeu de prompts. Réécrire les prompts entre deux runs rend la courbe de tendance dénuée de sens. Ajoutez-en avec le temps si nécessaire, mais ne retirez jamais discrètement ceux qui vous mettaient en difficulté.
- Échantillonnez, ne vérifiez pas. Les réponses des LLM sont probabilistes. Lancez chaque prompt au moins cinq fois par moteur, en session propre, mémoire et personnalisation désactivées, et lisez le résultat comme une distribution plutôt que comme un fait.
- Capturez le texte brut. Stockez la réponse complète et les URL citées, pas seulement un score. Presque tout ce qui est utile dans un audit vient de la relecture ultérieure des réponses.
- Notez chaque réponse sur les cinq axes ci-dessus, avec la même échelle à chaque fois. La constance compte davantage que la finesse.
- Remontez les cas extrêmes. Pour chaque réponse nettement négative, ouvrez les sources. Neuf fois sur dix, la formulation vient d’une page précise : un vieil avis, un comparatif rédigé par un concurrent, un fil Reddit, ou votre propre page tarifs devenue obsolète.
Transformer les réponses en un score suivable
Il vous faut un score pour observer les évolutions sur plusieurs trimestres, mais gardez une échelle grossière. Un scoring de sentiment trop fin sur un système probabiliste crée une fausse précision et déclenche des débats sur du bruit.
Une échelle simple et défendable :
- +2 — recommandé sans réserve, ou désigné comme l’option de référence.
- +1 — mentionné positivement mais avec une réserve limitante, du type « bien pour les petites équipes ».
- 0 — mentionné de façon neutre, une entrée parmi d’autres dans une liste, sans évaluation.
- -1 — mentionné avec une réserve qui dissuaderait votre acheteur cible, ou décrit de façon inexacte.
- -2 — activement écarté, ou concurrent recommandé à votre place dans une comparaison directe.
Publiez deux chiffres par moteur : le score moyen sur l’ensemble des mentions, et la part de réponses où vous apparaissez. Le couple compte davantage que chacun des deux pris isolément. Un sentiment qui monte pendant que la présence baisse signifie généralement que vous êtes cité par un ensemble de sources plus étroit et plus spécialisé, ce qui est une situation très différente d’une couverture large mais tiède.
Corriger le sentiment négatif à la source
Une fois les formulations remontées jusqu’à leurs sources, les correctifs sont peu spectaculaires et concernent rarement votre page d’accueil.
- Corrigez d’abord la couche factuelle. Un tarif erroné, une liste de fonctionnalités périmée ou une histoire de création dépassée sur votre site, G2, Crunchbase ou Wikipédia se propage partout. C’est le gain le moins cher de tout l’exercice.
- Répondez publiquement aux prompts d’objection. Si « défauts de la Marque A » renvoie vers la page d’un concurrent, vous avez cédé la question. Une page honnête qui nomme de vrais arbitrages est souvent citée précisément parce qu’elle paraît équilibrée.
- Corrigez la ligne « idéal pour ». Si tous les assistants vous décrivent comme idéal pour les petites équipes alors que vous vendez au mid-market, cette formulation vient de quelque part, souvent de votre propre positionnement d’il y a deux ans, toujours indexé.
- Gagnez des mentions tierces précises. Un avis qui dit « installation rapide, moins d’une heure » donne au modèle quelque chose de citable. Un avis qui dit « super produit » ne lui donne rien.
- Soyez patient avec la mémoire paramétrique. Les moteurs orientés récupération peuvent basculer en quelques jours dès qu’une nouvelle page se positionne. Le sentiment inscrit dans les données d’entraînement évolue, lui, au rythme des sorties de modèles.
À quelle fréquence relancer l’audit
Le mensuel est la bonne cadence pour l’audit complet et noté. Un échantillonnage hebdomadaire reste utile comme couche de surveillance, pour repérer une chute brutale ou l’arrivée d’un nouveau concurrent dans les réponses, mais les variations hebdomadaires de sentiment sont presque toujours du bruit autour d’une tendance plutôt que la tendance elle-même.
Jugez le programme sur des trimestres. Fixez une base au premier mois, corrigez la couche factuelle au deuxième, et attendez le premier mouvement lisible autour du troisième ou quatrième mois, plus tôt sur les moteurs très orientés récupération, plus tard sur ChatGPT. Les équipes qui abandonnent le font en général vers la sixième semaine, c’est-à-dire exactement au moment où les données commencent à devenir utiles.
Peu de temps ? Faites résumer cette page par un assistant.

