Résumé
Une prépublication parue le 5 octobre 2026, signée Amine Aziz Alaoui (GetMint Research), modélise la visibilité des marques dans ChatGPT à partir de plus d’un million de réponses collectées entre janvier et septembre 2026. Son résultat central : le taux de visibilité quotidien d’un prompt varie d’environ 14 points d’un jour à l’autre, surtout pour des raisons qui s’estompent en deux à trois jours, tandis que son niveau de fond dérive d’environ 4 à 4,5 points par jour. Aucun nombre de runs sur une seule journée ne mesure un prompt à mieux que ±28 points environ. Les chiffres fiables viennent du regroupement des prompts en thématiques, lues sur environ deux semaines. Cet article résume l’étude et ce qu’elle change pour le suivi de la visibilité IA.
La réponse courte
La visibilité d’un seul prompt sur ChatGPT, un jour donné, est un signal faible : selon l’étude, elle peut s’écarter d’environ ±28 points du niveau réel du prompt, quel que soit le nombre de runs ce jour-là. Une thématique d’une vingtaine de prompts lue sur 14 jours est précise à environ ±7 à ±8 points en période calme. Suivez des thématiques plutôt que des prompts, lisez les tendances sur deux semaines plutôt qu’au jour le jour, et traitez les mouvements soudains de tous vos prompts comme de possibles changements du moteur avant de les attribuer à votre travail.
L’étude en un paragraphe
Le papier s’intitule « A Measurement Model for Brand Visibility in ChatGPT Answers », par Amine Aziz Alaoui (GetMint Research, prépublication v1.3, DOI 10.5281/zenodo.23156371). Il s’appuie sur huit mois de suivi en production de GetMint, une plateforme de visibilité IA, sur l’interface web grand public de ChatGPT en session déconnectée : plus d’un million de réponses à des dizaines de milliers de prompts, la plupart observés une fois par jour. L’auteur modélise le taux de visibilité d’un prompt (la part des réponses qui mentionnent une marque) comme un niveau qui dérive lentement, plus un effet du jour qui ne dure pas, observés à travers des tirages aléatoires, avec des chocs occasionnels qui touchent tous les prompts à la fois.
Nous n’avons aucun lien avec cette étude. Nous en parlons parce qu’elle est l’un des traitements publics les plus rigoureux d’une question à laquelle tout outil de visibilité IA, y compris le nôtre, doit répondre : à quel point peut-on se fier à un chiffre de visibilité, et pendant combien de temps ?
Résultat 1 : la visibilité bouge de 14 points d’un jour à l’autre
Sur les jours où un même prompt a été lancé plusieurs fois, l’auteur a pu séparer le bruit d’échantillonnage (une même question qui donne des réponses différentes) du vrai mouvement de ChatGPT. Pour les prompts à visibilité intermédiaire, le taux réel a bougé d’environ 14 points entre deux jours consécutifs, de 20 points à deux ou trois jours d’écart, et de 25 à 33 points à une à six semaines d’écart.
Ce mouvement se décompose en deux parties :
- Un effet du jour d’environ 14 à 16 points : ce que ChatGPT récupère et la façon dont il rédige ce jour-là. Il s’estompe en deux à trois jours, et aucun des deux jours n’est plus « vrai » que l’autre.
- Une dérive du niveau d’environ 4 à 4,5 points par jour pour un prompt, qui s’accumule dans le temps : environ 16 points après deux semaines et 24 points après un mois.
Le papier montre aussi pourquoi beaucoup d’équipes ne voient pas ce phénomène. Le raccourci courant d’un run par jour, avec une variance estimée sur toute la fenêtre, soustrait mathématiquement le mouvement qu’il devrait mesurer. Il produit une lecture trompeuse du type « stable pendant deux semaines », quoi que fasse le moteur. L’auteur précise que la première version de son propre travail commettait cette erreur, ce qui est une bonne raison de prendre la correction au sérieux.
Pourquoi c’est important
Si votre tableau de bord indique qu’un prompt est passé de 40 % à 55 % de visibilité depuis hier, l’étude suggère que c’est largement dans la variation ordinaire d’un jour à l’autre. Y réagir, ou le présenter comme une victoire, revient à lire du bruit.
Résultat 2 : multiplier les runs sur une journée ne suffit pas
Le réflexe face à des réponses IA bruitées est de lancer chaque prompt plus souvent. L’étude montre où cela cesse de fonctionner. Multiplier les runs d’un prompt le même jour ne fait que préciser le taux de ce jour-là, pas le niveau de fond du prompt, car l’effet du jour est partagé par tous les runs de la journée.
Les chiffres du papier : pour un seul prompt, 96 runs en une journée donnent environ ±29 points sur le niveau, 300 runs environ ±28, et aucun nombre de runs le même jour ne descend sous ±28 environ. Pour une thématique de 20 prompts, 30 runs chacun sur une journée (600 réponses) donnent environ ±7, et non les ±4 que promet le seul calcul d’échantillonnage ; passer à 100 runs chacun n’améliore rien. Au-delà d’environ 30 runs par prompt, une rafale le même jour n’apporte plus rien.
Résultat 3 : la thématique sur deux semaines est l’unité fiable
La précision vient du regroupement de jours et de prompts, pas des runs. Les jours calmes, les variations quotidiennes de prompts différents sont quasiment décorrélées (environ 0,004 à 0,009 dans le portefeuille d’un client, même pour un prompt identique traduit pour deux pays) : elles s’annulent quand on fait la moyenne d’une thématique.
Les marges de l’étude pour une thématique de 20 prompts, à un run par prompt et par jour :
- Un jour : environ ±23 points.
- 7 jours : environ ±9 points.
- 14 jours : environ ±7 à ±8 points.
- 30 jours : environ ±8 points, car le niveau lui-même bouge au cours du mois.
- Un prompt isolé ne descend jamais sous ±32 points environ, quelle que soit la fenêtre.
La conclusion pratique est nette : l’unité du suivi de visibilité IA est la thématique, pas le prompt, et la bonne fenêtre de lecture est d’environ deux semaines. En simulation, une moyenne mobile sur 14 jours affichée avec une marge d’environ ±7 se comportait de façon proche du filtre plus sophistiqué de l’auteur. Une moyenne sur 30 jours, affichée avec la marge étroite que donne le seul calcul d’échantillonnage, ne contenait le vrai niveau qu’environ une fois sur deux.
Résultat 4 : ChatGPT change sans l’annoncer
Certains jours, tous les prompts bougent ensemble. L’auteur a construit une « sentinelle » qui signale les jours où les prompts suivis se déplacent dans le même sens bien plus que le hasard ne le permet. Entre mai et juillet 2026, elle a daté sept chocs communs sur ChatGPT web, dont six sans aucun événement public du moteur dans les deux jours. Elle a aussi détecté un changement de version du modèle non annoncé le 8 août 2026, rapproché de l’étiquette de version affichée avec les réponses.
L’inverse s’est aussi produit : le lancement public de GPT-5.6 le 9 juillet 2026 n’a eu aucun effet détectable sur les mentions de marques. Comme le dit le papier, annonces et impact sont deux objets distincts. On ne peut pas compter sur les notes de version pour expliquer ses chiffres : il faut détecter les changements à partir des données elles-mêmes.
L’étude observe également que certains segments bougent plus que d’autres : les prompts du retail et les organisations de taille moyenne s’écartent de la courbe moyenne. L’auteur considère ces résultats par segment comme exploratoires.
Ce que cela change pour votre suivi de visibilité IA
Quel que soit votre outil, voici les pratiques que ces résultats justifient :
- Regroupez vos prompts en thématiques de 15 à 20 prompts ou plus, et pilotez la thématique, pas les prompts individuels. Un prompt isolé est un diagnostic, pas un KPI.
- Lisez les tendances sur environ deux semaines. Les courbes quotidiennes servent à repérer des événements, pas à juger une performance.
- Affichez l’incertitude. Un score de thématique sans marge d’environ ±7 à ±8 points pousse à la surinterprétation.
- Surveillez les jours où tous les prompts bougent ensemble. Avant d’attribuer un gain à un contenu, vérifiez si les prompts concurrents et les prompts témoins ont bougé de la même manière.
- Mesurez vos actions face à des prompts témoins. Le papier décrit une approche en différence de différences : comparer les prompts ciblés à des prompts comparables auxquels vous n’avez pas touché.
- Ne payez pas pour d’énormes volumes de runs le même jour. Au-delà d’environ 30 runs par prompt et par jour, le gain de précision est illusoire.
Pour comprendre plus largement pourquoi les réponses IA évoluent, lisez notre guide sur la fréquence de changement des réponses IA, et pour mener de vraies expériences, comment tester vos changements GEO en A/B.
Appliquer ces résultats avec Refine
Refine lance vos prompts chaque jour sur ChatGPT, Gemini, Perplexity, Claude, Copilot et Mistral. Taguez vos prompts par thématique, lisez part de voix et taux de mention au niveau du tag sur deux semaines plutôt que prompt par prompt, et comparez vos thématiques à celles de vos concurrents sur les mêmes prompts pour distinguer les mouvements du moteur de vos propres gains. Pour en parler, [contactez-nous](/fr/contact).
Les limites de l’étude
Le papier est une prépublication et expose clairement ses limites. Il couvre une seule surface, ChatGPT web en session déconnectée, et les prompts des clients d’une seule plateforme, pas l’ensemble du web. L’effet du jour et la dérive sont estimés sur les jours à runs répétés, minoritaires et concentrés en juin et juillet 2026. La question de savoir si la vitesse de mouvement change selon la période reste ouverte, et les marges supposent des périodes calmes. Les résultats peuvent différer pour Gemini, Perplexity, Claude ou Copilot, même si l’auteur indique que la méthode se transpose à tout moteur.
Malgré ces réserves, la leçon principale est solide et rejoint ce que les praticiens constatent chaque jour : un chiffre de visibilité IA est une mesure avec une marge d’erreur, pas un fait. Traitez-le comme tel, et vos décisions de contenu, de relations presse et de budget reposeront sur du signal plutôt que sur du bruit quotidien.
Peu de temps ? Faites résumer cette page par un assistant.

