BLOG

Le chatbot branché sur le réseau publicitaire : ChatGPT intègre vos comportements intersites dans le profil publicitaire

Kael Zhang
ChatGPTConfidentialitéTechnologie publicitaireOpenAI
广告 · Advertisement

Suivi des tendances : publication des tendances × jugement technique × conseils pratiques. Auteur : Yongliang


Fixons d’abord le temps. Le 20 septembre, un chercheur indépendant a publié sur son blog personnel buchodi.com une divulgation : ChatGPT utilise un collecteur de publicités (ad collector) pour lier directement les actions des utilisateurs sur des sites tiers à leur compte ChatGPT. L’article a atteint la première page de Hacker News le jour même, avec 555 votes positifs et 303 commentaires, la discussion s’étendant sur des centaines de niveaux. Cet article est écrit dans la fenêtre de 48 heures suivant la publication initiale. Le mécanisme en lui-même n’est pas nouveau dans la technologie publicitaire ; ce qui est nouveau, c’est l’endroit où il s’exécute — un produit que les gens ont l’habitude d’utiliser pour se confier. Les faits suivants sont basés sur les déclarations de l’auteur de la divulgation, certaines pages de politiques officielles ayant été vérifiées indépendamment.

Ce qui s’est passé

Présentons les faits selon la version donnée, tous issus de l’article de divulgation original et des pages de politiques officielles d’OpenAI.

Le chercheur affirme avoir reproduit l’intégralité du processus sur mobile, et l’avoir vérifié de manière croisée en utilisant deux méthodes de capture de paquets ; des mois d’observation du trafic ont couvert 936 pixels d’annonceurs et 1 029 domaines. Le processus décomposé est le suivant :

À la première étape, le client ChatGPT génère 16 octets aléatoires, les échange contre un JWT signé en RS256 auprès du serveur, expire au bout de 60 secondes, et contient le numéro de version de la politique de consentement (user_granular_consent_v1) et l’identifiant du compte. À la deuxième étape, le serveur dépose un cookie nommé __obi : attaché au domaine de premier niveau openai.com, HttpOnly, SameSite défini sur none, Secure, avec une validité d’un an. Les connaisseurs comprennent en voyant ces trois caractéristiques : HttpOnly signifie que les scripts ne peuvent pas le lire mais que le navigateur l’enverra automatiquement, SameSite=none signifie que les requêtes intersites seront envoyées sans problème, et une validité d’un an signifie qu’il devient un ancrage d’identité à long terme, et non un marqueur de session jetable. La combinaison de ces trois caractéristiques détermine qu’il peut être porté intersites.

Du côté des annonceurs, dès qu’un site installe le SDK de pixel d’OpenAI — le même genre de code de suivi que Meta ou Google —, dès que l’utilisateur ouvre la page, le navigateur envoie automatiquement le cookie à OpenAI. Cette étape ne nécessite pas que l’annonceur écrive du code ; le navigateur a déjà attaché les identifiants avant que le SDK ne s’exécute. Selon les termes de l’auteur de la divulgation : même si le chemin du code ne le transmet pas activement, on ne peut pas empêcher le navigateur de l’attacher automatiquement.

Le SDK ne rapporte pas seulement les événements publicitaires : dans le trafic observé, « capture d’identité » est apparu 685 fois, tandis que « fourni activement par l’annonceur » n’est apparu que 255 fois — c’est-à-dire que plus de 60 % des informations d’identité sont capturées par le SDK lui-même depuis la page, et non remplies par l’annonceur. Les sources de capture incluent la couche de données du Google Tag Manager ; le SDK renomme d’abord les variables, puis analyse cette couche de données renommée. La version v0.1.31 publiée le 27 août a restreint la portée ; les versions précédentes récupéraient également le nom et la localisation géographique. La pratique actuelle est la suivante : l’e-mail et le téléphone sont hachés en SHA-256 avant transmission, tandis que le pays, la région, la ville et le code postal sont envoyés en clair ; le code postal est le champ de formulaire le plus récolté — sur 28 sites, 100 événements.

Au niveau de l’URL, seuls l’origine et le chemin sont envoyés, pas la chaîne de requête ; parmi les 23 929 observations, aucune ne contenait de paramètre de requête. Mais le chemin lui-même est une information : parmi les chemins observés sont apparus une condition médicale, un entonnoir de résolution de dettes et un formulaire de réception de poursuite judiciaire.

La fonction « correspondance automatique » est activée sur 638 des 881 pixels dont la configuration a pu être confirmée, couvrant chaque annonceur de type crédit observé ; le commutateur est contrôlé par OpenAI Ads Manager. La correspondance automatique consiste à faire correspondre la liste de clients existante de l’annonceur avec l’identifiant du visiteur collecté par le pixel : l’annonceur n’a pas besoin de savoir qui vous êtes ; tant que les listes correspondent, le système publicitaire sait à qui et quoi diffuser. Le fait que cette fonction soit entièrement activée chez les annonceurs de type crédit et prêt est en soi très révélateur — la conversion de ce type de commerce dépend justement le plus d’une identification précise jusqu’à l’individu.

La liste d’exclusion existe bel et bien : les mots de passe, les codes de vérification à usage unique, les numéros de carte, les numéros de sécurité sociale, les dates de naissance, les antécédents et diagnostics médicaux, ainsi que les champs juridiques y figurent. L’existence de cette liste montre que les concepteurs ont réfléchi aux limites ; mais ce qui est capturé en dehors de la liste, ce que le chemin de la page divulgue, la liste ne peut pas le contrôler.

Quelles entreprises l’utilisent ? La divulgation liste 12 sites commerciaux et 13 ID de pixels, avec des noms bien connus : Chewy, Wayfair, ThriftBooks, Eventbrite, HelloFresh, Coursera, SeatGeek.

L’identifiant anonyme est aussi stable que l’identifiant de connexion : un par appareil, persistant pendant au moins 27 jours ; parmi les 932 jetons de synchronisation décodés, 736 contiennent un identifiant de compte. Le chercheur estime qu’environ un cinquième des sessions ChatGPT généreront un jeton de synchronisation. La version web mobile peut afficher des publicités même sans charger de cookie.

Le mécanisme est ancien, la position est nouvelle

L’auteur de la divulgation fait preuve de retenue dans son propre jugement : Meta a construit un système structurellement équivalent il y a quelques années, il s’agit d’une technologie publicitaire standard ; ce qui est sans précédent, c’est de l’exécuter sur un produit de chat IA.

La différence de cette « position » mérite d’être expliquée en détail. Sur les réseaux sociaux, les utilisateurs s’attendent de toute façon à être regardés : chaque contenu publié, chaque like, alimente leur profil, leur compte psychologique est public. Ce que vous ne diriez pas dans votre cercle d’amis, vous ne le publieriez pas non plus dans ce cercle — cette limite est tracée pour vous par la forme du produit. Les chatbots détruisent cette limite. Les gens saisissent dans la boîte de dialogue des choses qu’ils ne publieraient sur aucune plateforme sociale — maladies, dettes, procès, divorces, ou même juste une phrase qu’ils n’oseraient dire à personne. La compréhension par défaut des utilisateurs de ce produit est : c’est un espace privé, en face se trouve un outil qui ne se souviendra pas de vous et qui, encore moins, ne vous monétisera pas.

Ce que fait ce collecteur, c’est connecter les comportements de l’espace privé au matching d’identité du système publicitaire public. Ce que vous avez dit dans la boîte de dialogue, les serveurs publicitaires ne l’obtiennent pas nécessairement directement ; mais vos comportements ailleurs — sur des sites médicaux, des pages de conseil en dette, des pages de documents juridiques — sont liés par le même identifiant de compte. Les mêmes entreprises obtiennent les produits que vous avez recherchés sur d’autres sites, les articles que vous avez lus, et si vous avez passé commande. Les deux jeux de données ne sont pas nécessairement fusionnés en clair, mais l’identifiant est le même, et le système publicitaire peut l’utiliser sans fusion. C’est là que réside la force destructrice de la « position » : l’utilisateur pense évoluer dans deux espaces sans rapport, le système voit une seule et même personne.

La version officielle ne colle pas

Le deuxième point d’impact se trouve sur la page de politique d’OpenAI elle-même.

Dans la politique de cookies d’OpenAI, __obi est listé en noir sur blanc dans la section Analytics : le domaine est OpenAI, la durée de validité est d’un an, et c’est la seule entrée de cette section. Dans toute la catégorie « analyse », il est le seul, un élément isolé, occupant le nom d’analytics.

Sur la même page, analytics et marketing sont deux options de consentement indépendantes — l’utilisateur peut cocher uniquement analytics dans les paramètres et refuser marketing. C’est la structure de promesse donnée par la page de politique elle-même : les deux types d’utilisation sont séparés, le droit de choix de l’utilisateur existe réellement.

Comparons avec le comportement réel : cet identifiant classé comme « analyse », est lié à l’identifiant de compte, transporté entre les sites, et alimente le système publicitaire, couvrant chaque annonceur de crédit observé. Les utilisateurs qui refusent uniquement marketing ne devraient pas, selon la politique, recevoir de suivi de type publicitaire, mais __obi est implanté quand même. La classification est analytics, l’utilisation est publicitaire, entre les deux se glisse un jeu de définition — chaque mot du texte de politique est techniquement vrai, mais l’effet combiné se détache de l’usage promis par la politique.

Les chercheurs ont envoyé le mécanisme et les deux questions à OpenAI : __obi est-il classé comme un cookie analytics ? Les utilisateurs qui consentent uniquement à analytics et refusent marketing le reçoivent-ils toujours ? L’équipe de support a confirmé la réception, indiquant qu’elle transmettrait en interne, mais aucune des deux questions n’a reçu de réponse. Au moment de la publication, OpenAI n’avait pas répondu officiellement ; l’auteur a indiqué que l’article serait mis à jour en cas de réponse.

Il faut garder la juste mesure : ce mécanisme ne peut actuellement être considéré que comme « divulgué et reproduit par des chercheurs », OpenAI n’a pas répondu officiellement, et la qualification réglementaire est une affaire à suivre. Mais le fait que « la classification officielle ne corresponde pas au comportement réel » peut être établi sans attendre de réponse — la page de politique est une source primaire publique.

Que dit la section des commentaires

Dans le fil de discussion de HN, quelques jugements sont représentatifs. Quelqu’un a dit qu’il payait encore OpenAI, mais qu’il faisait partie de cette affaire, alors que les utilisateurs de Google et Facebook ne payaient pas au moins — pour les produits gratuits, prendre des données est une vieille règle, mais pour un produit payant, c’est différent. Quelqu’un d’autre a dit que cette pratique s’apparente dans son livre à un logiciel malveillant, le problème est que les gens ne s’énervent pas tant qu’ils ne le voient pas : le SDK est caché dans la page, le cookie repose dans les profondeurs du navigateur, sans pop-up, sans notification, une personne ordinaire ne peut absolument pas s’en rendre compte. Chaque fois que quelqu’un excuse cela en disant que Meta fait pareil, quelqu’un rétorque immédiatement : le fait que d’autres le fassent ne rend aucun cas excusable — étaler le champ pour comparer qui est le pire n’est pas une défense. Quelqu’un d’autre encore a fait remarquer qu’OpenAI a embauché de nombreux anciens employés de Meta et Google à cette fin, il n’est donc pas surprenant qu’ils produisent un produit de même origine. D’aucuns ont comparé cela à la tragédie des biens communs — chaque fois que quelqu’un dit « faire cette fonctionnalité nécessite de créer d’abord un logiciel espion », la réponse est « c’est déjà comme ça de toute façon », et ainsi la ligne rouge est abaissée encore et encore par défaut.

Les utilisateurs ordinaires peuvent faire trois choses

Premièrement, choisir le bon navigateur rend immunisé à plus de la moitié. Firefox bloque les cookies tiers par défaut, cette synchronisation ne peut pas vous atteindre ; sur iOS, tous les navigateurs utilisent le moteur WebKit, ils ne sont donc pas affectés non plus. L’immunité de ces deux plateformes n’est pas une coïncidence, c’est la stratégie par défaut au niveau du moteur qui vous protège. Il n’y a pas de données de test pour Chrome sur ordinateur, ne le supposez pas sûr par défaut ; si vous utilisez principalement Chrome, installez une extension bloquant les cookies tiers, l’effet sera similaire.

Deuxièmement, ne cocher que les éléments nécessaires dans le consentement des cookies. Lorsque vous rencontrez une fenêtre pop-up de consentement, refusez marketing, et si vous pouvez désactiver analytics, désactivez analytics. Même si selon la classification officielle __obi est considéré comme analytics, décocher un élément alimente d’autant moins le système. Profitez-en pour vérifier les paramètres déjà consentis : de nombreux utilisateurs cochent tout d’un bloc lors de la première connexion, et n’y retournent plus jamais, la page des permissions recèle souvent une rangée d’interrupteurs dont ils n’ont pas conscience.

Troisièmement, ne vous confiez pas dans la boîte de dialogue de l’IA. Mots de passe de compte, codes de vérification, numéros de carte d’identité, détails des dossiers médicaux, ne les saisissez pas en pensant « ça ne fait rien de le dire à l’IA ». Vous ne savez pas quel collecteur est accroché en face, ni quelle version du SDK est en cours d’exécution ; plus réaliste encore, la vitesse à laquelle les produits IA changent de modèle économique est bien supérieure à la vitesse à laquelle les utilisateurs mettent à jour leur perception. Aujourd’hui, il promet de ne pas utiliser les conversations pour la publicité, demain, la page de politique change d’une ligne, et ce que vous avez confié se trouve déjà sur les serveurs de quelqu’un d’autre.

Conclusion

La conclusion de l’audit comportemental est que le mécanisme n’est pas nouveau, identique à celui de Meta ; l’emplacement est nouveau, les chatbots sont devenus les nouveaux confidents, mais le réseau publicitaire s’est accroché à ces confidents ; la version officielle classe __obi dans la catégorie analytics, n’a pas répondu de front aux deux questions des chercheurs, et la classification ne correspond pas à l’usage réel.

Pour terminer, ajoutons une dernière remarque sur la nuance de cette affaire. La divulgation vient actuellement d’une seule personne, et la reproduction n’a été réalisée que sur un seul téléphone ; cela ne constitue pas une preuve matérielle condamnant la surveillance, et toutes les formulations de cet article s’en tiennent à « selon la divulgation, reproduit par les chercheurs, sans réponse officielle ». Mais même en prenant cela avec des pincettes, deux faits sont irréfutables : le Pixel SDK existe bel et bien, et la classification sur la page de politique est écrite noir sur blanc. Il y a deux points à surveiller par la suite : si OpenAI répond directement aux deux questions spécifiques — l’auteur s’engage à mettre à jour l’article s’il y a une réponse ; ainsi que la position des régulateurs — si les autorités de contrôle de la vie privée de l’UE et au niveau des États américains ouvriront une enquête, surtout en Europe, où le conflit entre ce type de mécanisme de consentement et le RGPD est presque un cas d’école. Les technologies publicitaires ne manquent pas de précédents, ce qui manque, c’est de demander l’accord de l’utilisateur avant de traiter les produits de chat IA comme de simples points d’entrée de trafic. Ce point d’interrogation ne se pose pas seulement pour OpenAI, mais aussi pour chaque entreprise en train de connecter ses produits IA à un système publicitaire.

Sources de référence

  • buchodi.com (2026-09-20) : « ChatGPT now knows what you do on other websites via ad collector » —— mécanismes, données et liste des sociétés identifiées (les détails reposent sur les dires du divulgateur)
  • Fil de discussion Hacker News (id 49776729, 2026-09-20) : 555 votes pour / 303 commentaires, réactions des utilisateurs
  • OpenAI Cookie Policy (openai.com/policies/cookie-policy/) : __obi classé dans Analytics, validité d’un an, options de consentement séparées pour analytics et marketing
广告 · Advertisement

Questions fréquentes

Pourquoi le cookie __obi est-il dangereux ? Quelles sont ses trois caractéristiques techniques ?

Trois caractéristiques déterminent sa capacité à transporter l'identité intersites sur le long terme : premièrement, HttpOnly, les scripts de page ne peuvent pas le lire, mais le navigateur l'attachera automatiquement à toute requête ; deuxièmement, SameSite est défini sur none, les requêtes intersites sont toujours envoyées ; troisièmement, la validité est d'un an, ce n'est pas un marqueur de session jetable. La combinaison de ces trois caractéristiques en fait un point d'ancrage d'identité à long terme sous le domaine de premier niveau openai.com. Dans les données observées, 736 des 932 jetons de synchronisation décodés contenaient des identifiants de compte, et le chercheur estime qu'environ un cinquième des sessions ChatGPT généreront un jeton de synchronisation.

Qu'est-ce que la « correspondance automatique », et pourquoi est-elle entièrement activée chez les annonceurs de crédit ?

La correspondance automatique consiste à faire correspondre la liste de clients existante de l'annonceur avec les identifiants de visiteurs collectés par le pixel : l'annonceur n'a pas besoin de savoir qui vous êtes, tant que la liste correspond, le système publicitaire sait quelle publicité diffuser à qui. Parmi les 881 pixels dont les paramètres ont pu être confirmés, 638 sont activés, et cela couvre chaque annonceur de type crédit observé. Cette distribution est en soi révélatrice : la conversion des entreprises de crédit et de prêt dépend justement le plus de l'identification précise au niveau individuel. Dans les informations d'identité signalées par le SDK, la « capture d'identité » représente 685 occurrences contre 255 pour les « fournitures actives par l'annonceur » — plus de 60 % sont capturées par le SDK lui-même depuis la page, y compris depuis la couche de données de Google Tag Manager.

Quelles sont les trois choses que l'utilisateur ordinaire peut faire maintenant ?

Premièrement, changer de navigateur : Firefox bloque les cookies tiers par défaut, et sur iOS tous les navigateurs utilisent le moteur WebKit et sont donc tout aussi immunisés, ces deux-là vous protègent via la stratégie par défaut au niveau du moteur ; pour Chrome sur bureau, il n'y a pas de données de test, mais installer une extension bloquant les cookies tiers a un effet similaire. Deuxièmement, dans la fenêtre de consentement des cookies, cocher uniquement les éléments nécessaires : refuser le marketing, désactiver l'analytics si possible, et vérifier en retour les paramètres déjà acceptés. Troisièmement, ne pas divulguer d'informations confidentielles dans la boîte de dialogue de l'IA : ne pas saisir de mots de passe de compte, de codes de vérification, de numéros de carte d'identité, de détails de dossier médical — vous ne savez pas quel collecteur est actif de l'autre côté, et la vitesse à laquelle les produits d'IA changent de modèle commercial est bien plus rapide que celle à laquelle les utilisateurs mettent à jour leur perception.