BLOG
聊天机器人挂上了广告网:ChatGPT 正在把你的跨站行为接进广告画像
热点跟踪:热点发布 × 技术判断 × 实用建议。 作者:永亮
先把时间钉住。9 月 20 日,独立研究者在个人博客 buchodi.com 发了一篇披露:ChatGPT 正在通过一套广告收集器(ad collector),把用户在第三方网站上的行为同 ChatGPT 账号直接挂钩。文章当天被送上 Hacker News 首页,555 个支持票、303 条评论,讨论盖了几百层。这期写在首发后的 48 小时窗口内。机制本身在广告技术里并不新鲜,新鲜的是它跑在了哪里——一个人们习惯用来倾诉的产品上。以下事实以披露方自述为准,官方政策页部分已独立核实。
发生了什么
按口径摆事实,全部来自披露原文与 OpenAI 官方政策页。
研究者称自己已在手机上复现整套流程,并用两种抓包方法交叉验证,数月的流量观察覆盖了 936 个广告主像素、1029 个域名。流程拆开是这样:
第一步,ChatGPT 客户端生成 16 个随机字节,向服务端换取一枚 RS256 签名的 JWT,60 秒过期,里面带着同意策略版本号(user_granular_consent_v1)和账号标识。第二步,服务端种下名为 __obi 的 cookie:挂在 openai.com 一级域名下、HttpOnly、SameSite 设为 none、Secure、有效期一整年。懂行的人看到这三个特征就明白了:HttpOnly 意味着脚本读不走它但浏览器会自动带,SameSite=none 意味着跨站请求照发不误,一年有效期意味着它成了长期身份锚点,不是用完即弃的会话标记。三个特征加在一起,决定了它能被跨站携带。
广告主这边,网站只要装上 OpenAI 的像素 SDK——和 Meta、Google 的追踪代码同一类东西——用户一打开页面,浏览器就自动把 cookie 附带发向 OpenAI。这一步不需要广告主写什么代码,浏览器在 SDK 跑起来之前就已经把凭据带上了,披露方原话的意思是:就算代码路径里不主动传,也拦不住浏览器自动附带。
SDK 上报的不只是广告事件:观察流量里,「抓取身份」出现 685 次,「广告主主动提供」只有 255 次——也就是说,六成以上的身份信息是 SDK 自己从页面上抓的,不是广告主填的。抓取来源包括 Google 跟踪代码管理器的数据层,SDK 会先把变量名换掉,再解析这层重命名后的数据。8 月 27 日发布的 v0.1.31 收窄了范围,之前的版本还会取姓名和地理位置。现在的做法是:邮箱、电话做 SHA-256 哈希后传输,国家、地区、城市、邮编明文发送,邮编是被收割最多的表单字段——28 个站、100次事件。
URL 层面只发来源和路径、不发查询串,观察的 23,929 次里没有一次带查询参数。但路径本身就是信息:观察到的路径里出现过一种医疗病情、一个债务解决漏斗、一个诉讼受理表单。
「自动匹配」功能在能确认设置的 881 个像素里有 638 个开启,覆盖观察到的每一个信贷类广告主,开关由 OpenAI Ads Manager 控制。所谓自动匹配,就是把广告主手里已有的客户名单和像素收集到的访客标识做对接:广告主不需要知道你是谁,只要名单对得上,广告系统就知道该给谁投什么。这个功能在信贷、借贷类广告主里全开,本身就很说明问题——这类生意的转化,恰恰最依赖精准到个人的身份识别。
排除清单确实存在:密码、一次性验证码、卡号、社保号、出生日期、病史与诊断、法院字段都在名单上。名单的存在说明设计者对边界有过思考;但名单之外抓了什么、页面路径泄了什么,名单管不到。
哪些公司在用?披露列出 12 个商业网站、13 个像素 ID,名字都认得:Chewy、Wayfair、ThriftBooks、Eventbrite、HelloFresh、Coursera、SeatGeek。
匿名标识和登录标识一样稳:每设备一个,至少持续 27 天;932 个被解码的同步令牌里,736 个带着账号标识。研究者估计,大约五分之一的 ChatGPT 会话会产生同步令牌。移动端网页版不挂载 cookie 也能出广告。
机制是老的,位置是新的
披露作者自己的判断很克制:Meta 几年前就搭过结构等价的系统,这是标准广告技术,没有先例的是把它跑在 AI 聊天产品上。
这个「位置」差在哪,值得说透。社交网络上,用户本来就默认自己被看:发的每条内容、点的每个赞,都在给画像添料,心理账户是公开的。你在朋友圈不会说的事,本来也不会发朋友圈——这个边界是产品形态替你画好的。聊天机器人把这个边界拆了。人们会往对话框里输入不愿发到任何社交平台的东西——病情、债务、官司、婚变,甚至只是一句不敢对任何人说的话。人们对这个产品的默认理解是:这是个私密空间,对面是个不会记住你、更不会拿你变现的工具。
而这套收集器做的事,是把私密空间里的行为接进公开广告系统的身份匹配。你在对话框里说过什么,广告端未必直接拿到;但你在别的地方——医疗网站、债务咨询页、法律文书页——的行为,被同一枚账号标识串了起来。同一批公司拿到了你在别的网站搜过什么商品、读了什么文章、有没有下单。两份数据未必明文合并,但标识符是同一个,广告系统不需要合并就能用。这才是「位置」的杀伤力:用户以为自己在两个互不相干的空间里活动,系统看到的是同一个人。
官方口径对不上
第二个落点在 OpenAI 自己的政策页上。
OpenAI Cookie Policy 里,__obi 白纸黑字列在 Analytics 章节:域名为 OpenAI、有效期一年,而且是该章节唯一一条。整个「分析」类别下只有它一个,孤零零一条,占着 analytics 的名字。
同一页上,analytics 与 marketing 是两个独立的同意选项——用户可以在设置里只勾 analytics、拒掉 marketing。这是政策页自己给出的承诺结构:两类用途分开,用户的选择权真实存在。
对照实际行为:这个被归类为「分析」的标识符,绑着账号标识、跨站携带、喂给广告系统,覆盖每一个被观察到的信贷广告主。只拒绝 marketing 的用户按政策理解不该收到广告类追踪,但 __obi 照样种下。归类是 analytics,用途是广告,中间隔着一层定义游戏——政策文字上每个词都成立,拼起来的效果却和政策承诺的用途分家。
研究者把机制和两个问题一起发给了 OpenAI:__obi 是否被归类为 analytics cookie?只同意 analytics 拒绝 marketing 的用户,是否仍收到它?支持团队确认收到、称会内部转达,两个问题都没有回答。截至发稿,OpenAI 未正面回应,作者表示若回应会更新文章。
分寸要拿稳:这套机制目前只能算「据披露、经研究者复现」,OpenAI 未正面回应,监管怎么定性是后面的事。但「官方归类与实际行为对不上」这件事,不需要等回应就能成立——政策页是公开的一手材料。
评论区怎么说
HN 的讨论楼里,几个判断有代表性。有人说,自己还在付费给 OpenAI,却成了这门生意的一部分,Google 和 Facebook 的用户至少没花钱——免费产品拿数据算老规矩,付费产品还拿,味道就变了。有人说,这种实践在他书里接近恶意软件,问题只在人们看不见就愤怒不起来:SDK 藏在页面里,cookie 躺在浏览器深处,没有弹窗、没有通知,普通人根本无从察觉。每当有人拿 Meta 也这么干来开脱,立刻有人回:别人也干,不能让任何一例变得可原谅——把范围摊开比烂,不是辩护。还有人说,OpenAI 为这个目的雇了大量前 Meta 和 Google 员工,做出同源的产品毫不意外。也有人把这比作公地悲剧——每次有人说「做这功能得先造间谍软件」,得到的回应都是「反正已经这样了」,于是底线一次次被默认。
普通用户能做三件事
第一,换对浏览器就免疫大半。 Firefox 默认拦第三方 cookie,这套同步打不上你;iOS 上所有浏览器都是 WebKit 内核,同样不受影响。这两个平台的免疫不是碰巧,是引擎层的默认策略替你挡了。桌面 Chrome 没有测试数据,别默认它安全;如果你主要用 Chrome,装一个拦第三方 cookie 的扩展,效果接近。
第二,Cookie 同意只勾必要项。 遇到同意弹窗,拒绝 marketing,能关 analytics 就关 analytics。即便按官方归类 __obi 算 analytics,少勾一项就少喂一条。顺手检查一下已同意的设置:很多用户第一次登录时一路全勾,之后再也没回去看过,权限页面里往往躺着一排自己没意识到的开关。
第三,在 AI 对话框里别交底。 账号密码、验证码、身份证号、病历细节,不要当成「跟 AI 说说没关系」的内容输入。你不知道对面挂着什么收集器,也不知道哪个版本的 SDK 在跑;更现实的是,AI 产品换商业模式的速度,比用户更新认知的速度快得多。今天它承诺不拿对话做广告,明天政策页改一行字,你交出去的东西已经在别人的服务器上。
结语
言行审计的结论,机制不新鲜,Meta 同款;位置新鲜,聊天机器人成了新的树洞,广告网却顺着树洞挂了上来;官方把 __obi 归为 analytics,对研究者两问未正面回应,归类与实际用途对不上。
这件事的分寸,最后再说一层。披露方目前只有一个人,复现也只在一台手机上完成;这不算实锤监控定罪,本期的全部表述都停在「据披露、经研究者复现、官方未回应」。但即使打折听,两个事实是硬的:像素 SDK 真实存在,政策页的归类白纸黑字。接下来值得盯的节点有两个:OpenAI 是否正面回应两个具体问题——作者承诺有回应就更文;以及监管口径——欧盟与美国州一级的隐私执法机构会不会立案,尤其是在欧洲,这类同意机制与 GDPR 的冲突几乎是教科书级的。广告技术不缺先例,缺的是把 AI 聊天产品当成普通流量入口之前,先问过用户同不同意。这个问号不只在 OpenAI 头上,也在每一个正在把 AI 产品接入广告系统的公司头上。
参考来源
- buchodi.com(2026-09-20):《ChatGPT now knows what you do on other websites via ad collector》——机制、数据与具名公司清单(细节以披露方自述为准)
- Hacker News 讨论串(id 49776729,2026-09-20):555 支持 / 303 评论,用户反应
- OpenAI Cookie Policy(openai.com/policies/cookie-policy/):
__obi归类 Analytics、有效期一年、analytics 与 marketing 分设同意选项