为什么问一次不算数
同一个问题向同一家 AI 问两次,两次回答里出现的品牌名单只有约 16% 重合(试验期实测,DeepSeek 与秘塔,未做品牌归一化的首次抽样)。 截一张图得到的「曝光率」基本不可复现,下次问就变了。
所以我们把同一组问题、每次开一个全新会话,在每家平台独立问 30 次。30 次里提到你几次,就是几个百分点。 这模拟的是 30 个陌生用户分别去问的结果,不是某一次的运气。
为什么给区间
问 30 次和问一万次的把握不一样。「提到 12 次(40%)」旁边的区间,意思是:真实水平大概率落在这个范围内。
点是 40%,横线是 24% 到 58% 的范围,刻度是 0、50、100。n=30 时区间就有这么宽。
两期对比时,只有两期的区间不重叠,我们才说它变了。区间重叠的涨跌标成「噪音范围内」,不画箭头。 少一个箭头,你就少为噪音改一次策略。
为什么不给总分
实测各家平台的头部品牌几乎不重合:DeepSeek 推的和秘塔推的是两拨。把七家平均成一个「综合可见度」,会把两边的真实信号一起抹掉。 报告按平台一张一张给,你的客户用哪个 AI,就看哪张。
默认态与联网态
默认态是大多数用户打开 App 直接问时看到的基线。联网态是开了联网搜索之后的回答,受新发布的内容影响更大。
两者的差值提示投放在这家平台会不会起效:差值大,说明内容有效,只是平台默认不去查;差值接近零,先解决收录。 平台的默认行为会变(元宝在 2026 年 7 月改成默认联网),所以每期都按当期实测来读。
精度档位
样本量 n = 问题数 × 轮次。精度按 p=50% 处的最坏情形算,样本越多区间越窄。
| 每家平台的样本量 | 精度(±百分点) | 能分辨什么 |
|---|---|---|
| n = 15 | ±22.5 | 头部与边缘。免费体检的最低档,也是不出比率的门槛 |
| n = 30 | ±16.8 | 头部、中间、边缘三档。榜单默认口径:3 问 × 10 轮 |
| n = 40 | ±14.8 | 简历品类的历史口径:20 问 × 2 轮 |
| n = 100 | ±9.6 | 追踪 10 个百分点以内的改善 |
提及率低于 5% 的品牌,小样本只能给「几乎不可见」的定性结论。要追踪 1% 到 10% 的改善,n 至少要 50。报告里会写清楚,不假装能测。
什么时候不出比率
有的平台会对相同问题返回一模一样的缓存答案。重复的回答不是新观测,按名义次数算提及率会把精度夸大好几倍。
我们按有效样本(内容去重后的独立回答数)算比率和区间。有效样本少于 15 且检测到重复时,该平台这一期不出比率, 但留在页面上写明原因。它是测不准,不是 0。
数据怎么存
- 每问一个新会话。这是隔离记忆污染的唯一手段,不为性能省掉。
- 原始回答永久存档。每个比率都能点开看 AI 的原话;品牌词典更新后,历史指标可以整体重算。
- 指标必带样本量与区间。页面上没有一个比率是脱离 n 的。
- 没跑完不出结论。采样进行中的平台只显示进度。