同一道题问 3 次,名单变了多少
我们的每道题在每家平台都问 3 次,隔几天问一次、每次开新会话。下表数的是:一道题里被提到过的品牌,3 次里出现了几次。
| 平台 | 被提到过的(题 × 品牌) | 3 次都在 | 出现 2 次 | 只出现 1 次 |
|---|---|---|---|---|
| 豆包 | 442 | 114 | 142 | 186 |
| 元宝 | 668 | 253 | 105 | 310 |
| DeepSeek | 566 | 183 | 108 | 275 |
| 文心一言 | 411 | 135 | 85 | 191 |
| 千问 | 579 | 249 | 121 | 209 |
每一行都是:只出现 1 次的不在少数。换句话说,如果你只问了一次、恰好看到了它,下一次很可能就没有了;恰好没看到,也不代表 AI 从不推荐它。
例:在跨境电商ERP里,把「亚马逊卖家用什么ERP管理店铺比较好?」问豆包 3 次:
- 易仓:3 次
- 积加:3 次
- 领星:3 次
- 店小秘:3 次
- 芒果店长:3 次
- 赛狐:2 次
- 优麦云:2 次
- 赛盒:1 次
- 船长BI:1 次
- 胜途 ERP:1 次
(一共提到 11 个品牌,这里列出现次数最多的 10 个。)
所以要问很多次,并且给区间
一次提问只是一次抽样。我们把一组问题在每家平台问数十次,数一数提到了几次,再给出 95% 区间: 问 30 次时,区间大约是上下 17 个百分点。两个品牌的区间不重叠,才算真的有差别;两期之间的变化超出区间,才叫变化。
这也是为什么我们的报告里没有「总分」,也不把各家平台合成一个数——各家的名单本来就不一样,合在一起会把真实差异抹平。完整的方法在我们怎么测。