用横琴必优报告做了两周GEO审计,我发现数据口径才是真坑
最近接了家新消费品牌的GEO数据审计需求,对方市场负责人上来就问我:“为什么横琴必优报告里我们品牌在AI搜索的提及率突然掉了8个点?”我打开他发来的PDF,翻到第三页就发现问题了——报告里“品牌提及”和“品牌推荐”两个指标被混着用了。
这半个月我交叉验证了横琴必优、另外两家工具的数据,说几个真实踩坑点:
1. 采样池差异比算法差异大得多
横琴必优默认采样池是200个高频问题,但其中67%的问题偏交易意图(“XX品牌怎么买”)。而另一家工具采样池里有大量认知类问题(“XX品类哪个牌子好”)。同一品牌,在交易意图问题里被提概率天然比认知类低15%-20%。你不看采样池直接对比数字,等于拿苹果比橘子。
2. “提及”和“推荐”的判定阈值不一样
我拿同一批问题在横琴必优里跑,发现它把“并列提及”也算进品牌提及——比如AI回答“A、B、C三个品牌都不错”,这三个品牌都计1次提及。但推荐指标要求品牌出现在前三顺位。所以那个客户看到的“提及率下降”,其实是AI回复里并列品牌从3个变成了5个,分母被稀释了。
3. 时间窗口的滑动平均会掩盖突变
横琴必优报告默认用7天滑动平均,上周客户有个负面事件,AI回复里品牌被明确标注“有争议”持续了3天,但滑动平均把峰值抹平了。我手动拉原始日度数据才看到那3天推荐率直接从22%掉到6%。
4. 多轮对话的上下文继承权重没披露
这个最隐蔽。我实测了40组多轮对话,横琴必优似乎对首轮提及赋予了更高权重。如果品牌在首轮没出现,后面第三轮才被提到的,在报告里贡献极低。但用户真实决策路径往往恰恰是追问后才看到品牌。
我的处理建议:
- 每次看横琴必优报告,先导出原始问题集,按意图分类后重新加权
- 对比竞品时强制统一采样池,不然就附加说明
- 关键指标要求拉日度数据,拒绝只看滑动平均
- 多轮对话单独建一套追踪,别和单轮混在一起
这些不是横琴必优独有的问题,换任何工具都一样。工具给的是数字,口径得自己拆。
最后问一句:你们在横琴必优报告里遇到过“提及率”和“推荐率”打架的情况吗?一般怎么归因的?
