网络分析中的数据采样及其如何扭曲您的报告
您打开分析工具,运行一个跨越六个月的日期范围的自定义报告,看到顶部出现一条横幅:"此报告基于您会话的10.4%。" 您的报告突然成了有根据的猜测。数据采样是网络分析中讨论最少但后果最严重的问题之一——这正是大规模分析平台中的详细报告往往无法轻信的原因,也是许多网站所有者转向替代方案的主要原因。
数据采样的真实含义
当分析平台接收到太多数据点而无法快速处理查询时,它会通过分析会话的代表性子集(样本)来获取快捷方式,然后推断完整数据集。如果您的网站在过去六个月中有200万个会话,而平台的查询引擎在达到处理限制之前可以处理500,000个会话,它将对大约25%的会话进行采样,然后将结果乘以四来得出估计总数。
在总页面浏览量或总会话等汇总指标中,这种推断通常足够准确。真正的问题发生在您对采样数据进行分段或筛选时。如果您应用分段来查找仅来自德国、使用iPhone并访问定价页面的访客,您最终可能在样本中只得到40个会话。从40个会话推断到数万个会话会产生可能大错特错的数字——而且平台仍然会以与任何其他数字相同的视觉信心呈现它们。
采样何时启动?
采样由查询复杂性和数据量触发,而不仅仅是由网站规模触发。具体阈值因平台而异,但常见的触发因素包括:
- 长日期范围。在单个报告中查询超过90天的数据是常见的采样触发因素。您的网站生成的会话越多,阈值就越低。
- 包含多个维度的自定义报告。在单个报告中添加两个或三个维度(例如国家+设备+登陆页面)会大大增加处理负载。
- 应用的分段。筛选到少量会话子集然后进行进一步分析的分段特别容易出现高采样率。
- 高流量网站。月流量为1000万的网站将在采样阈值上碰壁,而月流量为10万的网站可以毫无问题地运行相同查询。
采样数据的真实世界影响
采样不会随机引入小错误。它引入了系统性错误,这取决于哪些会话被碰巧选中。这在特定场景中最重要:
转化分析
转化事件通常很罕见——也许占会话的2-3%。如果您的样本系统地过度或不足代表转化会话(因为它们具有特定特征,如更长的会话持续时间或来自特定来源的推荐),您的采样转化率可能会有很大偏差。基于采样转化数据做出预算决策确实存在风险。
分段受众报告
生成少于几千个会话样本的分段会使所有结果指标都不可靠。如果您试图了解来自特定城市或宣传活动的访客的行为,而该分段在15%样本中有800个会话,那么您的实际数据池仅~120个会话——不足以进行有意义的分析。
趋势比较
比较两个采样的日期范围可能会引入虚拟趋势。如果10月的采样率为18%,11月的采样率为32%,用户行为的明显变化可能部分反映不同的样本构成而非实际访客行为的变化。
如何最小化采样
如果您被困在采样的平台中,有实际的方法可以减少它:
- 缩短您的日期范围。运行单独的30天报告并手动比较它们,而不是一次查询六个月。
- 避免堆叠多个分段。一次应用一个筛选器,使用结果通知单独的报告,而不是将所有内容合并到单个查询中。
- 使用预先聚合的标准报告。大多数平台在应用采样之前处理和缓存标准报告使用所有数据。自定义报告和临时查询是采样最积极发生的地方。
- 导出原始数据并在本地分析。一些平台允许通过API进行原始数据导出,这绕过了影响UI报告的查询时间采样。
更深层的解决方案:使用不采样的工具
一些分析平台在架构上设计用来避免采样,通过存储预先聚合的数据或使用可以有效处理完整数据集查询的列式存储。为中小规模网站构建的隐私友好型分析工具通常查询每个报告的完整数据集,因为它们不在采样成为计算必要性的规模运行。当您在statpx中运行报告时,您看到的数字来自数据库中的每个会话——没有采样、没有估计、没有横幅告诉您数据基于您会话的12%。
底线
数据采样是大规模分析平台为保持查询速度快而做出的性能权衡。对于高级趋势监控,它通常是可以接受的。对于任何涉及分段、转化追踪或具有真实财务后果的决策的分析,采样数据引入的不确定性容易忽视但难以解释。了解您的平台何时在采样——以及采样多少——是知道哪些报告可以信任的第一步。
如果数据准确性与隐私同等重要,请查看我们关于免费Google Analytics替代方案的总结中statpx的表现。