持续交付2.0

怎么把一个AB实验做成“结果有效”?反复做么?

Image

“ 反复实验,直到它可信? 你错了,同一个AB实验,不能重复多次”

经典 AB 实验的要求非常苛刻,即使互联网平台说自己有大量数据,但也很难做好 AB实验。

今天就来说说 AB 实验的那些事。

很多互联网公司要求产品经理用数据说话,而有的产品经理为了能有一个正向数字向上汇报,会将一个AB实验,重复进行多次。

甚至有人会问:“我如何才能将一个AB实验,做成正向数据?”

这种做法,对么?这种问法,对么?

同一个AB实验,不要重复多次

1

概率问题与
抛非均匀硬币

假设有一枚非均匀的硬币,

当每次抛硬币时,

有5%的可能性出现正面向上,95%的可能性出现反面向上。

那么,

1、重复抛硬币时,可能出现结果不一致的现象(有正有反)。

2、当抛硬币的次数足够多时,必然会观测到正面向上的结果。

2

概率问题与
AB实验的关系

当我们把抛硬币的场景类比到AB实验的时候,假设当前实验策略是没有效果的,但是由于实验平台本身会有5%的假阳性(没有效果但观测到显著的结论),因此该实验将有5%的几率得到显著的结论。

在这时候,如果将相同的实验重复做多次时,其出现假阳性的概率将会叠加,那么这时候实验结果指标会有较大几率同时出现有的是显著的,有的是不显著的。这样就会给实验评估带来了很大的难度。

如何解读重复实验的结果

有人在碰到这种情况的时候,第一反应是“为什么同样的实验策略会出现不一致的A/B结果?到底应该以哪一个结果为准?”要不直接挑显著的指标来看吧?

其实,这是不建议的。

3

几个常见的
错误做法

No.1:忽略不显著的结果,关注显著指标

有人在碰到上述问题时会选择性忽略不显著的结果而认为实验策略是有效的,由于假阳性膨胀(多次抛硬币有更大的概率出现正面),带来的问题是:

一直在发布实验,但整体数据不涨。

No.2:保守派,多次实验指标一直显著

有的同学可能偏保守,在多次实验的基础上需要同时出现显著正向的结论才认为实验策略是有效果的。

这种方式虽然能够控制假阳性率,但是容易导致真正有效果的实验策略没法被检测出来,错过增长机会。

No.3:FDR修正,控制误判率

针对多次检验,可以使用FDR ( False discovery rate ) 修正方法对检验结果进行修正,根据修正的结果进行实验评估。

该方法虽然能够控制整体的误判率,但是对实验的统计功效(有效果的实验策略被正确识别出来的概率)是有损的,因此这种方式虽然能够准确评估实验结果,但会导致一些有效果的实验策略没被识别出来,错过增长机会。

这种方式是可以的,但并不是最佳方法。

4

AB实验的
建议做法与步骤

同一个实验策略只做一次AB实验,可以按照如下步骤科学实验。

1. 实验设计:

这一步骤至关重要,也是建立正确假说的基石。

在实验创建之前需要对实验进行设计,如实验的改动点是什么,预计影响哪个场景的什么指标,影响有多大,对实验的结果有个预期,然后通过实验进行数据验证。

2. 实验指标:

按需选择实验的指标进行关联,

一般包括北极星指标+护栏指标+期望提升指标+监控指标。

北极星指标是整个业务的核心指标,所有实验都需要关联这些指标进行数据监控;

护栏指标一般是crash率、请求耗时等影响用户体验的指标;

期望提升指标是实验的目标,是衡量整个实验结果是否有效的关键指标;

监控指标是除以上指标之外的一些可能会受影响的相关指标。

3、 实验流量:

在实验之前需要合理选择实验的流量,根据实验周期和实验期望提升指标预计提升的幅度进行样本量预估。注意:

  • 样本量太小,会导致实验的样本量收集较慢,影响实验结果准确性;

  • 样本量太大,会导致实验的风险变大,例如,实验策略的实现上有bug,可能会导致更多的用户体验受到影响。

4、实验分析:

收集到足够的样本量后(指标的最小检测变化低于预期提升幅度时),就可以对实验结果进行分析了。

分析时间范围必须是从实验策略生效起始日期到当前日期,观测期望提升指标是否有变好,并且北极星跟护栏指标是否没有明显下降。

5、实验决策:

实验完成后,创建实验报告。并根据实验报告,如果实验效果明显,可以进行发布申请,审批通过后进行实验全量,同时可以留一个反转桶进行长期效果监控。

5

这种方法
有哪些收益?
  • 只进行一次实验观测,可以控制假阳性率(更准确)

  • 不需要对结果进行修正,降低实验分析门槛(更易用)

  • 只需要做进行一次实验,能够节省实验流量(更高效)