用科学实验ABN测试改善游戏体验
本文介绍如何用ABN测试科学验证游戏改动效果。相比A/B测试,ABN测试通过设置两个控制组并对比差异,能有效排除5%~10%的随机性干扰。实验需保证样本量充足、设置双控制组、核查置信区间,才能得出可信结论。
可以先通过数据分析来了解玩家的感受,再用ABN测试的方式推导出大概率有效的改善方案。ABN测试类似于化学实验里的控制组和对照组实验方法:游戏里可以通过调整某些游戏参数或内容,小规模更新控制组的玩法,再用对照组实验对比游戏数据是否有改善。之所以采用ABN测试而不是A/B测试,是因为如果随便选择两个控制组,不做任何事情,这两个样本就会表现出5%~10%甚至更大的随机性差异。我们假设游戏尝试做出一些改变或者更新内容,横轴是不同游戏内容的对比,纵轴是游戏的某项指标(例如参与人数),此外,每个组的样本规模最好在200人以上。

有些分析文章只用了几十人的样本,就下结论说变化了多少个百分点,这种实验结果是没有说服力的。因为数据样本量的不同会导致结果的偏差,用几十人和几万人做样本,结果会有很大差异。在总样本量不足200的情况下,每个组的样本量都很小,根本无法达到置信区间的可信度,而数据结果其实具有很大的随机性。
因此,在做数据分析实验的时候,我们需要控制好以下三点:
第一,样本量要足够多。
第二,最好做两个控制组。如果两个控制组之间的差异达到5%~10%,那么对照组A和对照组B之间的差异应该远超过5%~10%,否则实验的结果就不能说明任何问题。它并不能说明你所使用的两个方案中哪个更好,二者的差异也许只是源于样本的随机性。因此,大家一定要进行ABN测试,而不是A/B测试。A/B测试尽管也有用,但它能够说明的问题的置信区间是有限的。从统计学意义上讲,置信区间展现了参数的真实值有一定概率落在测量结果周围的程度,它给出了被测量参数的测量值的可信程度。
第三,需要知道置信区间是多少。即使从两个样本中可以看出对照组A、对照组B之间有差距,也无法确定这个差距能否说明问题。实验结果的置信区间是95%还是90%,对实验结果的判断是有影响的。如果只是比对照组提高了1%,那么置信区间很小,这个样本结果很有可能是随机的。此外,还需要查看实验方法是否涵盖了目标人群,且样本是随机分布的。例如,对照组A可能都是新用户,而对照组B可能是通过单一渠道获得的用户。如果用户的分布不是完全随机的,那么这个结果就没有太大的说服力。
总体而言,要控制好上述三点,才能真正说明问题。最终还是要依托数据分析,而不是拿着数据做数据,或者为了得到一个结果去做数据。我们要有一些定性的分析和想法,知道用某个数据来验证这个想法对不对、合不合适。
影响数据形成的过程如下:
1)统计数据,了解游戏各方面的表现,有较为规范、统一、一致的评估标准。
2)挖掘、清洗数据,从统计中找到有用的数据进行处理,找到我们希望验证的问题的支撑点。
3)通过经验形成推断、结论,以及下一步的观测指标与实验指导,为充分讨论游戏行为提供更多路径。
(本文内容根据网络资料整理,出于传递更多信息之目的,读者需判断其时效性,不代表连连赞同其观点和立场)









































