AB实验实际上是在做一个假设检验,可以参考上一篇笔记【概率论】- (2)假设检验。在查资料的过程中,查到AB实验主要有两种检验方式(不同的样本量,不同的检验方式)——
这里以Z检验为例,介绍如何确定AB实验中实验组与对照组的样本量,提供相应的代码,卡方检验原理相似。
在假设检验中有以下两类错误——
在教科书中一般只限定显著性水平为 α \alpha α,即只考虑一型错误的概率,而不考虑二型错误。但在实际应用中(如AB实验),二型错误也必须限定在较低的范围内。如下例子,这种情况下即使 α \alpha α 足够小,实验结果仍不够具有说服性。
假设实验的显著性水平 α = 0.01 \alpha=0.01 α=0.01,二型错误概率 β = 0.5 \beta=0.5 β=0.5,这意味着——
- 若原假设为真,我们判断出错(即拒绝)的概率为1%;
- 若原假设为假,我们判断出错(即接受)的概率为50%。
上面说的考虑二型错误,更常见的是考虑统计功效Statistical Power
。
统计功效是指当原假设为假,拒绝原假设的概率。因此有 p o w e r = 1 − β power = 1-\beta power=1−β。
通过求解统计功效,即可得到统计功效与 α 、 n \alpha、n α、n 的关系式。反过来,知道 α 、 p o w e r \alpha、power α、power 后就可以求出所需的样本量。
H 0 : μ A = μ B H 1 : μ A ≠ μ B (1) H_0:\mu_A=\mu_B \\ H_1:\mu_A \ne\mu_B\tag{1} H0:μA=μBH1:μA=μB(1)
β = P ( 接 受 H 0 ∣ H 0 为 假 ) = P ( − z α / 2 ≤ x ˉ A − x ˉ B σ / n A + n B ≤ z α / 2 ∣ δ ≠ 0 ) = P ( − z α / 2 − δ σ / n A + n B ≤ ( x ˉ A − x ˉ B ) − δ σ / n A + n B ≤ z α / 2 − δ σ / n A + n B ) = ϕ ( z α / 2 − δ σ / n A + n B ) ) − ϕ ( − z α / 2 − δ σ / n A + n B ) ) (2) \begin{aligned} \beta&=P(接受H_0|H_0为假)\\ &=P(-z_{\alpha/2}\le \frac{\bar x_A-\bar x_B}{\sigma/\sqrt{n_A+n_B}}\le z_{\alpha/2}|\delta \ne 0)\\ &=P(-z_{\alpha/2}-\frac{\delta}{\sigma/\sqrt{n_A+n_B}}\le \frac{(\bar x_A-\bar x_B)-\delta}{\sigma/\sqrt{n_A+n_B}}\le z_{\alpha/2}-\frac{\delta}{\sigma/\sqrt{n_A+n_B}})\\ &=\phi(z_{\alpha/2}-\frac{\delta}{\sigma/\sqrt{n_A+n_B}}))-\phi(-z_{\alpha/2}-\frac{\delta}{\sigma/\sqrt{n_A+n_B}})) \tag{2} \end{aligned} β=P(接受H0∣H0为假)=P(−zα/2≤σ/nA+nBxˉA−xˉB≤zα/2∣δ=0)=P(−zα/2−σ/nA+nBδ≤σ/nA+nB(xˉA−xˉB)−δ≤zα/2−σ/nA+nBδ)=ϕ(zα/2−σ/nA+nBδ))−ϕ(−zα/2−σ/nA+nBδ))(2)
注意,由于 H 0 H_0 H0 为假,即 μ A ≠ μ B \mu_A \ne \mu_B μA=μB, X ˉ A − X ˉ B σ / n A + n B \frac{\bar X_A-\bar X_B}{\sigma/\sqrt{n_A+n_B}} σ/nA+nBXˉA−XˉB 不服从正态分布,所以需要转化为 ( X ˉ A − X ˉ B ) − δ σ / n A + n B \frac{(\bar X_A-\bar X_B)-\delta}{\sigma/\sqrt{n_A+n_B}} σ/nA+nB(XˉA−XˉB)−δ 才服从标准正态分布。
p o w e r = 1 − β = 1 − ϕ ( z α / 2 − z ) + ϕ ( − z α / 2 − z ) = ϕ ( − z α / 2 + z ) + ϕ ( − z α / 2 − z ) (3) \begin{aligned} power=1-\beta&=1-\phi(z_{\alpha/2}-z)+\phi(-z_{\alpha/2}-z)\\ &=\phi(-z_{\alpha/2}+z)+\phi(-z_{\alpha/2}-z) \tag{3} \end{aligned} power=1−β=1−ϕ(zα/2−z)+ϕ(−zα/2−z)=ϕ(−zα/2+z)+ϕ(−zα/2−z)(3)
上述推导出了统计功效的计算公式,当然计算样本量已经有很多工具,比如Z检验计算样本量工具,这个工具中也提供了计算公式,与上面推导出的类似,注意区别在于这个工具的 z 1 − α / 2 z_{1-\alpha/2} z1−α/2 是下分位点,上述推导是上分位点。
从这个网站的公式中也可以看到样本量的计算公式。
python中提供了假设检验的函数(R中也有类似的函数,参考pwr功效分析R包),Z检验的函数定义如下,使用的时候提供参数,留一个未知参数(None),返回值为未知参数的计算结果,看后面的具体例子。
from statsmodels.stats.power import NormalIndPower
NormalIndPower().solve_power(
effect_size=None,
nobs1=None,
alpha=None,
power=None,
ratio=1.0,
alternative='two-sided',
)
第一个参数effect_size
表示效应量,代表不同处理下总体差异的大小(即判断有没有差别,还要判断差多少)。在Z检验中确定样本量可以使用 ∣ μ A − μ B ∣ σ \frac{|\mu_A-\mu_B|}{\sigma} σ∣μA−μB∣ 近似效应量。
假设原方案的留存率为0.40,新方案的留存率预计为0.45,方差为1,则求解样本量如下:
使用python函数计算,得到第一组为6280人,第二组与第一组相等(ratio=1)
按照公式计算,两个Z值查表得到,代入公式,求得样本量均为6280,与上面一致
使用Z检验计算样本量工具,结果为6267,与上述计算结果差异较小,猜测为效应量公式不同。使用另一个Z检验计算样本量工具计算结果则相同,为6280
卡方检验的推导思路应该与Z检验大致相同,我没有去尝试,这里直接用python函数求解,并与工具对比。
python提供的卡方检验函数如下,使用方法与Z检验的函数相同。
from statsmodels.stats.power import GofChisquarePower
GofChisquarePower().solve_power(
effect_size=None,
nobs=None,
alpha=None,
power=None,
n_bins=2,
)
卡方检验中,四格表的效应量计算公式如下(百度百科-效应量):
ϕ = χ 2 n = n ( a d − b c ) 2 / [ ( a + b ) ( c + d ) ( a + c ) ( b + d ) ] n = ( a d − b c ) 2 / [ ( a + b ) ( c + d ) ( a + c ) ( b + d ) ] \phi=\sqrt{\frac{\chi^2}{n}}=\sqrt{\frac{n(ad-bc)^2/[(a+b)(c+d)(a+c)(b+d)]}{n}}=\sqrt{(ad-bc)^2/[(a+b)(c+d)(a+c)(b+d)]} ϕ=nχ2=nn(ad−bc)2/[(a+b)(c+d)(a+c)(b+d)]=(ad−bc)2/[(a+b)(c+d)(a+c)(b+d)]
假设原方案的留存率为0.40,新方案的留存率预计为0.45,方差为1,则求解样本量如下:
使用python函数计算,样本量为3068,则每组1534
使用卡方检验计算样本量工具结果如下,每组样本量为1514,与上述函数结果有较小差异
使用另一个卡方检验计算样本量工具结果如下,每组样本量也为1514
两个工具均为1514,猜测与我们自己计算的结果不同原因为效应量计算方式不同。
因为没有实际进行过AB实验,不太清楚实际应用中使用的是哪种方式。个人认为卡方检验更为方便实用,一方面是样本量更少,实验成本更低,另一方面需要提供的参数也更少(不需要提供方差)。
以上是我对于AB实验样本量计算的一些思考,如有错误,请大佬指正~
《浙江大学概率论与数理统计第四版》
文章浏览阅读2w次,点赞7次,收藏51次。四个步骤1.创建C++ Win32项目动态库dll 2.在Win32项目动态库中添加 外部依赖项 lib头文件和lib库3.导出C接口4.c#调用c++动态库开始你的表演...①创建一个空白的解决方案,在解决方案中添加 Visual C++ , Win32 项目空白解决方案的创建:添加Visual C++ , Win32 项目这......_c#调用lib
文章浏览阅读4.6k次。苹方字体是苹果系统上的黑体,挺好看的。注重颜值的网站都会使用,例如知乎:font-family: -apple-system, BlinkMacSystemFont, Helvetica Neue, PingFang SC, Microsoft YaHei, Source Han Sans SC, Noto Sans CJK SC, W..._ubuntu pingfang
文章浏览阅读159次。表单表单概述表单标签表单域按钮控件demo表单标签表单标签基本语法结构<form action="处理数据程序的url地址“ method=”get|post“ name="表单名称”></form><!--action,当提交表单时,向何处发送表单中的数据,地址可以是相对地址也可以是绝对地址--><!--method将表单中的数据传送给服务器处理,get方式直接显示在url地址中,数据可以被缓存,且长度有限制;而post方式数据隐藏传输,_html表单的处理程序有那些
文章浏览阅读1.2k次。使用说明:开启Google的登陆二步验证(即Google Authenticator服务)后用户登陆时需要输入额外由手机客户端生成的一次性密码。实现Google Authenticator功能需要服务器端和客户端的支持。服务器端负责密钥的生成、验证一次性密码是否正确。客户端记录密钥后生成一次性密码。下载谷歌验证类库文件放到项目合适位置(我这边放在项目Vender下面)https://github.com/PHPGangsta/GoogleAuthenticatorPHP代码示例://引入谷_php otp 验证器
文章浏览阅读4.3k次,点赞5次,收藏11次。matplotlib.plot画图横坐标混乱及间隔处理_matplotlib更改横轴间距
文章浏览阅读2.2k次。①Storage driver 处理各镜像层及容器层的处理细节,实现了多层数据的堆叠,为用户 提供了多层数据合并后的统一视图②所有 Storage driver 都使用可堆叠图像层和写时复制(CoW)策略③docker info 命令可查看当系统上的 storage driver主要用于测试目的,不建议用于生成环境。_docker 保存容器
文章浏览阅读834次,点赞27次,收藏13次。网络拓扑结构是指计算机网络中各组件(如计算机、服务器、打印机、路由器、交换机等设备)及其连接线路在物理布局或逻辑构型上的排列形式。这种布局不仅描述了设备间的实际物理连接方式,也决定了数据在网络中流动的路径和方式。不同的网络拓扑结构影响着网络的性能、可靠性、可扩展性及管理维护的难易程度。_网络拓扑csdn
文章浏览阅读1.8k次,点赞5次,收藏8次。IOS系统Date的坑要创建一个指定时间的new Date对象时,通常的做法是:new Date("2020-09-21 11:11:00")这行代码在 PC 端和安卓端都是正常的,而在 iOS 端则会提示 Invalid Date 无效日期。在IOS年月日中间的横岗许换成斜杠,也就是new Date("2020/09/21 11:11:00")通常为了兼容IOS的这个坑,需要做一些额外的特殊处理,笔者在开发的时候经常会忘了兼容IOS系统。所以就想试着重写Date函数,一劳永逸,避免每次ne_date.prototype 将所有 ios
文章浏览阅读5.3k次。方法一:用PLSQL Developer工具。 1 在PLSQL Developer的sql window里输入select * from test for update; 2 按F8执行 3 打开锁, 再按一下加号. 鼠标点到第一列的列头,使全列成选中状态,然后粘贴,最后commit提交即可。(前提..._excel导入pl/sql
文章浏览阅读83次。Git常用命令速查手册1、初始化仓库git init2、将文件添加到仓库git add 文件名 # 将工作区的某个文件添加到暂存区 git add -u # 添加所有被tracked文件中被修改或删除的文件信息到暂存区,不处理untracked的文件git add -A # 添加所有被tracked文件中被修改或删除的文件信息到暂存区,包括untracked的文件...
文章浏览阅读202次。分享119个ASP.NET源码总有一个是你想要的_千博二手车源码v2023 build 1120
文章浏览阅读1.8k次。版权声明:转载请注明出处 http://blog.csdn.net/irean_lau。目录(?)[+]1、缺省构造函数。2、缺省拷贝构造函数。3、 缺省析构函数。4、缺省赋值运算符。5、缺省取址运算符。6、 缺省取址运算符 const。[cpp] view plain copy_空类默认产生哪些类成员函数