一文掌握卡方检验
1. 什么是假设检验?
1.1 假设检验:一个例子
1.2 假设检验
设置零假设(null hypothesis),备择假设(alternative hypothesis)和显著性水平( ); 从检验统计量计算 值; 根据 值和显著性水平 拒绝或不拒绝零假设。
1.2.1 设置零假设(null hypothesis),备择假设(alternative hypothesis)和显著性水平( )
因为科学家必须始终持怀疑态度并小心处理他们发现的东西。科学家不能对没有足够证据的事情感到过于兴奋并告诉每个人它有效。
它被称为“零假设”,是因为它假设实验期间观察到的任何差异仅是随机机会的结果(result of random chance)。这个零是我们的默认值。
[示例 - 如何制定零假设/备择假设]# 单样本检验研究问题:COVID疫苗是否能够预防感染?H0:疫苗不会改变感染率。(然后将感染率设置为当前的常量。)H1:感染率≠常量# 两样本检验H0:苹果手机和Galaxy手机的电池寿命没有差异。H1:苹果手机和Galaxy手机的电池寿命有差异。
1.2.2 从检验统计量计算 值
1.2.3 根据 值和显著性水平 拒绝或不拒绝零假设
假设检验是统计学中最重要的概念之一。它在日常生活中被广泛使用,例如产品的A/B测试,药物批准,临床试验等,以帮助公司做出明智的决策。假设检验为我们提供了一个坚实的框架,以使用来自人口的较小样本做出决策。
2. 为什么要进行卡方检验?
3. 卡方检验统计量的计算
第一步:根据给定数据创建表格,也称为“条件表”或“观察O”;
第二步:为每个数据点计算“期望值E”;
第三步:计算 ;
第四步:通过添加第3步中的值来获取 (卡方);
第五步:获取你的“自由度”;
第六步:计算 值,或查找卡方概率表中的检验统计量。
在概率论和统计学中,一个离散性随机变量的期望值(或数学期望,亦简称期望,物理学中称为期待值)是试验中每次可能的结果乘以其结果概率的总和。换句话说,期望值像是随机试验在同样的机会下重复多次,所有那些可能状态平均的结果,便基本上等同“期望值”所期望的数。期望值可能与每一个结果都不相等。换句话说,期望值是该变量输出值的加权平均。期望值并不一定包含于其分布值域,也并不一定等于值域平均值。(https://zh.wikipedia.org/wiki/期望值)
为什么要计算期望值E表?
因为,如果实际观察值,例如[ICU,厌食症]的24与期望值(36 * 55/138 = 14.35)有很大的不同,那么厌食症和ICU之间可能会有一些关联。另一方面,当观察结果类似于预期时,无论是ICU还是非ICU,患有厌食症的患者的比例都将相同。那么,厌食症对ICU入院可能没有太大的影响。
那么,我们的观察结果(24、12、31、71等)似乎不是其他数字的平均值,它们就是数据本身。如果是这样,为什么我们认为这将遵循正态分布呢?
卡方检验通常忽略了这个正态分布的假设,但这个假设是卡方检验成立的原因。
from scipy.stats import chi2_contingencytable = [[24, 12], [31, 71]]alpha = 0.05test_statistic, p_value, dof, expected = chi2_contingency(table)if p_value <= alpha:print('Variables are not independent (reject H0)')else:print('Variables are independent (fail to reject H0)')
值小于 。我们可以拒绝零假设。
值大于 。在这种情况下,我们无法拒绝零假设。
4. 结论
🏴☠️宝藏级🏴☠️ 原创公众号『数据STUDIO』内容超级硬核。公众号以Python为核心语言,垂直于数据科学领域,包括可戳👉Python|MySQL|数据分析|数据可视化|机器学习与数据挖掘|爬虫 等,从入门到进阶!
长按👇关注- 数据STUDIO -设为星标,干货速递