数据STUDIO

最强总结,十大特征选择方法 !

Image

Image

特征选择方法在机器学习中非常非常重要,它能提高模型的性能和泛化能力。通过去除冗余或不相关的特征,可以减少计算成本并加速训练过程。此外,它还帮助理解数据的内在结构,提升模型的可解释性。

本篇文章给大家总结的十个特征选择方法有:

  • 方差阈值法
  • 单变量特征选择
  • 递归特征消除
  • 基于树模型的特征选择
  • L1 正则化
  • 嵌入法
  • 主成分分析
  • 相关系数法
  • 信息增益
  • 互信息法

具体的每种方法,咱们具体看下~

1. 方差阈值法 (Variance Threshold)

方差阈值法是一种简单的特征选择方法,通过移除方差低于某一阈值的特征,来减少特征数目。

原理

特征的方差小表示其在数据集中变化小,对模型的贡献可能较小,因此可以移除。

核心公式

其中, 是特征 , 是样本数, 是特征  的均值。

计算每个特征的方差,并与预设的阈值比较,方差小于阈值的特征将被移除。

2. 单变量特征选择 (Univariate Feature Selection)

单变量特征选择通过对每个特征单独进行统计测试,选择与目标变量显著相关的特征。

原理

使用统计检验(如卡方检验、F检验等)评估每个特征与目标变量的关系。

核心公式

以卡方检验为例:

其中, 是观察值, 是期望值。

通过卡方检验公式计算每个特征的卡方值,并与临界值比较,选择卡方值较大的特征。

3. 递归特征消除 (Recursive Feature Elimination, RFE)

RFE通过递归地训练模型,移除最不重要的特征,直到达到预定的特征数。

原理

每次训练模型后,根据特征的重要性分数移除最不重要的特征。

核心公式

特征重要性分数取决于使用的模型。例如,线性回归模型的权重  可用于评估特征重要性。

  1. 训练模型,计算特征重要性分数。
  2. 移除分数最低的特征。
  3. 重复以上步骤,直到达到预定的特征数。

4. 基于树模型的特征选择 (Feature Importance from Tree-Based Models)

使用决策树、随机森林等树模型中的特征重要性分数来选择重要特征。

原理

树模型中的特征重要性基于特征在树结构中分裂节点时减少的损失函数值。

核心公式

特征重要性  的计算公式为:

其中,  是节点  处的损失减少量, 是特征  在节点  的分裂。

遍历树的所有节点,计算每个特征在节点分裂时的损失减少量,并累加得到特征的重要性分数。

5. L1 正则化 (Lasso Regression)

L1 正则化通过在损失函数中添加 L1 范数项,使得某些特征的权重变为零,从而实现特征选择。

原理

L1 正则化倾向于产生稀疏模型,即许多权重为零的特性。

核心公式

Lasso 回归的损失函数为:

其中, 是正则化参数, 是权重。

通过求解 Lasso 回归的损失函数,使用梯度下降或坐标下降法等优化算法,使得某些特征的权重  收缩为零,从而实现特征选择。

6. 嵌入法 (Embedded Methods)

嵌入法在模型训练过程中自动选择特征,如 Lasso 回归和基于决策树的模型。

原理

嵌入法将特征选择嵌入到模型训练过程中,通过正则化或特征重要性分数来选择特征。

嵌入法依赖于具体的模型,如 Lasso 回归和树模型的特征重要性分数。

与 Lasso 回归和基于树模型的特征选择方法类似,嵌入法通过模型训练过程中的特征权重或重要性分数来选择特征。

7. 主成分分析 (Principal Component Analysis, PCA)

PCA 通过将高维数据映射到较低维度的空间,通过选择主成分来减少特征数量。

原理

PCA 通过寻找数据的主成分,将数据投影到这些主成分上,从而实现降维。

核心公式

PCA 的目标是找到一个线性变换矩阵 ,使得变换后的数据  的协方差矩阵  是对角矩阵。

  1. 计算数据矩阵  的协方差矩阵 。
  2. 对协方差矩阵  进行特征值分解,得到特征值和特征向量。
  3. 选择最大的  个特征值对应的特征向量,构成变换矩阵 。

8. 相关系数法 (Correlation Coefficient)

通过计算特征与目标变量之间的相关系数,选择高相关性的特征。

原理

相关系数衡量两个变量之间的线性关系,值越大表示关系越强。

核心公式

皮尔逊相关系数公式为:

其中, 是  和  的协方差, 和  分别是  和  的标准差。

  1. 计算特征  和目标变量  的协方差。
  2. 计算特征  和目标变量  的标准差。
  3. 计算相关系数  并排序,选择相关系数较高的特征。

9. 信息增益 (Information Gain)

评估每个特征对目标变量信息的贡献,并选择信息增益较高的特征。

原理

信息增益衡量特征  对目标变量  的不确定性的减少。

核心公式

信息增益公式为:

其中, 是目标变量的熵, 是在特征  给定条件下目标变量的条件熵。

  1. 计算目标变量  的熵 。
  2. 计算特征  给定条件下目标变量的条件熵 。
  3. 计算信息增益  并排序,选择信息增益较高的特征。

10. 互信息法 (Mutual Information)

通过计算特征与目标变量的互信息来选择重要特征。

原理

互信息衡量两个变量之间的依赖关系。

核心公式

互信息公式为:

其中, 是  和  的联合概率分布, 和  分别是  和  的边缘概率分布。

  1. 计算特征  和目标变量  的联合概率分布 。
  2. 计算特征  和目标变量  的边缘概率分布  和 。
  3. 计算互信息  并排序,选择互信息较高的特征。