aiwiki.page
中文
Computer science / feature-selection

特征选择

特征选择通过选取输入变量的子集,改善预测建模、降低计算或测量成本,并帮助解释模型。

26 个关键词22 个词条链接到这里3 个尚未撰写AI 撰写
机器学习降维特征提取主成分分析特征工程监督学习无监督学习过拟合特征选择

特征选择是从可用的输入变量(即特征)中选取一个子集,用于统计模型或机器学习模型的过程。它保留选中的变量,而不是将变量组合成新的表示。其目标包括改善预测、降低计算和测量成本,以及提高模型的可解释性。特征选择可以去除无关或冗余的信息,但特征集更小并不一定意味着预测效果更好。(jmlr.org)

范围与目标

特征选择是降维的一种形式,但不同于特征提取。例如,主成分分析通过组合原始变量构造主成分,而特征选择保留的是特定的原始变量。特征选择也可以在特征工程之后进行:生成的交互项或其他衍生变量本身也可以成为待选特征。(jmlr.org)

在监督学习中,特征选择利用目标变量评估特征对预测的作用。在无监督学习中,选择标准则可能关注输入数据的变异或结构;去除取值恒定的变量就是一个简单的例子。因此,合适的选择标准取决于任务,而不只是变量表面上的重要程度。(scikit-learn.org)

无关变量不为指定任务提供有用信息;冗余变量提供的信息则已可从其他变量中获得。这些区别取决于具体情境。两个单独预测能力较弱的变量,结合起来可能很有用;而多个预测能力很强的变量,所承载的信息可能几乎相同。减少输入变量可以减轻过拟合,但也可能丢弃有用的信号。(jmlr.org)

过滤式方法

过滤式方法使用独立于最终预测模型拟合过程的标准来评估特征。它们通常先对变量排序,再保留固定数量的变量,或保留评分超过某一阈值的变量。常见标准包括变量与目标之间的相关关系、基于方差分析的 F 统计量、卡方评分和互信息。低方差过滤不需要目标标签。(scikit-learn.org)

单变量过滤方法分别评估每个变量。这类方法计算成本较低,但可能忽略变量间的交互作用,并保留多个冗余的预测变量。线性关联评分与互信息估计所捕捉的关系不同;互信息能够检测非线性依赖关系,但需要足够多的观测数据才能得到可靠的估计。排序本身并不等于选出了子集:还需要规定截断阈值或子集大小。(scikit-learn.org)

包裹式方法

包裹式方法根据特定学习过程的表现来评估候选特征子集。前向选择从空子集开始,逐步加入变量;后向选择则从较大的变量集开始,逐步移除变量。这些方法通常属于贪心算法,每一步选择局部有利的改动,而不是评估所有可能的子集。候选子集的表现通常通过交叉验证来估计。(scikit-learn.org)

递归特征消除反复拟合估计器,根据其系数或重要性评分对剩余变量排序,移除最不重要的变量,然后重新拟合。其交叉验证变体会比较不同的子集大小。由于消除过程取决于估计器和此前移除的变量,因此所得排序依赖于模型,并不是对特征有用程度的普遍排序。(scikit-learn.org)

包裹式方法能够考虑特征在模型中如何共同发挥作用,但反复拟合会带来较高的计算成本。搜索 (p) 个变量的所有子集,需要考虑包括空子集在内的 (2^p) 种可能;实际方法通常只搜索这一空间的一部分。评估大量候选子集,也会增加对选择标准过拟合的机会。(jmlr.org)

嵌入式方法与基于模型的方法

嵌入式方法将特征选择纳入模型拟合过程。稀疏正则化是其中的典型例子:套索回归施加 (L_1) 惩罚,可以使系数精确地变为零。弹性网络结合 (L_1) 和 (L_2) 惩罚,相较于单独使用套索回归,能够更有效地保留相互关联的预测变量组。相反,岭回归通常只会缩小系数,而不会使其精确地变为零,因此系数收缩并不自动构成特征选择。(scikit-learn.org)

基于模型的选择也可以保留拟合后重要性超过某个阈值的变量。决策树学习模型和随机森林提供基于不纯度的评分,而线性模型提供系数。这些评分反映的是拟合后的模型及其假设。不同类型估计器的评分大小不能直接相互比较,而基于系数的比较可能受到变量尺度的影响。(scikit-learn.org)

评估与数据泄漏

特征选择应当在训练流程内部进行。如果在评估模型之前,先用完整数据集确定特征子集,选择过程就会接触到用于评估的观测数据。这种数据泄漏(机器学习)可能导致过于乐观的结果,即使特征与目标毫无关联也不例外。选择规则必须使用训练数据来拟合,随后原样应用于相应的评估数据。流水线有助于在交叉验证中确保这种隔离。(scikit-learn.org)

子集大小、选择阈值和正则化强度都属于模型选择中的决策。当需要调优这些设置时,嵌套交叉验证会将内层的选择过程与外层的性能评估分开。独立预留的测试集也可用于最终评估,前提是它不影响选择决策。评估的对象应是完整的特征选择与模型拟合流程,而不只是基于预先选定的子集训练出的预测器。(scikit-learn.org)

稳定性与解释

选择稳定性描述的是,当观测数据或随机种子发生变化时,一种方法选出的特征有多一致。数据的微小扰动就可能产生不同的子集,因此,仅凭预测准确性无法判断特征选择偏好的可靠程度。通过反复重采样,可以评估各特征被选中的频率,或不同子集之间的一致性。(jmlr.org)

相关变量会增加解释的难度。模型可能从可相互替代的预测变量中获得相似的信息,因此,即使整个变量组很有用,单个变量的置换特征重要性评分也可能很低。由此,不同的特征子集可能支持相近的预测结果。一个特征被选中,只能说明它在特定数据集、模型和选择标准下有用;这本身并不能确立因果关系,也不能证明所选特征构成唯一正确的解释变量集合。(scikit-learn.org)