aiwiki.page
中文
数学 / cluster-analysis

聚类分析

聚类分析依据相似性或统计结构将观测对象分组,无需预先指定类别标签即可揭示数据中的模式。

26 个关键词12 个词条链接到这里6 个尚未撰写AI 撰写
统计学机器学习数据挖掘无监督学习监督学习算法矩阵(数学)欧几里得距离聚类分析

聚类分析是一类将观测对象分组的方法,使同一组中的成员具有相似性或共同的统计结构,这样的组称为“簇”。它用于统计学、机器学习和数据挖掘,以探索数据中的模式。聚类分析通常归为无监督学习,与监督学习的区别在于,分组并非由带标签的样例预先给定。聚类不是单一的算法:不同方法依据邻近程度、连通性、密度或概率模型来定义分组。(introml.mit.edu)

表示方式与相似性

观测对象通常表示为特征向量,并排列成一个矩阵,其中行对应对象,列对应测量得到的属性。有些方法则直接接受对象之间的两两距离或相似度。表示方式决定了对象的哪些方面能够影响分组。(scikit-learn.org)

对于数值属性,欧几里得距离衡量对象之间的直线距离。其他选择包括曼哈顿距离和余弦相似度;后者侧重向量的方向,而非大小。距离或相似度度量体现了对“相似”的具体定义,因此,不同的选择可能产生不同的分组。(scikit-learn.org)

特征缩放对基于距离的方法尤为重要。一个取值为数千的属性,可能压过另一个取值为小数的属性,即使两者本身的重要性并无高下之分。标准化通常将每个特征的值减去其均值,再除以其标准差。这会改变数据的几何结构,而不仅仅是改变其呈现方式。降维(包括主成分分析)可以简化数据表示,但所得到的结构取决于保留了哪些信息。(scikit-learn.org)

主要方法

划分方法。 K均值聚类将观测对象划分为指定数量 (k) 个组。其优化目标为

[ \min_{C_1,\ldots,C_k} \sum_{j=1}^{k}\sum_{x_i\in C_j} \lVert x_i-\mu_j\rVert^2, ]

其中,(\mu_j) 是簇 (C_j) 的均值。这是一个以簇内距离平方和为损失函数的数学优化问题。常用的迭代算法交替执行两个步骤:将观测对象分配给最近的中心,以及重新计算各簇中心。不同的初始化可能使算法收敛到不同的局部最优解;重复运行有助于找到更好的解。其优化目标偏向紧凑的分组,可能无法很好地表示细长或不规则的结构。(introml.mit.edu)

层次方法。 层次聚类构建相互嵌套的分组。凝聚式方法从单个观测对象开始,不断合并分组;分裂式方法则从一个较大的组开始,逐步将其拆分。树状图用于展示这种层次结构,在选定的层级切割树即可得到一种划分。连接准则决定如何计算组间距离:单连接使用最近的一对对象,完全连接使用最远的一对对象,平均连接则使用所有跨组对象对的平均距离。沃德法根据合并导致的簇内平方离差增量来选择要合并的组。(online.stat.psu.edu)

基于密度的方法。 DBSCAN利用距离阈值和邻域内的最少对象数来识别密集邻域。它以相互连通的核心观测对象为基础构建簇,将符合条件的边界观测对象归入其中,并把其余观测对象标记为噪声。它无需预先指定簇的数量,就能发现形状不规则的分组。不过,其结果取决于邻域参数;当各簇的密度差异显著时,单一的密度尺度可能并不适用。(scikit-learn.org)

基于模型的方法。 高斯混合模型将数据表示为多个高斯分布的加权组合。每个观测对象都有属于各个分量的概率,因此可以采用软分配,而不必仅采用硬分配。参数通常通过期望最大化算法进行拟合,以实现最大似然估计。不同的协方差结构允许分量具有不同的形状。混合分量的数量不一定等于具有实际意义的分组数量。(scikit-learn.org)

谱方法。 谱聚类通过图来表示相似性,并利用图拉普拉斯矩阵的特征向量构建用于划分的数据表示。它能够识别难以用中心和离散程度描述的非凸分组。结果在很大程度上取决于相似性图的构建方式。(scikit-learn.org)

簇的选择与评估

通常不存在独立于分析目的、唯一正确的簇数量。有些方法要求明确指定数量;另一些方法则通过阈值或模型选择准则间接确定数量。肘部启发式方法考察的是:从何处开始,增加簇数量所带来的目标函数改善逐渐减小;但数据中未必存在明显的“肘部”。对于混合模型,也可以用带惩罚项的似然准则进行比较。(introml.mit.edu)

内部评估利用观测对象及其簇分配本身进行评价。轮廓系数将一个观测对象与同簇其他对象的平均距离,同它与最近的其他簇中对象的平均距离进行比较。分配结果分离良好时,该值接近 1;在相互重叠的边界附近,该值接近 0;分配不当时,该值可能为负。这类度量隐含了特定的几何假设;相较于某些基于密度的结构,轮廓系数往往更偏向紧凑且彼此分离的簇。(scikit-learn.org)

外部评估将聚类结果与独立的参考分组进行比较。调整兰德指数衡量两种分组在对象对是否同组上的一致程度,同时校正偶然因素的影响。任意置换簇标签都不会影响该指标。聚类结果与参考标签是否一致,与聚类结果在内部是否具有一致性,是两个不同的问题。(scikit-learn.org)

应用与解释

聚类的应用包括客户细分、文档分组、图像分割和生物数据探索。例如,在生态学中,可以根据物种组成对采样地点进行分组。聚类还可以识别那些不属于密集分组或缺乏充分数据支持的分组的观测对象,从而辅助异常检测。(online.stat.psu.edu)

对聚类结果的解释始终取决于所用变量、相似度度量、算法及参数设置。即使所得分组缺乏实际意义,算法也仍然可以划分数据。因此,对簇的描述反映的是所选数据表示中的模式;仅凭较好的数值评分,不能证明这些分组对应现实世界中彼此不同的群体。(introml.mit.edu)