聚类假设(cluster assumption),理学-计算机科学技术-人工智能-机器学习-弱监督学习-半监督学习,半监督学习中的经典假设。该假设认为来自不同类别的样本倾向于凝聚成不同的簇;来源于同一个簇的样本倾向于具有相同的类别标记。聚类假设是半监督学习中的一种经典假设。该假设认为来自不同类别的样本倾向于凝聚成不同的簇;来源于同一个簇的样本倾向于具有相同的类别标记。基于这一假设,大量的无标记样本可以帮助学习器寻找簇的边界,而少量的标记样本可以帮助学习器确定簇中样本所对应的类别。需要注意的是,聚类假设并不认为具有相同类别标记的样本全部属于同一个簇或紧凑的簇。聚类假设仅仅认为通常情况下,观测到不同类别标记的样本属于同一个簇的概率较低。另一个由聚类假设所衍生出的假设被称为“低密度分隔”(low-density separation),即决策边界位于低密度区域。聚类假设与低密度分隔假设都导出决策边界应该穿过低密度区域的结论,但两者启发出不同的半监督学习方法。例如,半监督支持向量机主要考虑低密度分隔假设,而半监督高斯混合模型则是聚类假设的一种实例。