APP下载

基于PCA降维的成对约束半监督聚类集成

2021-01-27黄欣辰黄豪杰

计算机与现代化 2021年1期
关键词:监督实验

黄欣辰,皋 军,黄豪杰

(1.盐城工学院信息工程学院,江苏 盐城 224002; 2.江苏科技大学计算机学院,江苏 镇江 212003)

0 引 言

聚类分析的目的是根据对象之间的相似度对对象分组,使得簇内对象相似度尽量高,而簇间对象相似度尽量低,簇内相似性越大,簇间差别越大,聚类性能越好[1]。但单个的聚类方法不能令人产生满意的结果,聚类集成是一种将多个不同的聚类结果进行合并,能够获得比传统聚类算法更好聚类结果的方法[2]。目前聚类集成的研究主要集中在无监督学习领域中,没有考虑到用户或者专家提供的先验知识。而半监督聚类集成将少量带有标签的数据代入到聚类集成中,监督与指导集成过程,最终获得更加优越的聚类结果,使得整个过程更具稳定性、准确性和鲁棒性[3-5]。

常见的半监督聚类方法有3种。第1种是基于约束的半监督聚类[4],样本两两之间包含了一组成对约束信息,即正约束(must-link)和负约束(cannot-link)信息,通过它们能很有效地指导聚类过程。must-link约束规定:若2个样本满足must-link约束,则2个样本在聚类时一定被划分到同一个簇中。cannot-link约束规定:若2个样本满足cannot-link约束,则2个样本在聚类时一定被划分到不同簇之中。第2种是基于距离的半监督聚类[6],这类算法是根据样本之间的约束信息来构造一个距离度量函数,对样本点进行划分,形成分组。第3种是基于约束和距离的半监督聚类算法[7],它是第1种和第2种方法的融合。

随着大数据时代的到来,各种各样的数据出现在人们生活中,如文本数据、图片数据、声音数据、视频数据、基因数据等,且这些冗长的数据越来越呈现出高维性的特点,使得很多算法在数据分析过程中引起“维数灾难”[8-9]。……

登录APP查看全文

猜你喜欢

监督实验
记一次有趣的实验
突出“四个注重” 预算监督显实效
做个怪怪长实验
监督见成效 旧貌换新颜
夯实监督之基
NO与NO2相互转化实验的改进
实践十号上的19项实验
绩效监督:从“管住”到“管好”
监督宜“补”不宜“比”
人大监督不能总是“心太软”