结合改进密度峰值聚类和共享子空间的协同训练算法
2021-03-18
计算机应用 2021年3期
关键词:分类
(1.重庆师范大学计算机与信息科学学院,重庆 401331;2.重庆师范大学重庆市数字农业服务工程技术研究中心,重庆 401331)
0 引言
协同训练是基于不同视图训练两个分类器来互相标记样本以扩充训练集的一个过程,属于半监督学习[1-2]的范畴。由于协同训练一方面考虑到现实世界中数据集的分布情况,充分利用数据集中大量无标记样本和少量有标记样本;另一方面考虑到多视图数据的多态性、多源性、多描述性等特点,充分利用数据集中各视图间的相关信息,使得协同训练广泛应用于图像处理[3]、工业样品检测[4]、城市管理[5]、在线问答服务[6]等领域。
协同训练的特点是在不用人工干预的情况下,通过两个独立分类器的协同作用从大量无标记样本中自动获取训练信息;然而,在协同训练迭代过程中,多分类器存在的标记不一致样本易导致分类错误累积,而如何选择更具代表性的无标记样本加入训练集也是提高分类器性能的关键。针对无标记样本的选择,付治等[7]利用基于简单约束的聚类算法和标记置信度来选择可靠的实例,以此来实现有标记样本的扩展;然而该方法严重依赖标记置信度,若样本集的簇中心选取不准确,则会造成分类连带错误。Gan等[8]用半监督模糊聚类来发现数据的内部结构,利用该数据结构选取局部判别能力强的无标记样本,但该方法未考虑到数据的全局结构信息,使得选择的无标记样本不能充分代表数据的原始空间结构。……
登录APP查看全文
