基于邻域样本稳定性的三支聚类方法
2021-01-08李洪梅姜冬勤王平心
山西大学学报(自然科学版) 2020年4期
关键词:定义
李洪梅,姜冬勤,王平心
(1.江苏科技大学 计算机学院,江苏 镇江 212003;2.江苏科技大学 理学院,江苏 镇江 212003)
0 引言
聚类分析是数据挖掘与机器学习领域中的重要技术之一[1-2],已经广泛地应用于多个领域,包括信息粒化[3-4]、图像处理[5]、生物信息学[6]、安全保障[7]、网页搜索[8]等。所谓聚类就是将数据集中的样本划分到不同的类簇中,使得相同类簇中的样本相似度高,而不同类簇中的样本相似度低。聚类作为一种无监督学习技术,在识别无标签数据结构方面发挥了极大的作用。针对不同的情况,可以将聚类方法粗略地分为两大类:层次聚类方法和划分聚类方法[9]。
传统的聚类方法大多属于硬聚类,即对象要么属于一个类,要么不属于一个类,聚类的结果必须具有清晰的边界。但是在处理不确定性信息时,考虑到当前获取到的信息还不够充分,强制将其中的元素划分到一个类中,往往容易带来较高的错误率或决策风险。为了解决传统聚类方法存在的问题,许多新的聚类策略被提出。Hoppner等人[10]将模糊数学引入到了聚类分析中,用模糊集表示聚类结果。Lingras[11-12]提出了粗糙聚类方法,将聚类结果由粗糙集的正域,边界域和负域来表示。以上方法都是对传统硬聚类的一种改进。而三支决策聚类方法[13],是将三支决策[14]思想引入到了聚类分析中,将确定的元素放入核心域中,将不确定的元素放入边界域中延迟决策,有效地降低了决策风险。三支聚类不仅可使聚类的结果具有更好的结构特征和可解释性,还可以避免二支决策引起的不必要代价。……
登录APP查看全文