基于NMF算法的多标记学习
2021-10-13李闪闪田文泉潘正高
兰州文理学院学报(自然科学版) 2021年5期
李闪闪,田文泉,潘正高
(宿州学院 信息工程学院,安徽 宿州 234000)
大数据时代,信息的高速产生和发展,使得从海量、庞大的“大数据”信息中筛选和挖掘出有价值的数据信息成为了新的技术挑战.现实世界中事物的存在往往面临多义性问题,即一个样本可能不仅仅具备一个标记信息,这种情况下,多标记学习[1]的框架应运而生.在该框架下,为了更好地描述数据对象,需要收集丰富的特征数据.与此同时,特征数据的大量增长也会伴随许多冗余特征的产生,从而造成分类困难,增加模型的训练时间.因此,对多标记数据的维度约简处理有重要意义.
矩阵分解技术是一种常见的对复杂、高维度数据进行压缩、去噪和降维的方法.传统的矩阵分解是将一个维数较大的矩阵分解成V=WH的形式,而不在乎分解后的矩阵W和H中元素是正值还是负值.但是实际生活中,矩阵中负值元素不具备物理可解释意义.比如,在图像处理中,每一个非负数值都可以被解释为与之对应的特征图例.在文本统计中,每一个非负取值都可以表示一篇文章的主题.而如果这些元素为负值,就无从解释了.
为了解决这一问题,Lee和Seung在《Nature》提出了一种有限定约束条件的非负矩阵分解(Non-negative Matrix Factorization,NMF)算法[1].该算法限定矩阵中所有元素均为非负值,规避了传统的矩阵分解技术中存在可解释性比较差的问题.NMF算法通过非负分解数据矩阵,将原始矩阵维数进行削减、压缩,是处理大规模数据的一……
登录APP查看全文
