基于PLSA 学习概率分布语义信息的多标签分类算法
2021-01-30王一宾郑伟杰程玉胜曹天成
南京大学学报(自然科学版) 2021年1期
王一宾 ,郑伟杰 ,程玉胜* ,曹天成
(1.安庆师范大学计算机与信息学院,安庆,246133;2.安徽省高校智能感知与计算重点实验室,安庆师范大学,安庆,246133)
大数据时代,文本数据分类[1]是当前的研究热点,因文本数据中含有多个主题,所以语义信息[2]的挖掘是主要研究的问题.多标签文本数据具有丰富的语义空间,语义空间的挖掘大多数应用在标签空间.在多标签算法中,特征与标签之间的联系与应用是近几年研究的热点,研究者们通过将标签对应几组特征、特征间与标签间的相关性信息等方法挖掘标签空间中语义信息,进而提升算法的性能.
大多数多标签数据具有维数较高的特征与标签空间,如何获取空间中的内在信息是面临的主要问题.针对这一问题,Huang et al[3]提出将特征与标签空间缩小到低维空间,从低维的特征空间获取潜在标签空间中的信息.标签嵌入[4]同样是获取标签空间中的内在信息主要方法,Kumar et al[5]提出将特征与标签分组对应投影到低维空间,标签向量嵌入到低维空间可保证各个组的稀疏性不变.特征间与标签间的相关性信息是特征与标签空间中的主要信息,许多研究者提出较好的学习方法.Cheng et al[6]利用均值漂移聚类[7]方法获得特征空间中的隐藏信息,并利用信息熵度量标签的相关性,采用一种非平衡化标签补全的方法重塑标签空间.但上述研究中,研究者们未能将特征与标签可能存在的先验分布信息用于提升算法的性能……
登录APP查看全文
