GCN-PU:基于图卷积网络的PU文本分类算法
2021-06-11姚佳奇徐正国燕继坤王科人
计算机工程与应用 2021年11期
关键词:文本
姚佳奇,徐正国,燕继坤,王科人
盲信号处理重点实验室,成都610041
目前处在一个信息快速增长的时代,如何根据用户给出的感兴趣文本,从海量的文本集中挑选出相关文本成为一个急需解决的问题。在实际应用中,用户只保留了感兴趣的文本集以及大量的未标注文本集,即只有正类样本和未标注的样本。传统的有监督学习和半监督学习都需要正类样本和负类样本来训练分类器[1]。与传统的有监督学习和半监督学习不同,PU学习(Positive and Unlabeled)的分类器建立在正类样本集P和未标注样本集U的基础上,其中未标注样本集同时含有正类样本和负类样本[2]。
PU学习算法可以分成两类,一类是“两步法”,即从未标注样本集中不断选择可靠的负类样本来构建分类器;另一类是“直接法”,即直接在正类样本和未标注样本上构建分类器[3]。
“两步法”包括S-EM[4]、Roc-SVM[5]和AdaSampling[6]等算法。S-EM算法的第一步采用了间谍技术(Spy Technique),即随机选取少量已经标注的正类样本作为间谍集S放入未标注样本集中,然后以P-S作为正类样本集,以U∪S作为负类样本集训练基于EM算法的分类器,最后以间谍集S的类别概率确定选择可靠负类样本的阈值。Roc-SVM算法的第一步采用Rocchio算法筛选出可靠的负类样本集后,利用SVM训练文本分类器。AdaSampling是一种基于Bootstrap采样的算法,U中被选择作为可靠负类样本的概率为上一轮分类器训练得到的负类样本概率。
“直接法”典型的代表是偏置SVM算法(Biased-SVM)[3]。令X=P∪U,|X|表示集合X的元素个数,则偏置SVM算法的优化目标函数如下所示:……p>
登录APP查看全文
