基于蚁群聚集信息素的半监督文本分类算法
2014-06-07杜芳华冀俊忠吴晨生吴金源
计算机工程 2014年11期
杜芳华,冀俊忠,吴晨生,吴金源
(1.北京工业大学计算机学院多媒体与智能软件技术北京市重点实验室,北京100124;
2.北京市科学技术情报研究所,北京100048)
基于蚁群聚集信息素的半监督文本分类算法
杜芳华1,冀俊忠1,吴晨生2,吴金源1
(1.北京工业大学计算机学院多媒体与智能软件技术北京市重点实验室,北京100124;
2.北京市科学技术情报研究所,北京100048)
半监督文本分类中已标记数据与未标记数据分布不一致,可能导致分类器性能较低。为此,提出一种利用蚁群聚集信息素浓度的半监督文本分类算法。将聚集信息素与传统的文本相似度计算相融合,利用Top-k策略选取出未标记蚂蚁可能归属的种群,依据判断规则判定未标记蚂蚁的置信度,采用随机选择策略,把置信度高的未标记蚂蚁加入到对其最有吸引力的训练种群中。在标准数据集上与朴素贝叶斯算法和EM算法进行对比实验,结果表明,该算法在精确率、召回率以及F1度量方面都取得了更好的效果。
文本分类;半监督学习;聚集信息素;自训练;Top-k策略;随机选择策略
1 概述
基于机器学习原理的有监督文本分类技术[1],已在自然语言处理[2]、信息过滤、文本挖掘[3]、情感挖掘、舆情监控等领域具有广泛的应用,但是有监督的文本分类方法一般都需要事先拥有大量的已标记数据来完成分类器的训练。然而,随着大数据时代的到来,人们通常得到的数据往往是海量的且数据分布未知的未标记数据[4]。由于客观资源的限制和手工标记数据的主观性,因此在实际应用中准确地获取大量的已标记数据非常困难。……
登录APP查看全文
