APP下载

基于类别覆盖集的改进蚁群算法研究

2017-04-13焦莉娟宗春梅

软件导刊 2017年3期
关键词:分类文本信息

焦莉娟,宗春梅

(忻州师范学院 计算机系,山西 忻州 034000)

基于类别覆盖集的改进蚁群算法研究

焦莉娟,宗春梅

(忻州师范学院 计算机系,山西 忻州 034000)

结合蚁群算法在解决分类问题方面的优势,以及中文网页内容特征值的离散性特点,提出一种改进的基于蚁群算法的网页分类方法。该算法通过携带类别信息的种群蚂蚁的爬行,在迭代过程中寻找一条最佳路径与之匹配,实现了Web页面的分类。最佳路径通过计算测试文档与每一类别的覆盖集合,进而比较最优覆盖集合得到。其中类别权重计算中引入了文字链接比和标签权值,进一步提高了分类精度。实验证明,引入类别覆盖集的蚁群分类算法能够取得更好的分类效果。

蚁群算法;文本分类;类别覆盖集;词义相似度

0 引言

基于文本分类的网络页面分类是根据页面文本内容,由计算机依照某种分类算法,把文本自动映射到一个或多个预先定义好的类别。网页标记与页面链接是影响网络页面分类的主要元素,采用文本与网页特征有机结合的分类方法是网页分类的研究趋势[1]。目前常用的文本分类方法有支持向量机[2]、朴素Bayes[3]、KNN[4]等。

蚁群算法ACA(Ant Colony Algorithm)是20世纪90年代意大利学者M Dorigo,V Maniezzo,A Colorni等[5]通过模拟真实蚂蚁寻找路径的行为,而提出的一种成熟的模拟进化算法。蚁群算法最初主要用于求解TSP问题、分配问题、Job-shop调度问题等,目前已有学者将其应用于文本分类问题,并取得显著效果。本文利用蚁群算法在解决分类问题方面的优势,将其引入Web页面分类领域,并提出类别覆盖集概念。……

登录APP查看全文

猜你喜欢

分类文本信息
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本
健康信息
健康信息(九则)