基于K-Means和Apriori算法的多层特征提取方法
2015-03-21钱慎一朱艳玲朱颢东
华中师范大学学报(自然科学版) 2015年3期
钱慎一, 朱艳玲, 朱颢东
(郑州轻工业学院 计算机与通信工程学院, 郑州 450002)
基于K-Means和Apriori算法的多层特征提取方法
钱慎一, 朱艳玲, 朱颢东*
(郑州轻工业学院 计算机与通信工程学院, 郑州 450002)
根据科技文献的结构特点,论文提出了一种四层挖掘模式,并结合K-means算法和Apriori算法,构建一个新的特征词提取方法——MultiLM-FE方法.该方法首先依据科技文献的结构将其分为4个层次,然后通过K-means聚类对前3层逐层实现特征词提取,最后再使用Aprori算法找出第4层的最大频繁项集,并作为第4层的特征词集合.该方法能够解决K-means算法不能自动确定最佳聚类初始点的问题,减少了聚类过程中信息损耗,这使得该方法能够在文献语料库中更加准确地找到特征词,较之以前的方法有很大提升,尤其是在科技文献方面更为适用.实验结果表明,该方法是可行有效的.
科技文献; 特征提取;K-means算法; Apriori算法
随着文献检索能力的提高,越来越多的用户习惯于从中国知网和数字图书馆进行快速检索,获取所需文献资料.但是在知识更新不断加快的今天,新主题、新事物、新学科大量涌现,信息种类和数量激增,这使得科技文献的数量每年近似指数的速度增长.如此海量的科技文献,往往需要消耗读者大量的时间.如何对其进行高效组织,满足广大读者的需求,已经成为该领域的一个研究热点.目前,诸多检索机构已将文献资料进行分类处理,例如,在中国知网中输入检索词“绿色网络”,能够检索到……
登录APP查看全文