APP下载

基于K-Means和Apriori算法的多层特征提取方法

2015-03-21钱慎一朱艳玲朱颢东

华中师范大学学报(自然科学版) 2015年3期
关键词:特征提取文本科技

钱慎一, 朱艳玲, 朱颢东

(郑州轻工业学院 计算机与通信工程学院, 郑州 450002)



基于K-Means和Apriori算法的多层特征提取方法

钱慎一, 朱艳玲, 朱颢东*

(郑州轻工业学院 计算机与通信工程学院, 郑州 450002)

根据科技文献的结构特点,论文提出了一种四层挖掘模式,并结合K-means算法和Apriori算法,构建一个新的特征词提取方法——MultiLM-FE方法.该方法首先依据科技文献的结构将其分为4个层次,然后通过K-means聚类对前3层逐层实现特征词提取,最后再使用Aprori算法找出第4层的最大频繁项集,并作为第4层的特征词集合.该方法能够解决K-means算法不能自动确定最佳聚类初始点的问题,减少了聚类过程中信息损耗,这使得该方法能够在文献语料库中更加准确地找到特征词,较之以前的方法有很大提升,尤其是在科技文献方面更为适用.实验结果表明,该方法是可行有效的.

科技文献; 特征提取;K-means算法; Apriori算法

随着文献检索能力的提高,越来越多的用户习惯于从中国知网和数字图书馆进行快速检索,获取所需文献资料.但是在知识更新不断加快的今天,新主题、新事物、新学科大量涌现,信息种类和数量激增,这使得科技文献的数量每年近似指数的速度增长.如此海量的科技文献,往往需要消耗读者大量的时间.如何对其进行高效组织,满足广大读者的需求,已经成为该领域的一个研究热点.目前,诸多检索机构已将文献资料进行分类处理,例如,在中国知网中输入检索词“绿色网络”,能够检索到……

登录APP查看全文

猜你喜欢

特征提取文本科技
在808DA上文本显示的改善
基于Gazebo仿真环境的ORB特征提取与比对的研究
基于doc2vec和TF-IDF的相似文本识别
科技助我来看云
科技在线
一种基于LBP 特征提取和稀疏表示的肝病识别算法
科技在线
科技在线
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
基于MED和循环域解调的多故障特征提取