基于远程学习的关键词提取技术研究
2021-11-19曹聪慧漆为民
电脑与电信 2021年8期
曹聪慧 兰 强 侯 群 漆为民*
(1.江汉大学人工智能学院;人工智能研究院,湖北 武汉 430056;2.东风汽车财务有限公司,湖北 武汉 430056)
1 引言
近年来,互联网已经成为全球最大的分布式的信息库,据不完全的统计显示,全世界每年出版的各种文献资料和新发表的论文总数突破1000万,互联网上已有超过400亿张网页。而文本的形式仍然是大部分信息的表现形式[1],如何准确高效地提取出对用户有用的信息成为急需要解决的问题。
目前,利用文本聚类、关键词提取、自动文摘、信息搜索等计算机技术对文本信息进行处理,再将其直观地呈现给用户是一个较热门的研究方向。基于统计学的聚类算法包括有Fisher提出的COBWEB算法以及Gennari等人提出的CLASSIT算法等[2],但是精确度都不高。首都师范大学的王少鹏等人将LDA算法和TF-IDF相结合,虽然能够较好地利用文本聚类对舆论新闻等进行简单分析[3],但是该方法的数据仅仅来自于网络舆情分析,对其他应用场景的适应性差。对于英文关键词提取的研究,华人科学家ZHANG K等利用支持向量机来建立分类的模型来判断文档中的词是否是关键词,这个方法最大的缺点是需要大量的训练语料,需要大量的人力去进行标注[4]。TRIESCHNIGG D等利用词性和TF-IDF构建SVM模型,用这个生成模型来提取关键词,效果要强于TF-IDF方法,但是这种方法只选择了单词作为关键词,局限性很大[5]。对于中文语言关键词的提取,2008年,方俊等提出了采用词义代替词,来对待选词的语义进行代表以此来提高算法的各项指标[6]。……
登录APP查看全文
