基于共词分析的国内文本挖掘研究*
2021-05-15宋卓远阚乾超陈镱尹杨云帆杨秀璋罗子江
图书馆学刊 2021年4期
宋卓远 阚乾超 赵 凯 陈镱尹 杨云帆 杨秀璋 罗子江
(贵州财经大学信息学院,贵州 贵阳550025)
在信息迅速发展的时代,人们从以往对信息数量的需要转变为对信息质量的需求,而之前较少被人们注重的文本内却包含着海量潜在价值。文本的来源多种多样,有书本、论文、期刊、新闻、邮件、各类网络评论、聊天记录和社交媒体数据等,这些都和人们的生活息息相关。因此对文本进行有效挖掘具有重要价值。
文本挖掘主要是从诸多复杂的文本数据中发掘隐形的、有用的数据模式、内在关联、规律、发展趋势等,从而被个人、企业和机构等进行有效利用[1]。文本挖掘涉及多个领域,可以辅助相关领域的研究,如杨亚楠等[2]基于多视图协同的方式,对政策文本背后规律进行深入分析,证明了该技术框架的有效性;沈健等[3]提出一种基于文本挖掘的生物领域实例获取方法,提高了该领域的文本检索效率;张坤等[4]采用文献计量、社会网络分析等方法,对智慧图书馆文献的外部及内部特征进行分析,并揭示其学科特色和整体格局;李梦杰等[5]利用LDA模型和聚类算法,对某互联网教育平台中课程信息进行研究,有效挖掘出学员所选课程背后隐含的关注点和兴趣点;余本功等[6]基于机器学习和主题模型,对专利摘要进行内容挖掘,并构建出技术创新评价体系;戴德宝等[7]将文本挖掘和机器学习应用到股票数据的分析中,有效提高股指走势预测的精度。
以……
登录APP查看全文
