基于NewTF-IDF的新闻文本特征提取算法研究
2021-06-05闫思贤
湖北民族大学学报(自然科学版) 2021年2期
关键词:文本
黄 敏,闫思贤
(1.郑州轻工业大学 软件学院,郑州 450002; 2.郑州轻工业大学 计算机与通信工程学院,郑州 450002)
在互联网时代,电视或者网络平台增长速度较为迅速,在这些平台中,可以获取到的新闻文本数据量巨大[1].在国内外,每天发生的事件不计其数,每个人关注热点又各有差异,因此在平台中每天都在更新不同的新闻数据,引起新闻数据暴涨,使得新闻数据逐渐繁杂且冗余.若要对大批量的新闻文本数据逐条分类,无疑是复杂且低效的工作[2].因此,针对新闻文本的特征词提取算法,在学术界逐渐崭露头角.例如:蔡中祥等[3]提出了一种融合指针网络的自动文本摘要模型,实现新闻数据的标题的自动生成;Hakak Saqib等[4]提出一种基于有效特征提取的集成机器学习方法,实现对假新闻的分类;Patidar等[5]采用TF-IDF和相似度权重的方法实现混合新闻的推荐;Zhuo Zhuo等[6]在Spark上采用TF-IDF算法对新闻的文本主题进行聚类优化;等.综上可知,针对新闻文本分类的研究吸引较多学者关注,并且新闻文本数据存在量较大,获取时较为简便[7],为文本分类研究提供非常大的便利.但是,在基于传统TF-IDF文本分类研究中,针对关键字的提取,只能简单地将词频和逆文档频率挂钩,忽略关键词的其他特征,进而可能会使关键词的提取不精确[8-10].此外,在分类过程中常遇到判别条件缺乏的情况,因此将导致文本分类准确率降低[11-13].基于上述分析,针对文本关键字获取不精确、判别条件缺乏等问题,本文提……
登录APP查看全文
