APP下载

基于NewTF-IDF的新闻文本特征提取算法研究

2021-06-05闫思贤

关键词:文本

黄 敏,闫思贤

(1.郑州轻工业大学 软件学院,郑州 450002; 2.郑州轻工业大学 计算机与通信工程学院,郑州 450002)

在互联网时代,电视或者网络平台增长速度较为迅速,在这些平台中,可以获取到的新闻文本数据量巨大[1].在国内外,每天发生的事件不计其数,每个人关注热点又各有差异,因此在平台中每天都在更新不同的新闻数据,引起新闻数据暴涨,使得新闻数据逐渐繁杂且冗余.若要对大批量的新闻文本数据逐条分类,无疑是复杂且低效的工作[2].因此,针对新闻文本的特征词提取算法,在学术界逐渐崭露头角.例如:蔡中祥等[3]提出了一种融合指针网络的自动文本摘要模型,实现新闻数据的标题的自动生成;Hakak Saqib等[4]提出一种基于有效特征提取的集成机器学习方法,实现对假新闻的分类;Patidar等[5]采用TF-IDF和相似度权重的方法实现混合新闻的推荐;Zhuo Zhuo等[6]在Spark上采用TF-IDF算法对新闻的文本主题进行聚类优化;等.综上可知,针对新闻文本分类的研究吸引较多学者关注,并且新闻文本数据存在量较大,获取时较为简便[7],为文本分类研究提供非常大的便利.但是,在基于传统TF-IDF文本分类研究中,针对关键字的提取,只能简单地将词频和逆文档频率挂钩,忽略关键词的其他特征,进而可能会使关键词的提取不精确[8-10].此外,在分类过程中常遇到判别条件缺乏的情况,因此将导致文本分类准确率降低[11-13].基于上述分析,针对文本关键字获取不精确、判别条件缺乏等问题,本文提……

登录APP查看全文

猜你喜欢

文本
重点:论述类文本阅读
重点:实用类文本阅读
初中群文阅读的文本选择及组织
作为“文本链”的元电影
在808DA上文本显示的改善
“文化传承与理解”离不开对具体文本的解读与把握
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
从背景出发还是从文本出发
如何快速走进文本