APP下载

基于朴素贝叶斯的新闻分类改进

2018-12-21孙子杰

电子制作 2018年22期
关键词:分类文本模型

孙子杰

(中国人民大学附属中学,北京,100080)

0 引言

随着时代的发展,信息爆炸一词早已不再陌生,互联网上丰富的信息给人们的生活带来诸多方便,例如降低了学习资料获取的成本等;与此同时,信息爆炸的负面性也渐渐的影响着我们的生活,铺天盖地的广告、新闻、信息远远超出我们的接受范围,其中充斥着大量的无用甚至虚假信息。从海量的信息中抽取对自己有用的信息这件事占用了现代人大量的时间,因此,如何高效的进行信息分类成为亟待解决的问题。

常见的信息呈现方式有视频、图片、文本等,本文针对文本信息进行研究。文本分类属于自然语言处理的范畴,自然语言的处理是现阶段研究的热门难题,而汉语结构的复杂性和几千年来汉语中沉淀的人文历史,让汉语文本的分类难上加难。

文本分类作为很常见的热门难题,自然积累了大量的技术实现方法。由于素材和数据集可采集性较高,训练集标记难度不大,现有的文本分类水平也在不断跟进,简单来说,文本分来的过程是通过将文章分段、分词,对词语的词性、词义等进行判断,以小见大达到对整个文章内容进行分类。具体分为基于规则的方法和基于统计的方法。

基于规则的方法是基于研究人员(例如语言学家)对语言的规律进行总结,形成规则形态的知识库,但是由于语言的复杂性,导致很难选取一个规则覆盖所有的语言现象,社交媒体不规范的语言使用习惯也使得基于规则的方法效率较低;……

登录APP查看全文

猜你喜欢

分类文本模型
一半模型
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本