基于不平衡文本分类的改进Stacking模型*
2021-09-15赵礼峰
计算机与数字工程 2021年8期
蒋 瑶 赵礼峰
(南京邮电大学理学院 南京 210023)
1 引言
如今,我们生活在一个信息驱动的时代,人们不仅从社会、生活的环境中获得信息,更多的信息来自于网络这片海洋里[1]。随着互联网的飞速发展,人们慢慢倾向于在网络上阐述观点和表达情感,从网络上的言论中获取信息。以脸书(Facebook)、微博、微信等为代表的社交平台和以亚马逊、淘宝为代表的电子商务平台上的评论迅速增多,所蕴含的信息量也非常多。从大量评论中挖掘出其蕴含的态度或情绪信息是迫切需要的,因为从一个商品的评价中,卖家和买家可以做出决策;在各大网站上的评论有助于政府的舆情监控。
文本分类就是从文本中获取信息,进而对信息进行分析处理,挖掘出更为重要的知识。文本分类分为两个部分:特征工程和分类器,特征工程是将数据变为信息的过程,是最为耗时耗力的,却又相当重要的过程[2]。DF(词频)、CHI(卡方检验)、IG(信息增益)、ECE(期望交叉熵)等常常被用来作为特征选择的依据[3]。Bao Guo等[4]运用TF-IDF将文本分词后向量化作为文本的特征进行分类。牛玉霞[5]对特征选择算法IG进行改进,并与DF进行了结合,提取了更为重要的特征用以文本分类,提高了文本分类的精度。文本分类的另一部分分类器是将信息变为知识,即我们所想得到的结果,前人对文本分类采用的分类器算法不断更新,使得文本分类的预测效果越来越好。Peixin Liu等[6]将朴素贝叶斯(Naïve Bayesian)作为分类器对短文本进行分类取得了很好的效果。……
登录APP查看全文
