基于随机森林的产品垃圾评论识别
2015-04-21何珑
中文信息学报 2015年3期
何 珑
(1. 福州大学信息化建设办公室,福建 福州 350108; 2. 福建省超级计算中心,福建 福州 350108)
基于随机森林的产品垃圾评论识别
何 珑1,2
(1. 福州大学信息化建设办公室,福建 福州 350108; 2. 福建省超级计算中心,福建 福州 350108)
目前的产品垃圾评论识别方法只考虑评论特征的选取,忽略了评论数据集的不平衡性。因此该文提出基于随机森林的产品垃圾评论识别方法,即对样本中的大、小类有放回的重复抽取同样数量样本或者给大、小类总体样本赋予同样的权重以建立随机森林模型。通过对亚马逊数据集的实验结果表明,基于随机森林的产品评论识别方法优于其他基线方法。
产品垃圾评论;不平衡问题;随机森林
1 引言
近几年,互联网在很大程度上改变了消费者的消费观以及消费意见的反馈途径,网上购物倍受青睐[1]。同时,很多商业网站让他们的顾客在购买产品时对该产品进行评论,以获取对产品有价值的信息。这些观点信息同样对其他潜在用户至关重要。
由于网络的开放性,人们可以在网站上任意书写评论,这导致评论的质量低下,甚至产生垃圾评论,即由一些用户蓄意发表的不切实际、不真实的、有欺骗性质的评论,其目的是为了提升或者诋毁某一产品或某一类产品的声誉,从而误导潜在消费者,或者干扰评论意见挖掘和情感分析系统的分析结果[2]。近几年,国内外针对产品垃圾评论展开了广泛的工作。文献[2-5]在考虑评论文本、产品描述、用户评分、用户投票等信息下,对产品垃圾评论进行识别,并据此总结出识别规则,但这类方法忽略了数据集的不平衡问题,识别精度有待进一步提高。……
登录APP查看全文
