基于随机特征子空间的半监督情感分类方法研究
2012-06-29居胜峰王中卿李寿山周国栋
中文信息学报 2012年4期
苏 艳,居胜峰,王中卿,李寿山,周国栋
(苏州大学 自然语言处理实验室,江苏 苏州 215006)
1 引言
随着www的高速发展,互联网上产生了大量对于人物、事件、产品等进行评论的文本信息。为了处理和分析这些海量的评论信息,情感分析(sentiment analysis)正渐渐发展成为自然语言处理中一项越来越受关注的研究课题[1-3]。目前情感分类的主流研究方法—基于机器学习的方法,大致可以分为三种类型: 无监督学习、监督学习和半监督学习。尽管监督学习方法在情感分类中取得了非常好的效果[4-5],但是监督学习依赖大量的标注样本,而获得大量标注样本的成本代价很高;无监督学习虽然不需要标注样本,但分类效果与监督学习相比还存在一定差距[6-7]。相对而言,半监督学习方法,一种结合少量标注样本和大量未标注样本进行学习的方法[8-10],是前面两种方法的一种折衷。该方法既能有效地减少标注样本带来的开销,又可以避免完全没有标注样本带来的分类效果损失。因此,半监督学习渐渐受到广大研究者的密切关注。
众所周知,协同训练(Co-training)是由Blum和Mitchell[11]提出的一种非常有效的半监督学习方法。该方法的成功运用需满足两个条件: (1)样本可以由两个冗余的条件独立视图表示;(2)每一个视图都能从训练样本中学习到一个强分类器。例如,在网页分类中,网页的正文信息构成一个视图,而网页中超链接信息构成另一个视图[11]。然而,不同于网页文本,普通情感评论文本并没有天然存在的多个视图。……
登录APP查看全文
