基于SVM的以词性和依存关系为特征的句子倾向性判断分析
2012-10-23吴明芬陈涛
五邑大学学报(自然科学版) 2012年4期
吴明芬 ,陈涛
(1. 中国科学院 计算技术研究所,北京 100190;2. 五邑大学 计算机学院,广东 江门 529020)
基于SVM的以词性和依存关系为特征的句子倾向性判断分析
吴明芬1,2,陈涛1,2
(1. 中国科学院 计算技术研究所,北京 100190;2. 五邑大学 计算机学院,广东 江门 529020)
将句法平面词的词性特征、依存关系、依存关系中的词性特征、邻接依存关系、邻接依存关系中的词性特征与倾向性词汇和倾向性搭配作为支持向量机(SVM)分类器的特征集,以句子为单位对多个领域的文本进行倾向性判断. 通过交叉验证的方式,估计出分类器的精度为95.6%,据此提出句子倾向性分析可不以句子倾向性判断为前提.
倾向性判断;依存关系;词性特征;支持向量机
支持向量机(Support Vector Machine,简称SVM)是一种得到广泛应用的有监督的二元分类方法,由Cortes和Vapnik于1995年首先提出[1],对解决小样本、非线性及高维模式识别具有独特的优势.
句子倾向性判断是将文本以句子为单位对其是否包含主观意见和情感进行判断,它可以作为按倾向性对文本分类系统的预处理模块,用来过滤无倾向性的文本;也可以与搜索引擎结合,用以搜索客户对某件商品的评论等倾向性文本.
基于SVM对文本进行句子倾向性判断,首先需要选取特征集. 目前特征集选取主要采用词级特征,有以下 2种方法:1)利用情感/倾向性词典、语料库等识别文本中具有明显倾向性的词(即评价词语)来判断文本倾向性[2-5]. 这种方法对分析显式的倾向性(即含有情感词的文本……
登录APP查看全文