一种基于PCA的文本特征混合选择方法
2019-10-21张扬武李国和王立梅赵晶明
计算机应用与软件 2019年10期
张扬武 李国和 王立梅 宗 恒 赵晶明
1(中国石油大学(北京)地球物理与信息工程学院 北京 102200)2(中国政法大学法治信息管理学院 北京 102200)3(中国石油大学(北京)石油数据挖掘北京市重点实验室 北京 102200)
0 引 言
随着互联网的快速发展,网络数据量快速增长,数据共享越来越丰富。截至到2017年3月,全世界网民数量达到37亿[1]。过去的几年中,网络为人们创造了各种便利条件。进入大数据时代,信息传播从单一类型逐渐过渡到复合类型,不仅是难以控制,而且也很难确定和捕捉到。一些机构开始为公司提供信息跟踪服务,关注特别领域的话题跟踪的主要工作就是对评价文本进行分类,分类方法有基于规则的和基于统计的。基于规则的方法是按照已有的语法规则来学习一些情感词,在已知情感词的极性基础上加入句法分析,提取情感词所描述的属性[2]。基于规则的分类方法在理解能力、先验知识和迁移能力这些方面不具备优势,理解能力并不是依赖语法就能完成的,同一个词在不同领域中的含义也是不一样的,迁移能力明显达不到人类的水平[3]。近年来,逐渐采用机器学习方法来进行文本分类,这是一类基于统计的方法。机器学习通过从数据中学习模型和经验,让用户获得一个更接近事实和客观的洞察力和解释结果[4]。用于学习的文档集称为语料集,通常分成训练集和测试集两部分。训练集包括那些已经标记好类别的文档,而测试集是为了验证模型性能,包括那些未标记的文档。……
登录APP查看全文
