APP下载

一种基于PCA的文本特征混合选择方法

2019-10-21张扬武李国和王立梅赵晶明

计算机应用与软件 2019年10期
关键词:分类特征文本

张扬武 李国和 王立梅 宗 恒 赵晶明

1(中国石油大学(北京)地球物理与信息工程学院 北京 102200)2(中国政法大学法治信息管理学院 北京 102200)3(中国石油大学(北京)石油数据挖掘北京市重点实验室 北京 102200)

0 引 言

随着互联网的快速发展,网络数据量快速增长,数据共享越来越丰富。截至到2017年3月,全世界网民数量达到37亿[1]。过去的几年中,网络为人们创造了各种便利条件。进入大数据时代,信息传播从单一类型逐渐过渡到复合类型,不仅是难以控制,而且也很难确定和捕捉到。一些机构开始为公司提供信息跟踪服务,关注特别领域的话题跟踪的主要工作就是对评价文本进行分类,分类方法有基于规则的和基于统计的。基于规则的方法是按照已有的语法规则来学习一些情感词,在已知情感词的极性基础上加入句法分析,提取情感词所描述的属性[2]。基于规则的分类方法在理解能力、先验知识和迁移能力这些方面不具备优势,理解能力并不是依赖语法就能完成的,同一个词在不同领域中的含义也是不一样的,迁移能力明显达不到人类的水平[3]。近年来,逐渐采用机器学习方法来进行文本分类,这是一类基于统计的方法。机器学习通过从数据中学习模型和经验,让用户获得一个更接近事实和客观的洞察力和解释结果[4]。用于学习的文档集称为语料集,通常分成训练集和测试集两部分。训练集包括那些已经标记好类别的文档,而测试集是为了验证模型性能,包括那些未标记的文档。……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征