APP下载

基于SVM的大学生热点问题的研究

2016-07-01作者杨世瀚李婷婷

电子制作 2016年9期
关键词:分类文本大学生

作者 / 杨世瀚、李婷婷



基于SVM的大学生热点问题的研究

作者 / 杨世瀚、李婷婷

基于SVM(Support Vector Machine)分类器来建立大数据的文本分类机制是目前的热点研究之一。针对于怎样将SVM应用到大学生网络社区文本数据的分析,并从中挖掘出大学生热点问题,是SVM应用的一个新尝试。利用SVM可以在大规模的网络社区文本数据中得出准确的训练模型以及预测结果,在此基础上给出了特征向量构造以及有效选取SVM参数的方法,同时给出了剔除重复样本的策略,最后还会研究特征选择对SVM分类效率的影响。

SVM;大数据;网络社区文本数据;文本分类

引言

基于SVM分类器来研究大学生热点问题是一个新的尝试。从网络上获取的网络社区文本数据是相当庞大的,针对这类文本数据的分类也是比较少见的。SVM具有很好的泛化能力和出色的分类性能,将SVM用于网络社区文本数据的分类并以此来研究大学生热点问题是可行的。

1. SVM基础

在机器学习领域,支持向量机SVM(Support Vector Machine)是一个有监督的学习模型,通常用来进行模式识别、分类、以及回归分析。

SVM进行分类的步骤有:样本整理、特征选择、计算特征权重、模型训练与预测[1]。

从数据库中提取已预处理的文本,将样本标签设定为-1和1。然后根据地理、人文差异将大学生网络社区数据的文本分为两类,-1为来自北方的大学,1为来自南方的大学。

SVM进行特征选择,就是将特征的个数限制在一个合理的范围内,即确定特征集。特征选择就是从特征集中选择一些代表性的词。……

登录APP查看全文

猜你喜欢

分类文本大学生
分类算一算
在808DA上文本显示的改善
带父求学的大学生
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
大学生之歌
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
让大学生梦想成真
他把孤儿院办成大学生摇篮