网页分类中特征选择方法的研究
2016-09-13唐喆曹旭东
电子设计工程 2016年5期
唐喆,曹旭东
(中国石油大学(北京)地球物理与信息工程学院,北京 102249)
网页分类中特征选择方法的研究
唐喆,曹旭东
(中国石油大学(北京)地球物理与信息工程学院,北京102249)
准确的网络分类对于健康的网络环境至关重要,本文基于这样的目的,采用了效果理想SVM分类技术,考虑到不同的特征选择方法造成的分类结果的差异,分别在相同和不同的分类样本的条件下测试了4种特征选择方法,研究得出TFIDF方法的突出优点,并总结了合适的特征选择方法对于应用到不同的分类系统的重要性。
文本分类;SVM;特征选择;TFIDF
支持向量机SVM[1]是一种可训练的机器学习方法,它对小样本进行学习,得到一个分类函数,再将待测文本代入此分类函数中判定文本所属的类别。SVM的特点是:SVM可以通过映射把低维样本空间映射到高维特征空间中,成功地将非线性可分问题转化为线性可分的问题,并且在特征空间中构造线性函数,实现对文本的自动分类。SVM将非线性问题转化成线性可分问题,巧妙地解决维灾难和过学习现象。特征选择是整个分类模块中的重要部分,选择合适的特征提取方法对分类的效果有很大的影响。
1 分类算法比较
如表1,从表1的结果可以得出:选择每一种分类算法的时候要从样本量的大小、样本数据的维度、样本数据的线性可分情况3种情况来考虑,对不同形式的训练样本采用不同的分类算法会大大提高分类的效率和准确率,节省开销。……
登录APP查看全文
