一种基于SVM的博客大数据分类算法及应用
2016-10-18陈建峡朱季骐王鹰适倪一鸣
陈建峡, 朱季骐, 王鹰适, 倪一鸣
(1 湖北工业大学 计算机学院,湖北 武汉 430068; 2 湖北泰信科技信息发展有限责任公司, 湖北 武汉 430071)
一种基于SVM的博客大数据分类算法及应用
陈建峡1, 朱季骐1, 王鹰适2, 倪一鸣2
(1 湖北工业大学 计算机学院,湖北 武汉 430068; 2 湖北泰信科技信息发展有限责任公司, 湖北 武汉 430071)
提出了一种基于SVM的博客大数据分类算法BBD-SVM,根据RSS博客文本特点提取博客特征词,通过SVM模型参数寻优化SVM分类模型实现博客大数据分类。并设计了RSS博客爬虫,以互联网上各种计算机程序设计语言的技术博客为爬取对象,利用BBD-SVM算法对相关技术博客进行专业分类,为用户学习程序设计语言提供专业推荐服务。其中,博客文本特征的提取选用改进的TF-IDF作为权重计算函数,SVM分类模型的参数寻优很好地提高了分类效率。实验结果表明,BBD-SVM算法具有准确率高,耗时少的优势,能够实现快速准确的博客推荐服务。
支持向量机;博客;大数据;分类算法;社交网络;用户推荐
目前,博客文本分类方法主要有朴素贝叶斯法、K最邻近(kNN,k-Nearest Neighbor)方法和支持向量机(SVM, Support Vector Machine)方法。朴素贝叶斯法是通过假设各个单词之间两两独立,然后用条件概率模型进行分类。kNN方法是一种基于实例的文本方法,对一个测试文本计算它与训练样本中每个文本的相似度,找出k个最相似的文本,在此基础上给每一个文本类别打分,然后根据打分高低排序分类[1]。SVM方法通过对样本的学习寻找最优分类超平面,然后根据找到的最优分类超平面进行分类。……
