APP下载

一种基于SVM的博客大数据分类算法及应用

2016-10-18陈建峡朱季骐王鹰适倪一鸣

湖北工业大学学报 2016年4期
关键词:分类文本

陈建峡, 朱季骐, 王鹰适, 倪一鸣

(1 湖北工业大学 计算机学院,湖北 武汉 430068; 2 湖北泰信科技信息发展有限责任公司, 湖北 武汉 430071)



一种基于SVM的博客大数据分类算法及应用

陈建峡1, 朱季骐1, 王鹰适2, 倪一鸣2

(1 湖北工业大学 计算机学院,湖北 武汉 430068; 2 湖北泰信科技信息发展有限责任公司, 湖北 武汉 430071)

提出了一种基于SVM的博客大数据分类算法BBD-SVM,根据RSS博客文本特点提取博客特征词,通过SVM模型参数寻优化SVM分类模型实现博客大数据分类。并设计了RSS博客爬虫,以互联网上各种计算机程序设计语言的技术博客为爬取对象,利用BBD-SVM算法对相关技术博客进行专业分类,为用户学习程序设计语言提供专业推荐服务。其中,博客文本特征的提取选用改进的TF-IDF作为权重计算函数,SVM分类模型的参数寻优很好地提高了分类效率。实验结果表明,BBD-SVM算法具有准确率高,耗时少的优势,能够实现快速准确的博客推荐服务。

支持向量机;博客;大数据;分类算法;社交网络;用户推荐

目前,博客文本分类方法主要有朴素贝叶斯法、K最邻近(kNN,k-Nearest Neighbor)方法和支持向量机(SVM, Support Vector Machine)方法。朴素贝叶斯法是通过假设各个单词之间两两独立,然后用条件概率模型进行分类。kNN方法是一种基于实例的文本方法,对一个测试文本计算它与训练样本中每个文本的相似度,找出k个最相似的文本,在此基础上给每一个文本类别打分,然后根据打分高低排序分类[1]。SVM方法通过对样本的学习寻找最优分类超平面,然后根据找到的最优分类超平面进行分类。……

登录APP查看全文

猜你喜欢

分类文本
分类算一算
垃圾分类的困惑你有吗
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
给塑料分分类吧
如何快速走进文本