APP下载

并行SVM算法在Flink平台的应用研究

2021-05-10白玉辛刘晓燕

小型微型计算机系统 2021年5期
关键词:模型

白玉辛,刘晓燕

(昆明理工大学 信息工程与自动化学院,昆明 650500)

1 引 言

大数据时代背景下,信用卡交易、传感器测量、机器日志、网站或移动应用程序上的用户交互等各种类型的数据都是作为事件流产生的,传统数据挖掘算法处理这些大规模数据集的能力出现瓶颈,因此需要将传统数据挖掘算法和现有大数据框架进行结合,改变传统数据挖掘算法无法高效处理大规模数据集的现状.支持向量机[1](Support Vector Machine,SVM)基于统计学习理论,在模式识别、文本分类和图像识别等众多领域表现出优异实践性能的机器学习算法.SVM相比较其他常用的数据挖掘算法而言,在算法训练过程中很少会出现过度拟合、属性特征过多造成的维数灾难对算法性能影响微乎其微、对核函数运用巧妙,可以让算法处理数据集线性不可分的情况.但是,当传统SVM算法处理大规模数据集时,会出现训练速度慢,内存溢出,运行崩溃等性能低下问题[2-4].

针对传统单机SVM算法面对大规模数据集处理效率低下等问题,最近几年数据挖掘领域的专家主要使用两种方法改进传统支持向量机算法:1)采用“分而治之”的思想处理大规模数据集,该思想是将一个完整的数据集切分成若干训练子集,在每一个训练子集上训练局部支持向量并剔除大量非样本边界样本点,使其并行训练,达到算法并行化训练的目的;2)利用GPU或FPGA强大的矩阵运算能力来提高收敛速度.如Li等人[5]基于GPU设备设计实现……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用