APP下载

基于MapReduce和上采样的两类非平衡大数据集成分类

2018-06-28翟俊海张明阳王陈希刘晓萌王耀达

数据采集与处理 2018年3期
关键词:分类实验方法

翟俊海 张明阳 王陈希 刘晓萌 王耀达

(1.河北省机器学习与计算智能重点实验室,保定,071002; 2.河北大学数学与信息科学学院,保定,071002; 3.河北大学计算机科学与技术学院,保定,071002)

引 言

随着计算机网络、数据存储、云计算和社会计算等技术的快速发展,数据正以前所未有的速度在不断地增长和积累,大数据处理已经成为学术界和工业界密切关注的问题。大数据是指具有海量(Volume)、多模态(Variety)、变化速度快(Velocity)、蕴含价值高(Value)和可靠性高(Veracity)“5V”特征的数据[1-3]。目前,针对大数据分类的研究主要集中在如何处理大数据量上。解决问题的主流思路包括两种:(1)并行化或分布式方法;(2)基于采样技术的方法。在第一种方法中,由于MapReduce编程模型的盛行,大数据分类的并行化或分布式方法基本上都是基于这种编程模型而提出的。例如,Bechini等利用MapReduce编程模型对著名的关联规则挖掘算法FP-Growth进行并行化,以实现从大数据中挖掘关联规则[4]。Zhang等将深度学习和MapReduce结合起来,提出了受限波尔兹曼机的分布式学习框架[5],可实现大数据环境中的深度学习。钱宇华等对大数据关联关系度量研究进行了全面的综述[6],具有较高的参考价值。吴启晖等对面向频谱大数据处理的机器学习方法进行了总结,分析了它们各自的特点[7]。吉根林和赵斌综述了时空轨迹大数据模式挖掘与知识发现领域的研究进展[8]。亓峰等对未来大数据环境下的配用电通信网虚拟网络架构及应用进行了研究[9]。第二种方法利用采样技术从大数据集中选择一个子集代替原来的大数据集进行分类。……

登录APP查看全文

猜你喜欢

分类实验方法
记一次有趣的实验
分类算一算
做个怪怪长实验
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼