基于Spark的自适应差分进化极限学习机研究
2021-06-27刘黎志邓开巍
杨 敏,刘黎志,邓开巍,刘 杰
智能机器人湖北省重点实验室(武汉工程大学),湖北 武汉430205
自适应差分进化极限学习机(self-adaptive differential evolution extreme learning machine,SaDE-ELM)[1]是由Cao等在2012年提出的一种使用群智能计算改进的极限学习机算法,它将自适应差分进化算法(self-adaptive differential evolution,SaDE)与标准极限学习机算法相结合,从很大程度上解决了标准极限学习机算法中由于随机初始化隐藏层输入权重和偏置导致的算法稳定性不高、预测准确度波动较大的问题,目前已被广泛应用到分类识别[2-4]和回归预测领域[5-7]。随着大数据时代的到来,一个算法能否高效地处理大规模数据集也成为了衡量算法普适性的一个重要指标,为了提升很多传统的机器学习算法的运行效率,如何利用现有的大数据处理框架对其进行并行化也成为目前研究的热点问题[8-10]。SaDE-ELM算法在计算过程中,由于需要多次迭代计算来更新输入层到隐藏层的连接权重和隐藏层偏置,不可避免地增加了算法的运行时间,在数据集规模较大时算法的运行效率十分低下。本文根据SaDE-ELM算法需要迭代计算的特性,采用了基于内存计算的大数据框架Spark对其进行并行化[11-13],将原本在单机上的计算合理地分布到集群的各台机器中,提出了并行自适应差分进化极限学习机(parallel self-adaptive differential evolution extreme learning machine,PSaDE-ELM),最后通过实验验证了在数据集样本数较大时,PSaDE-ELM算法能够在保证预测准确率基本不损失的基础上,显著地提升算法的运行效率。
1 研究背景
1.1 极限学习机
极限学习机(extreme learning machine,ELM)是2004年黄广斌等[14]提出的一种单隐藏层前馈神经网络(single-hidden-layer feedforward neural networks,SLFNs)机器学习算法。……
