APP下载

基于集成改进ELM的蛋白质结晶偏好预测

2015-05-13敖培张纪李明杨百顺

科技创新导报 2015年3期

敖培 张纪 李明 杨百顺

摘 要:由于基于蛋白质结晶的X射线晶体成像技术存在成功率较低的问题,因此引入计算方法筛选容易结晶的蛋白质序列对于节约测定蛋白质序列实现成本意义重大。该文提出一种基于旋转森林的集成极端学习机分类方法,用以提高蛋白质结晶偏好预测的准确性。选择蛋白质序列及序列衍生的信息和蛋白质相关的物理、化学等性质在内的20个特征作为分类特征,采用旋转森林增加集成极端学习机基分类器之间的差异性。实验结果表明,该文方法具有较高预测精度。

关键词:旋转森林 极端学习机 蛋白质结晶

中图分类号:TP311 文献标识码:A 文章编号:1674-098X(2015)01(c)-0023-01

该文选择蛋白质序列及序列衍生的信息和蛋白质相关的物理、化学等性质在内的20个特征作为分类特征,采用旋转森林增加集成极端学习机基分类器之间的差异性,建立了集成改进的极端学习机蛋白质结晶偏好预测模型,以有效提高预测的准确性。

1 极端学习机

极端学习机[1](ELM,Extreme Learning Machine)在随机给定输入权值与神经元参数的基础上,将传统前馈神经网络参数训练问题转化为求解线性方程组,以直接计算输出权值的最小二乘解的方式完成网络训练过程。

2 旋转森林算法

旋转森林[2](ROF,Rotation Forest)主要是对集成分类器的原始样本特征进行处理,通过一定的特征提取变换获得集成所需的新样本,并且在保证分类准确性的前提下,增加集成分类器个体间的差异性。

3 基于ROF的极端学习机集成预测算法

登录APP查看全文