基于自训练的回归算法
2017-03-21仝小敏
中国电子科学研究院学报 2017年5期
关键词:模型
仝小敏, 吉 祥
(中国电子科学研究院,北京 100041)
0 引 言
回归算法是一种统计学上分析数据的方法,主要是研究数据之间是否存在一种特定关系,从而建立自变量和因变量之间关系的模型,然后利用该模型对测试样本的因变量进行预测。由于科学研究中经常涉及对历史数据样本的分析和对新数据进行预测,所以回归算法在机器学习[1]、计算机视觉[2]、大脑数据分析[3-4]等许多方面具有广泛的应用。
传统的回归算法主要是利用训练集中样本的自变量和因变量训练回归模型,然后利用训练好的回归模型和测试集中样本的自变量预测得到测试样本的因变量,如图1所示。但是该回归模型只利用训练集中样本的信息,没有充分利用测试集中样本的信息,特别是当训练集中样本数量较少时,回归模型不能得到充分的训练,无法预测得到满意的结果,因此,本文提出一种基于自训练(self training[5])的回归算法,将第一次回归预测得到的置信度较高的测试样本加入到训练集中重新训练回归模型,完成回归模型的自我训练,从而使得回归模型得到充分的训练,对测试样本的因变量预测更加准确。
1 基于自训练的回归算法
本文提出的自训练回归算法亮点是加入了自训练的过程,下面将针对这一自训练反馈过程进行阐述:
本文利用两个回归算法:双高斯过程回归和LS-SVM对训练样本同时进行训练,将训练好的回归模型分别用于测试样本的预测中,对预测得到的样本进行置信度计算,将两者预测得到的置信度都高的测试样本加入到训练集中重新进行回归模型的训练,然后用新得到的回归模型重新对测试样本进行预测。……
登录APP查看全文
