核机器学习方法及其在生物信息学中的应用
2012-07-16牟少敏曹学成
王 蕊,牟少敏,曹学成,苏 平
(1.山东农业大学机械电子与工程学院,山东 泰安 271018;2.山东农业大学信息科学与工程学院,山东 泰安 271018)
机器学习(Machine Learning)是根据训练样本找出输入/输出数据之间的相互依赖关系估计,对未知的输出样本做出尽可能准确的预测或分类[1]。目前,随着计算机技术的飞速发展,数据的采集速度和存储技术都有了极大的提高,产生了各种大量的数据信息,需要人们对其进行合理的预测或分类,为科学决策提供有力的依据。因此,机器学习的研究具有非常重要的意义。而基于核的机器学习方法(简称:核方法)则以其优越的性能吸引了众多研究人员的关注,成为机器学习领域的研究热点之一。
核方法理论的研究工作可以追溯到1909年,Mercer首先在泛函分析中提出了再生核(Mercer核)和再生核Hilbert空间[2]。1950年,Aronszajn等人对其进行了进一步研究和完善[3]。1964年,Aizerman等人将再生核技术用于学习理论的证明[4]。1995年,统计学习理论的创始人Vapnik利用“核技巧”(Kernel trick),即通过在特征空间中引入核函数代替内积,构建了一种基于统计学习理论的核方法—支持向量机(Support Vector Machine,SVM)[1,5]。该方法广泛地应用于图像处理、文本分类和网络安全等领域[49],推动了核理论和核机器学习研究工作进一步地深入开展。
近年来,国内外研究人员相继提出了许多不同的核方法以及针对支持向量机的改进算法,使得核理论不断地完善,核方法的应用领域不断拓展。1998年,Sch·lkopf等人对线性主成分分析(Linear Principal Component Analysis,LPCA)方法进行核化,得到了相应的核主成分分析(Kernel Principal Component Analysis,KPCA)方法[6]。……