基于集成分量的基因微阵列数据分类方法的研究
2012-09-26宋红胜
宋红胜,孔 薇
(上海海事大学 信息工程学院,上海 201306)
自Golub等于1999年开创了基于基因表达谱的肿瘤分类领域以来,研究者已经提出许多基于基因表达谱的分类方法,这一领域也迅速成为生物信息学的主要研究方向之一,如,人 工 神 经 网 络 (Artificial Neural Network,ANN)、 贝 叶 斯(Bayesian)、决策树(Decision Tree)和支持向量机机(Supporting Vector Machine,SVM)等经典的分类器。由于微阵列数据集高维、小样本和高噪声等特点,对建立高精度的分类模型提出了挑战,而且基于实验表明不同的分类器对同一数据集分类效果不同,即使对同一数据集运用同一种分类器分析,随着提取特征基因的不同,实验结果会有很大差别。因此,为了提高分类模型的分类性能、稳定性以及泛化能力,研究人员把很多分类器集成起来,并采用某种决策策略对多个分类器的分类结果进行判定以决定最终的分类结果。
自从Sebestyen于1962年在其书中提出层叠多分类器集成系统的设计思路以来,集成分类系统的研究直到90年代才受到重视,许多学者也纷纷加入对其的研究,如Hansen和Salamon通过投票法将所有的神经网络结合起来解决问题,发现其性能比最好的个体神经网络的性能还好[1];Schapire也在自己的论文中证明了通过构建多分类器集成系统,弱分类器可以与强分类器等价[2];并且研究者也设计不少优秀的集成系统算法,如 Bagging、Boosting、AdaBoost、Random Forest、Rotation Forest、Wagging和Arcing等,这些方法已经被广泛应用于生物信息学等各个领域中。
从不同的角度可以得到不同的集成分类器方法,由于这些方法所选择的分……
