一种基于树的蛋白质功能预测算法:KDE–CSSA
2015-07-13陈义明贺细平乔波
陈义明,贺细平,乔波
(湖南农业大学信息科学技术学院,湖南 长沙 410128)
高通量的现代分子生物学实验产生了大量基因和蛋白数据,如基因和蛋白质序列、微阵列和蛋白质互作数据等。利用这些数据和已知蛋白质功能注释推断新蛋白质的功能,为生物学家提供实验参考已成为生物信息学研究的一项重要而紧迫的任务。笔者针对在每个标签类上直接学习分类模型计算代价高和树层次中低层结点训练数据扭曲的问题,提出了一种基于树层次的蛋白质功能预测算法:核依赖估计–压缩排序选择算法(KDE–CSSA)。
1 问题描述
生物学家已将各种蛋白质功能进行了分类整理,它们被组织成1 种层次结构。典型的有MIPS (Munich information center for protein sequences)数据库将所有功能组织成树层次结构[1],而gene ontology则组织成有向无环图(DAG directed acyclicgaph)[2]结构。2 种组织结构分别如图1–a,b 所示。一个蛋白质可能同时标记具有多个功能,笔者主要讨论基于树 层次结构的蛋白质功能预测问题。

图1 蛋白质功能的2种组织结构 Fig. 1 Two hierarchy structures of protein function
对每一个蛋白质,可以用实验所得的特征数据将它描述为一个特征向量xi,如果使用d个功能标签,则它的注释可以表示为一个d 维0,1 向量。假设需要从n个已知蛋白质功能注释预测新的蛋白质功能,从机器学习的角度看,需要从训练数据学习分类预测模型,用来对未知蛋白质功能进行预测,机器学习领域称此为多标签分类问题。此外,预测结果还要满足树层次结构约束(T –property),即如果1个标签结点标记为1,则它的所有祖先结点都应该标记为1。……