APP下载

基于最近邻区间的不完整基因表达数据多目标聚类算法

2021-07-29常巧珍,曹隽喆,顾宏,李丹

大连理工大学学报 2021年4期

常 巧 珍,曹 隽 喆,顾 宏,李 丹

(大连理工大学 控制科学与工程学院,辽宁 大连 116024 )

0 引 言

随着高通量DNA微阵列检测技术的发展,数量庞大的基因相关数据相应而生.基因表达数据反映了直接或间接测量得到的基因转录产物mRNA 在细胞中的丰度[1],阐明隐藏在这些数据中的模式,从中获取细胞的生理状态、基因表达调控信息以及基因功能,对功能基因组学的研究有着重要的意义.然而,数量庞大的基因和复杂的生物网络成为理解和解释这些数据的巨大挑战,基因聚类能够有效识别共表达基因,推断尚未确定功能基因的表达模式,进而有助于理解基因功能、基因调控及细胞过程[2-3].

在基因表达数据的获取过程中,受设备、实验环境、采集方法等因素影响,很多数据不可避免地存在缺失值[4],其填补准确度在一定程度上影响了最终的聚类效果.现有的针对不完备基因表达数据的聚类算法通常为“两阶段”算法[5],即将缺失值填补作为数据预处理过程,在填补后的数据集上进行聚类,是基因表达数据集聚类分析的常用方法.基因表达数据缺失值预处理的常用方法有:采用均值法计算缺失值对应样本下所有完整表达值的均值作为填补值(Meanimpute)[6];根据表达值不完整基因的k个完整近邻基因进行缺失值加权估计填补(k-nearest neighbor impute,KNNimpute)[7];Oba等利用贝叶斯主成分分析法(Bayesian principal component analysis,BPCA)处理基因表达数据中的缺失值[8];Buuren等则将多重填补法(multivariate imputation by chained equations,MICE)应用于基因表达数据集[9];Kim等依据皮尔逊相关系数提出了采用多元线性回归模型的局部最小二乘法填补缺失值[10];……

登录APP查看全文