基于FASTmrEMMA、最小角回归和随机森林的全基因组选择新算法
2021-03-29孙嘉利吴清太温阳俊张瑾
孙嘉利,吴清太,温阳俊,张瑾
(南京农业大学理学院,江苏 南京 210095)
许多动植物的重要性状和人类的复杂疾病都是数量性状,检测、发掘与数量性状关联的基因并进行全基因组选择,对动植物的性状分析及人类疾病的预防和治疗都具有重要意义[1-5]。全基因组选择(genomic selection,GS)又称全基因组预测(genomic prediction,GP),它是Meuwissen等[6]提出的一种利用全基因组高密度分子标记数据及原始训练群体表型数据建立预测模型,估计每个分子标记遗传效应,从而预测个体全基因组育种值(genomic breeding value,GBV)的方法。由于GS无需鉴定与目标性状显著关联的位点,即使微效标记也都能被捕获,只需个体遗传信息即可计算其育种值,这大大缩短了育种周期,目前已广泛应用于动植物的全基因组选择[7-10]。
近年来,研究人员陆续提出了许多GS方法,例如,应用广泛的最佳线性无偏预测(best linear unbiased prediction,BLUP),它是基于系谱信息来定义个体间亲缘关系矩阵,校正环境和非随机交配造成的偏差,从而提供个体育种值的无偏估计值。GBLUP(genomic BLUP)[11]是利用全基因组遗传标记计算遗传关系矩阵来预测表型缺失值。RR-BLUP(ridge regression BLUP)[6]是利用压缩估计获得标记效应来进行全基因组预测,但可能会被过度压缩。BayesA和BayesB[6]可以有效弥补RR-BLUP的不足,它们假设每个标记效应服从先验分布,其中BayesB的先验分布为混合分布。此外,还有BayesC[12]、Bayesian LASSO[13]等方法。上述GS大多基于压缩估计方法,其计算速度会随着数据维度的增加而受到限制,不适用于现代测序技术产生的海量遗传标记数据,且尚未考虑群体结构和多基因背景,从而影响全基因组预测的准确度。……
