机器学习在多组学数据分析中的应用
2021-11-27孙筱松何宇腾
科技与创新 2021年24期
邱 越,邢 卓,孙筱松,何宇腾
(中南大学湘雅医学院,湖南 长沙 410012)
近年来,对基因组、转录组、蛋白质组、代谢组和脂质组的大规模研究积累了大量数据,使在分子水平上研究疾病成为可能。多组学数据分析旨在结合多个组学数据进行分析,以确定生物过程的机制。多组学数据的综合分析可以帮助科学家了解基因调控的条件或患者特异性机制。在这篇综述中,我们讨论了将各种类型的组学数据组合在一起并使用各种机器学习模型进行分析的挑战、方法及其应用。
1 基于机器学习的多组学数据分析的挑战
多组学通过跨越不同的组织层(例如,来自DNA、RNA、蛋白质、代谢物等)来识别与生物过程相关的分子标记。多组学数据分析面临数据降维、数据异质性与整合的挑战。
1.1 数据降维
在多组学数据的综合分析中,经常会遇到样本数量少,但要研究的变量数量多,造成样本数量不足以获得统计显著结果的情况。例如,在根据DNA甲基化、miRNA表达和基因表达测量(变量)对卵巢癌患者(样本)进行分层时,变量的数量可能大大高于样本的数量(只有几百个患者,但有数千个变量),出现了维度问题。维度问题会使大多数机器学习方法容易过拟合,即在训练数据上非常准确而对测试数据的泛化能力较差。通过降低数据的维度并保持相同数量的样本,可以应用统计技术和机器学习来提取有用的信息。特征提取或特征选择是常用的数据降维方法。特征提取将数据从高维空间投影到低维空间,而特征选择通过仅识别原始特征的相关子集来降低维数。……
登录APP查看全文
