高维生物医学数据变量筛选方法的模拟研究
2021-07-09王静娴李业棉杨嵛惠陈方尧
西安交通大学学报(医学版) 2021年4期
王静娴,赵 芃,李业棉,杨嵛惠,陈方尧
(西安交通大学医学部公共卫生学院流行病与卫生统计学系,陕西西安 710061)
近年来,随着生物医学检验检测技术的发展,研究中生物医学数据的积累呈现指数级别的增长,尤其是在组学研究领域,测序技术的发展实现了基因、蛋白质等大规模组学数据的测量和积累。常规的统计分析中,在进行多变量分析时,往往要求自变量的数量和样本量成一定的比例[1]。然而,在实际研究中,特别是涉及组学分析的相关研究中,研究所关注的自变量数量往往远大于其收集的样本量数量,这类自变量的数量p远大于样本量n,即p>>n的数据被称为高维数据[2]。目前,高维数据分析被广泛应用于生物医学研究的各个领域,如计算生物学研究、组学研究、危险因素筛选和预后模型建立等。如何从海量的高维数据中提取有用的信息,筛选出最关键的研究变量,是高维数据分析研究中的重点和热点问题。
由于在高维数据的分析中存在许多假定条件,且高维数据本身的统计性质复杂,因此,在高维数据的分析中,虽然存在许多可选方法,但对于各个方法的实际效果,并没有公认的一致评价。本研究旨在通过Monte Carlo 模拟的方法,评估几种常用方法在高维数据变量筛选中的效果,为制定特定条件下高维生物医学数据的变量筛选策略提供依据。
1 材料与方法
常规的统计建模方法中,常要求数据中的变量数量(成一定比例的)小于样本量数量,且自变量间不存在或仅存在很弱的相关性。但是……
登录APP查看全文
