癌症研究中RPPA数据的统计分析*
2015-06-07罗冬梅覃跃海
乙 了,罗冬梅,覃跃海
(1.广东第二师范学院数学系,广东广州510303;2.安徽工业大学数理科学与工程学院,安徽马鞍山243002)
癌症基因图谱计划 (The Cancer Genome Atlas,TCGA)是一项从2005年开始的项目,使用基因组测序技术和生物信息学的方法来研究与癌症有关的基因突变,将他们辨析、标识以及归类。在人类与癌症的对抗中,癌症基因图谱计划使用高通量的基因组分析技术使人类从基因的角度更好地了解癌症,如相关基因的位置、序列、变异表达等,从而提升癌症的诊断,治疗以及预防能力[1]。
TCGA数据平台 (TCGA Data Portal,https://tcga-data.nci.nih.gov/tcga/)为研究者提供了一个搜索下载分析TCGA数据的平台,它包括了临床信息,基因组鉴定数据以及癌症基因组高通量测序数据。TCGA数据类型有以下几种:
1)临床数据:临床数据、生物样本数据、病理学报告;
2)图像数据:诊断图像、组织图像、放射图像;
3)微卫星不稳定 (MSI);
4)DNA测序数据:全外显子序列,全基因组序列,突变;
5)miRNA测序数据:miRNA序列,miRNA,异构体;
6)蛋白表达数据;
7)mRNA测序数据:mRNA序列,外显子,基因,剪接点,异构体;
8)基于阵列的表达数据:基因,外显子,miRNA;
9)DNA甲基化数据:亚硫酸盐测序,阵列数据;
10)拷贝数数据:SNP,阵列,低通量DNA测序。
由癌症基因图谱计划网络产生的归总数据都可以免费获得,广泛被各个癌症研究群体所使用[2]。其中,大规模的蛋白表达量数据,即反相蛋白阵列数据是以前所没有的。癌症相关蛋白表达量数据被研究者广泛应用于癌症研究当中,包括蛋白标记的研究,蛋白相互关系网络的研究[3]。本文着重利用一些常见的统计方法对癌症基因图谱计划的蛋白表达数据进行分析,来发现不同癌症间蛋白表达量的差异,特定蛋白在不同癌症中的表达特点,以及如何通过建模提高临床诊断的效率和降低检验的成本。……
