癌症基因组学相关数据管理与应用探析
2016-03-21,,,
,, ,
美国癌症基因组图谱(The Cancer Genome Atlas, TCGA)计划历经10年完成了阶段性任务[1],推动了癌症基因组学研究的发展,为大规模癌症基因组学研究计划的实施提供了参考。2006年,在美国国立卫生研究院(National Institutes of Health,NIH)的组织领导下,美国国立癌症研究所(National Cancer Institute,NCI)和国立人类基因组研究所(National Human Genome Research Institute,NHGRI)联合启动了癌症基因组图谱计划[2]。该计划旨在通过大规模收集特定癌症患者的临床信息、影像信息、肿瘤组织及部分对应的正常组织样本,对其进行全面的基因组数据分析,从而获得一个全面的癌症基因组“图谱”,找到癌症相关的基因组变异并为其编制目录,实现数据共享,促进癌症的早期诊断和精准治疗,并预防癌症的发生。
本文将从TCGA计划的数据管理相关机构、工作流程、数据分类及开放共享、数据应用等方面对TCGA进行调研,为建立和完善大型的开放癌症基因组学数据库及其数据开放和利用提供参考借鉴。
1 癌症基因组数据管理
1.1 数据管理相关机构
TCGA计划涉及多个负责数据收集和处理分析的相关机构(图1),具体包括组织样本采集站(Tissue Source Sites,TSSs)、样本处理中心(Biospecimen Core Resource,BCR)、基因组测序中心(Genome Sequencing Centers,GSCs)、基因组特征研究中心(Genome Characterization Centers,GCCs)、数据调度中心(Data Coordinating Center,DCC)、癌症基因组中心(Cancer Genomics Hub,CGHub)和基因组数据分析中心(Genome Data Analysis Centers,GDACs)等[2],其工作流程基本如下。

图1 美国癌症基因组图谱数据管理数据流[2]
组织样本处理:组织样本采集站(TSSs)收集志愿者的生物样本(肿瘤组织和正常组织)及临床元数据并提交给样本处理中心(BCRs),样本处理中心(BCRs)从样本中提取待分析的物质(DNA、RNA、蛋白质等),并检测以达到数量和质量的要求,同时为样本编码并去除患者隐私信息。……
