非小细胞肺癌差异表达基因的生物信息学分析
2021-07-09郑浩然蒋爱民阮之平
郑浩然,蒋爱民,傅 潇,田 涛,梁 璇,阮之平,姚 煜
(西安交通大学第一附属医院肿瘤内科,陕西西安 710061)
肺癌已经成为全世界癌症死亡的主要原因,其发病率和死亡率近年来显著升高[1]。一系列的研究表明,吸烟、空气污染、职业暴露等因素均与肺癌发生有关[2]。所有肺癌患者中,非小细胞肺癌(non-small cell lung cancer, NSCLC)约占肺癌病理分型的85%[3]。早期NSCLC患者接受手术治疗后预后尚可[4]。近年来,尽管NSCLC的早期诊断和治疗取得了较大进展,但其预后仍不容乐观。因此,寻找能够准确预测患者预后的生物标志物至关重要。随着科技的发展,大量基因芯片数据库的建立为研究肺癌差异表达基因(differently expressed genes, DEGs)提供了重要基础。本研究在GEO数据库中选取了GSE19804和GSE33532两个肺癌基因表达谱芯片作为研究数据集,筛选出DEGs并探讨其在NSCLC发生发展过程中的功能及其与患者预后的关系,从而为NSCLC的靶向治疗提供新策略。
1 资料与方法
1.1 芯片数据的选择本研究使用的是来自美国国立生物技术信息中心的GEO数据库(https://www.ncbi.nlm.nih.gov/geo)中的基因芯片数据,系列号分别是GSE19804和GSE33532。其中GSE19804数据集由LU等[5]于2011年发表,收集了60例NSCLC样本和60例正常肺组织样本。GSE33532数据集由MEISTER等于2014年发表,收集了80例NSCLC样本和20例正常肺组织样本。
1.2 方法
1.2.1NSCLC与正常肺组织差异基因的筛选 采用GEO2R(https://www.ncbi.nlm.nih.gov/geo/geo2r/)对NSCLC组织与正常肺组织之间的DEGs进行筛选。利用默认的Benjamini和Hochberg错误发现率方法,调整P值来降低假阳性率。以调整后P<0.05、|log2FC|≥2作为截断标准,运用FunRich3.1.3对两个数据集中的DEGs取交集,最终筛选出共同的DEGs。
1.2.2差异基因的富集分析 采用生物信息注释数据库DAVID(https://david.ncifcrf.gov/)对DEGs进行基因本体(gene ontology, GO)分析及京都基因和基因组百科全……
