基于文本挖掘筛选COVID-19症状相关核心基因及分析潜在药物
2021-07-04李俊玲何太平王晓辉杨峥嵘广东医科大学公共卫生学院广东东莞52808广东医科大学公共卫生学院广东湛江52402深圳市疾病预防控制中心广东深圳508055
李俊玲,何太平,王晓辉,杨峥嵘 (1.广东医科大学公共卫生学院,广东东莞 52808;2.广东医科大学公共卫生学院,广东湛江 52402;.深圳市疾病预防控制中心,广东深圳 508055)
SARS‑CoV‑2是于2020年1月通过基因测序确定的一种新型冠状病毒,该病毒引起新型冠状病毒肺炎(COVID‑19),简称“新冠肺炎”,并造成了世界范围的广泛流行[1]。SARS‑CoV‑2的持续传播,对国际公共卫生构成了巨大威胁[2],全球科学家都在积极探索新冠肺炎治疗和预防的方法,其中药物研究是一个热点。我们通过大数据的挖掘以及生物信息学的分析筛选出新冠肺炎症状相关的核心基因,并鉴定出潜在对症治疗药物,希望能为新冠肺炎药物的研发提供一些帮助。
1 材料和方法
1.1 文本挖掘确定基因列表
查阅文献确定了临床诊断中与COVID‑19 密切相关的7 个主要临床症状,分别是“发烧”“咳嗽”“重症肺炎”“呼吸困难”“呼吸窘迫”“乏力”“肌肉酸痛”,随后通过文本挖掘数据库(http://pubmed2ensembl.ls.manchester.ac.uk/)搜索这7 个关键词,得到7 组与这些关键词相关的基因列表,以供下一步分析。
1.2 基因功能注释和通路富集分析
基因注释功能分析主要包括基因的生物学过程、分子功能和细胞组分这三个方面。通路富集分析能够从分子水平确定基因参与最主要的信号转导途径。这两种分析方法主要是基于超几何分布检验,通过P值大小筛选出这些基因主要显著富集在何种生物学过程、分子功能、细胞组分及通路。利用R 软件中的clusterProfiler 包对基因进行功能注释和通路富集的统计分析和可视化[3]。……
