流感病毒组成蛋白质序列的分析与预测
2016-09-03靳佩轩
靳佩轩,高 洁
(江南大学 理学院,江苏 无锡214122)
流感病毒组成蛋白质序列的分析与预测
靳佩轩,高 洁*
(江南大学 理学院,江苏 无锡214122)
在NCBI数据库中获得1902—2013年关于流感病毒10种组成蛋白的所有氨基酸序列,在MATLAB中采用大数据编程分析,结合详细的HP模型,并基于CGR-WALK模型的方法将全部流感病毒蛋白质序列转化为数据形式,引入时间序列ARFIMA(p,d,q)模型来拟合所有序列,分析10种组成蛋白的序列在近80年的变化趋势,并对其未来10年的发展趋势进行预测.通过分析可以发现,其对流感病毒变异趋势的预测有很好的效果,这为基于大数据分析流感病毒蛋白质序列,预测流感病毒的爆发提供一定的的研究参考价值.
流感病毒;蛋白质序列;详细HP模型;CGR-WALK模型;ARFIMA(p,d,q)模型
流感病毒为负向单链RNA病毒[1],自身具有很强的变异性,历史上多次流感大流行都是由其新的亚型和以往出现过的亚型经过变异再次出现,人类由于缺乏对其的免疫力而导致流感病毒在人群中快速传播。
目前对流感病毒蛋白质序列的研究上,刘娟等用时间序列模型识别,预测流感病毒的DNA序列。张玲用时间序列模型识别,预测甲型H1N1流感病毒蛋白质序列在未来年份的变异情况取得很好的预测效果[2-5]。作者以时间序列分析研究为基础,分别选取数据库中现有的从1902—2013年间近100年的流感病毒的10种组成蛋白:Hemagglutinin,MatrixProtein 1,Matrix Protein2,Neuraminidase,Nonstructural Protein1,Nonstructural Protein2,Nucleocapsid Protein,Polymerase PA,Polymerase PB1,Polymerase PB2等作为研究对象。运用大数据处理方法将全部序列以HP模型为基础进行数据化转换,并利用CGR-WALK建模,再采用时间……
