原核生物基因识别问题的相关分析
2017-02-16杨汉铭
科技与创新 2017年1期
杨汉铭
摘 要:原核生物基因识别属于生物信息学的范畴,作为一门交叉性的学科,生物信息学中融入了对生物信息的解释、分析、分发、存储、处理和获取等多方面的内容,利用生物学、计算机科学和数学等工具,对大量数据中包含的生物学意义进行理解和阐述。通过分析DNA序列,有效分析蛋白质中非编码和编码序列的特征,以期提升蛋白质编码基因的识别率。简要阐述原核基因组中ORF及基因的结构特征,尝试提取描述基因特征的参量,通过分析重叠基因,有效设计自训练识别原核生物基因算法。
关键词:原核生物;基因识别;结构特征;蛋白质编码
中图分类号:Q93-33 文献标识码:A DOI:10.15913/j.cnki.kjycx.2017.01.038
在生物信息学领域中,基因识别是一项重要内容,通过分析基因序列,能够提取基因特征结构信息,得到相应的理论模型,设计识别算法,从而实现对计算机辅助基因的识别。在基因识别中,主要识别RNA基因、蛋白质编码基因。过去,采用生物学实验的方法确定基因及其结构,存在费用高、周期长等问题。因此,采用非实验的方法定位基因,确定基因结构,具有十分重要的意义。
1 Fisher判别法
过去,应用统计模式识别方法存在的一个问题,就是特征数或维数问题。基于此,逐渐产生了一种能够将特征空间维数降低的方法,其中一种较为常用的方法就是Fisher线性判别法。在这种方法中,在一条过原点的直线上投影d维空间的所有模式,从而形成在一起聚合的一个群,其在一维直线上可能存在混杂的投影。……
登录APP查看全文
