基于基因表达数据的双向聚类算法的综述
2017-05-30冯艳霞陈艳楠
科技风 2017年26期
冯艳霞 陈艳楠
摘 要:随着基因芯片和DNA微阵列等高通量、短读取、低成本检测技术的发展,从而产生了丰富的基因表达数据。对这些数据进行有效的分析已经成为后基因组时代的研究重点。一般的聚类是根据数据的全部属性将数据聚类,这种聚类方式称为传统聚类。传统聚类只能寻找到全局信息,无法找到局部信息,而大量的生物学信息就隐藏在这些局部信息中。为了更好地在数据矩阵中搜索局部信息,人们提出了双聚类概念,这种算法从思想上有别于传统的聚类算法,它主要强调在聚类时基因和条件的同时性。目前比较成熟的双聚类算法大约有十七种左右。基于此本文简要调研了现有的三种具有代表性的双聚类算法,系统的分析了每种算法的设计步骤,算法原理,操作环境以及应用。这对于不同的基因数据如何选择更加合适的双聚类算法和软件提供了一定的指导。
关键词:聚类分析;双聚类算法;基因表达谱分析;生物信息学
对基因表达谱数据的分析是生物信息学的研究热点和难点。分析目的是从数据矩阵中找出相似性结构,结构类型包括全局模型和局部模式。对基因表达谱数据的分析通常使用聚类分析的思想。聚类分析是模式识别和数据挖掘中普遍使用的一种方法。基本思想是在多元变量间定义距离或相似系数,以此来确定多元变量关系,在基因表达谱分析中,这个多元变量就是基因向量和条件向量。……
登录APP查看全文