基于文化基因算法和犹豫模糊集的聚类算法及其分布并行实现
2021-04-15王超英
计算机应用与软件 2021年4期
关键词:特征
王 超 英
(东莞职业技术学院 广东 东莞 523808)
0 引 言
随着医院的信息化建设和普及,全国的医疗系统每天产生海量的数据,如何高效地管理医疗大数据成为了一个难题[1]。在医学领域存在大量的高维小样本数据,例如医嘱类文档数据、病例类文档数据、DNA微阵列数据[2-3]。海量高维小样本数据集的聚类和分析需要大量的处理时间。以DNA微阵列数据为例,微阵列的维度高,且含有大量的冗余样本和不相关样本,严重影响聚类器的准确率[4]。
通过特征选择处理能够降低特征集的维度,删除冗余特征和不相关特征,有助于提高数据聚类的准确率和速度,是当前高维小样本数据挖掘领域的研究热点[5]。为了解决上述高维小样本数据集的瓶颈问题,许多研究人员进行了深入的分析[6]。文献[7]基于随机森林变量重要性分数提出了一种加权K-均值的基因微阵列数据聚类算法,以基因为对象、样本为特征、基因的重要性分数为权重进行K-均值聚类,该算法提高了聚类结果的同质性和差异性。文献[8]提出的高维微阵列数据混合特征选择算法分为两层:第一层使用信噪比方法计算全部基因的信噪比值,根据信噪比值选择指定数目的信息基因,过滤无关基因;第二层使用改进的Lasso方法对第一层得到的信息基因候选子集进行特征选择,剔除冗余基因。文献[7-8]均采用了过滤式特征选择算法,分别将随机森林变量重要性分数和基因信噪比作为特征重要性的评价指标,此类传统方法难以获得最少的特征数量[9]。……
登录APP查看全文
