基于不相关性检验的大数据异常抽取算法
2021-11-17谌裕勇陆兴华
计算机仿真 2021年3期
谌裕勇,陆兴华
(广东工业大学华立学院,广东 广州 511325)
1 引言
计算机与互联网技术的广泛应用,使得各行业数据均呈爆炸性增长,庞大数据量已成为互联网重要研究目标之一[1]。数据抽取可实现海量数据内高效获取目标信息与知识,数据规模大、多样化是大数据的基本特征。海量数据内通常会存在少量数据对象与正常数据期望行为不同,通常将其称为大数据的异常值[2],恰当处理此类异常数据是维护大数据正常应用的必要途径。在此背景下,有许多专家对此问题进行研究,得到了一些较好成果。
文献[3]按照异常网络数据的混合分类属性完成大数据之间的相似度分析,获得数值属性特征与分类属性特征。运用联合关联规则对异常网络数据完成模糊融合,建立异常网络数据分类模糊集,在模糊数据集中完成数据混合加权与自适应分块匹配,提取异常数据弱关联化特征量,将提取的特征量输入到模糊神经网络分类器中实行数据分类识别,达到异常大数据目标挖掘。但由于大数据具有较高随机性,导致该方法的应用准确性不高。文献[4]提出大数据集合中冗余特征排除的聚类算法。利用一致性聚类算法抽取各种子集样本,完成大数据冗余特征排除,并得到排除冗余特征的大数据集聚类结果。采用特征聚类和随机子空间的识别算法,聚类大数据集合冗余特征,实现大数据异常的抽取。但该方法存在计算开销大及复杂度高等问题。……
登录APP查看全文
