基于K-Means聚类算法的HDMA数据挖掘方法
2021-11-17耿德志
计算机仿真 2021年2期
耿德志,徐 乾
(1. 晋中学院信息技术与工程学院,山西 晋中 030600;2. 山西大学计算机与信息技术学院(大数据学院),山西 太原 030006)
1 引言
作为一种决策支持阶段,数据挖掘[1]在人工智能、统计学技术以及机器学习等基础上,对企业原有数据进行高度自动化分析,根据归纳性推理挖掘到内在形式,从而精准预测用户行为,并做出策略上的适当调整,通过正确决策降低市场风险。数据挖掘技术是大势所趋的必然产物,随着企业数据量的爆炸式增长,当前数据库工具既无法进行高效处理,也无法在海量的数据里选取出有用信息,所以,数据挖掘技术成为了数据库与决策领域的热点研究课题。数据挖掘就是在大规模的数据库内,完成用户隐含未知有效信息的兴趣知识提取,该知识具有概念、模式、规律以及规则等多种形式,也就是说,数据挖掘技术的处理目标除了数据库,还有可能是文件系统或者其它种类的数据集合。
数据挖掘过程中的关键环节之一就是聚类,通过划分物理或者抽象的数据集为相似对象类别,实现各类别中的数据对象彼此相似,且又不同于其它类别中所含的数据对象。经过数据聚类,可以更好地对数据集中的数据对象进行理解,因此,在文本分析、机器学习、模式识别以及数据挖掘等研究中运用广泛。文献[2]提出的多层次分布式网络数据挖掘改进方法,利用概率歪曲策略解决初始数据集扰乱问题,重构项集支持度,通过概率转换得到挖掘数据;……
登录APP查看全文
