基于分块和滑窗技术的相似重复记录检测算法研究
2019-04-15陈亮杜璐胡康
计算机应用与软件 2019年4期
陈 亮 杜 璐 胡 康
(西安工程大学计算机科学学院 陕西 西安 710048)
0 引 言
在大数据时代,数据成为有价值的公司资产,可以减少和消除企业经济活动中的风险,为企业的管理控制和科学决策提供合理依据,并预期给企业带来经济利益[1]。公司或企业为了更好地做出决策,往往需要高质量的数据[2]。但是由于各种原因,例如:重复输入、不同数据源中数据采用不同的表示方式、多数据源合并造成重复等数据质量问题,使数据中心中存在着很多的相似重复数据。这些“脏数据”导致了错误的分析结果,进而影响决策。因此数据清洗,尤其是数据清洗中的相似重复数据检测变得尤为重要。
相似重复记录检测就是识别一对记录是否表示为真实世界中的同一个实体。为了避免高代价的记录比对,减少无意义的数据比对次数,有学者提出了一种分区算法,将大量的数据分成更小的子集[3-11]。如果相似记录分布在同个子分区,在数据比对过程中仅与区中的记录比对而不是全部数据[3]。常用的技术是分块技术[4]和窗口技术[5]。其中,分块技术将数据集分成互不相关的子集,在较小的子集内数据聚类;窗口技术通过滑动窗口选中固定大小的数据依次与目标数据来进行记录比对。本文结合了分块技术和窗口技术,提出了一种相似重复检测算法,减少数据比较次数,提高算法运行效率。
1 相关工作
在相似重复记录的检测方面已经有了一些成果。传统的“排序&合并”算法先将数据库中记录排序,然后通过比较邻近记录是否相等来检测完全重复记录。……
登录APP查看全文
