混合属性数据集分布一致性度量的新方法
2021-03-17何玉林戴德鑫黄柏皓黄家杰
何玉林,金 一,戴德鑫,黄柏皓,黄家杰
1)深圳大学计算机与软件学院,广东深圳 518060;2)深圳大学大数据系统计算技术国家工程实验室,广东深圳 518060;3)中国刑事警察学院刑事科学技术学院,辽宁沈阳 110854
分治[1]是对大数据进行处理和分析的有效途径之一,当前流行的大数据计算框架,如MapReduce[2]和Spark[3]均是基于分治思想开展对大数据存储和计算的.最近,一种新的以分治策略为基础的大数据管理模型——随机样本划分(random sample partition, RSP)[4-5]被提出并用于大数据的处理和分析中.该模型通过将大数据划分成与大数据保持概率分布一致性的RSP数据块实现对大数据的学习和挖掘,其中大数据RSP数据块的生成和判定是模型的核心.
RSP数据块[6]是指在给定显著性水平下具有相同概率分布的数据块,包括连续属性、离散属性和混合属性数据块.用于度量不同样本之间相似性的指标很多,如欧氏距离、马氏距离、余弦相似度、相关系数和Jaccard相似系数等.然而,用于度量不同数据集分布相似性或一致性的指标却很少,最经典的就是用于度量连续属性数据集分布一致性的最大平均差异(maximum mean discrepancy, MMD)方法[7].MMD在再生核希尔伯特空间(reproducing kernel Hilbert space, RKHS)中构建度量标准来检验不同数据集是否来自同一概率分布.李洪奇等[8]给出了一种度量离散属性数据集分布相似性方法,本研究将其记为基于二值化的相似性度量(binarization-based similarity measure, BSM)方法.该方法首先将原始数据集转换成二进制数据集;之后计算二进制数据集的单项目集和双项目集的特征频率,并将他们组合,得到原数据集的特征向量;……