APP下载

分布式隐私保护FHE-DBIRCH模型研究

2014-08-03刘英华

计算机工程与科学 2014年7期

刘英华

(中国青年政治学院,北京 100089)

1 引言

自1995年提出隐私保护数据挖掘以来,隐私保护数据挖掘就成为了数据挖掘领域的研究热点和难点。隐私保护技术主要有数据扰动技术、匿名化技术和安全多方计算技术[1]。数据扰动技术隐藏了真实数据,挖掘者只能在被扰动的数据上挖掘知识(如添加了噪声、数据交换等);匿名化技术则是泛化和抑制操作微调了原始数据对象属性值,数据扰动技术、匿名化技术都改变了原始数据,即在被修改了的数据上完成挖掘任务。

聚类分析是数据挖掘研究的一个重要部分,是实现数据深层使用价值的一个重要步骤,也是其他挖掘任务的基础,聚类分析在数据挖掘领域得到了广泛的研究和应用[2]。可以将聚类分析作为单独的工具使用,分析、发现数据库中存在的知识和信息,并且对聚类分析的每一类总结其特点。针对聚类分析的某个类,还可以聚类二次分析出更深层次的知识和信息,并以此类推,进行聚类的n次分析,所以也可以认为聚类分析是其他数据挖掘模型中的一个预先处理过程[3]。

聚类分析是根据数据对象的相似度划分为若干个群组(簇),而隐私保护中的数据扰动技术、匿名化技术微调了原始数据对象属性值,这种操作将导致相似度计算值的误差,从而引起数据分布、密度特征的改变,进而影响群组的划分结果[4]。只有隐私保护中的安全多方计算技术,没有改变原始数据集,而是加密后传输,确保参与方信息的独立性和计算的正确性,同时又可以保护各参与方的信息不泄露给其他参与方或第三方。……

登录APP查看全文