基于粗糙集的数据发布多约束匿名保护方法
2014-12-23邱桃荣段文影
刘 萍,邱桃荣,段文影
(南昌大学 信息工程学院,江西 南昌330031)
0 引 言
怎样发布既真实有效又能保护个人的隐私信息不被泄露的数据是亟需解决的重要问题。为了达到保护个人隐私的目的,最初的方法是仅删除个人信息中唯一能识别具体元组的身份属性,这个过程被称为匿名化。文献 [1]提出了K-anonymization规则来解决由于链接攻击造成的隐私泄露问题。然而K-anonymization存在一定的不足之处,对敏感数据,它没有做任何约束处理。为解决这个问题,在文献 [2]中提出了一种新的隐私规则l-diversity,l-diversity规则提高了匿名组内敏感属性多样性,降低了隐私泄露的风险,但是它并没解决K-anonymization规则会大量丢失原始数据大量信息的缺点。另一方面,l-diversity模型对相似性攻击没有比较好的解决办法。因此,依靠泛化技术文献[3]提出了一种可以抵御相似性攻击的匿名规则t-closeness,同样基于泛化技术的隐私规则还包括 (c,k)-safe-ty[4],privacy skyline[5]等。采用泛化技术的匿名规则在很大程度上降低了数据的精度和利用率。文献 [6]采用一种交换方法,实现高精度的数据发布规则anatomy,该规则采用一种被称为有损连接的方法。 (k,e)-anonymity[7]也是典型的采用交换来实现匿名化的模型。
由于传统的匿名算法都是把数据表所有的准标识符属性的重要度看成一致,采用相同的匿名强度实现k-划分,所设计的匿名规则属于单约束规则,所以采用这种传统匿名规则设计方法对所要发布的高维数据表进行隐私保护时会造成大量有用信息损失。文献 [8]提出多约束规则以适应多种约束条件,能够较好地实现发布数据的隐私保护程度与数据可用性之间的平衡。……
