基于随机干扰的文本型数据隐私保护方法研究
2021-04-09徐雅斌
北京信息科技大学学报(自然科学版) 2021年1期
徐雅斌,郭 昊
(1.北京信息科技大学 网络文化与数字传播北京市重点实验室,北京 100101;2.北京信息科技大学 北京材料基因工程高精尖创新中心,北京 100101;3.北京信息科技大学 计算机学院,北京 100101)
0 引言
经过多年的信息化建设,各行各业、各个领域都已经积累了大量的数据,而且数据量仍呈现出爆发式增长的态势。但是,孤立数据的利用价值相对较低,只有经过共享和交换,将数据有机地融合到一起,才能在更大程度上发挥数据的应有价值。然而有些数据涉及个人隐私,比如:发布给第三方进行市场需求分析的零售数据中包含客户信息;共享给医疗部门进行疾病预防研究的医疗数据中包含患者信息,等等。在数据的共享和交换过程中,如果处理不当,就可能导致隐私泄露,这正是很多数据拥有者的顾虑所在。
因此,是否能够有效保护个人隐私,直接影响到数据的应用,以及大数据和人工智能产业的发展。在此背景下,隐私保护研究成为数据科学研究中的一个热门领域,隐私保护相关技术具有广泛的市场前景和应用价值。
1 相关工作
隐私保护就是采用技术手段,在保证数据质量的前提下,对数据进行处理,使其不泄露个人隐私。早期简单的人工数据脱敏技术不仅效率低,而且很难保证不存在漏洞,无法真正有效保护个人隐私。一种常见的隐私保护技术是匿名化处理,它主要用于对准标识符的部分内容进行泛化处理,适用于数值型数据。……
登录APP查看全文
