差分隐私保护约束下集成分类算法的研究
2021-08-25贾俊杰邱万勇马慧芳
信息安全学报 2021年4期
贾俊杰,邱万勇*,马慧芳,2
1西北师范大学计算机科学与工程学院 兰州 中国 730070
2桂林电子科技大学 广西可信软件重点实验室 桂林 中国 541004
1 引言
互联网“颠覆性”的发展,使各种信息系统采集且积累了丰富的数据。机器学习即对海量的数据进行分析以获得各类可用的数据模型[1]。而数据集中通常都含有私有或敏感信息,如医疗诊断信息、电子商务购物信息等,由此引发人们对自身隐私泄露的担忧。
隐私保护技术[2-4]能有效处理数据模型发布当中个人隐私信息泄露问题。匿名技术依赖于攻击者的背景知识,所提供的隐私是“无法保证的”。Dwork等人[5]提出差分隐私定义,解决了传统隐私保护模型的两个缺陷: 1)差分隐私保护与背景知识无关; 2)差分隐私建立在严格的数学基础上,对隐私保护提供了量化的评估方法。差分隐私的核心概念涵盖了从隐私保护领域到数据科学(如机器学习、数据挖掘、统计和学习理论)等领域的一系列研究[6-10]。
针对机器学习中数据模型发布、分析时的个人隐私泄露问题,在特定算法中引入差分隐私,保护数据私有或敏感信息的同时,使得发布的模型发挥其最大的可用性[7-8]。差分隐私数据分析的基本任务是将现有的非隐私算法扩展到差分隐私算法。在集中学习模式下,基于数据分析的差分隐私模型研究中,由于模型本身会泄露训练数据中个体属性或敏感信息。对此,需设计相应扰动机制使模型训练过程实现差分隐私保护。……
登录APP查看全文
