通用深度学习语言模型的隐私风险评估
2021-06-04潘旭东颜一帆陆逸凡
潘旭东 张 谧 颜一帆 陆逸凡 杨 珉
(复旦大学计算机科学技术学院 上海 200438)
在过去10年,深度学习、云计算等新型技术的高速发展带动了包括智能制造、数字医疗、智慧化服务在内的多行业、各领域的智能化革新.在自然语言处理(natural language processing, NLP)中,得益于深度学习的多项前沿技术,计算机已经可以准确地判别句子中蕴含的情感[1],与人类进行智能问答[2]或对话[3],也能独立写出1首高水平的古诗[4],甚至1篇以假乱真的新闻长篇报道[5].
这些技术突破大多离不开近2年自然语言处理领域涌现的基于深度学习的通用语言模型(general-purpose language models, GPLMs).其中,以Google提出[6]的BERT(bidirectional encoder representation from transformers)模型和OpenAI提出的GPT(generative pre-training)[7],GPT-2[8]等模型作为引领,Facebook、百度等知名IT公司陆续开发出多种通用语言模型,持续刷新着各类自然语言处理任务的最好成绩.具体而言,通用语言模型主要由一种于2017年提出的被称作Transformer[9]的新型神经网络模块双向逐层堆叠而成,通常包含成万上亿的可训练模型参数,例如,OpenAI的GPT-2模型具有15亿左右的参数[8].当通用语言模型在海量的公开语料库上完成预训练后,该类语言模型能直接用于从输入文本提取向量形式的文本特征(embedding,下文均以“通用文本特征”指代),并广泛应用于不同的下游任务(包括情感分析、语义分析等).例如,BERT在2018年最早提出之时,以BERT作为文本特征提取模型,简单配以下游的线性分类模型,同时在多达11种重要的自然语言处理任务上显著提升了此前最优基准指标[6].
考虑到重新训练通用语言模型的极大时间开销和……
