基于对抗网络的文本情绪分析性别偏见消减方法
2024-01-24乌达巴拉张贯虹
乌达巴拉 张贯虹


摘要:近年来,性别偏见引起自然语言处理领域研究者们的关注。已有研究工作证实,性别偏见不仅影响模型性能,且其传播将进一步对下游产品产生一定的危害。文章探究性别偏见对文本情绪分析的影响,提出基于对抗网络模型的性别偏见消减方法。实验结果表明,在文本数据集上,文章提出的对抗性训练方法相比其他减偏方法,使TPR-GAP下降约0.02~0.03,而性能只降低了0.8个点。
关键词:性别偏见;文本情绪分析;对抗网络
中图分类号:TP391 文献标识码:A
文章编号:1009-3044(2023)34-0029-03
开放科学(资源服务)标识码(OSID)
0 引言
近年来,性别偏见(Gender Bias) 在NLP领域受到了关注,它不仅影响NLP模型的性能,其传播在很大程度上会对下游产品产生一些危险的刻板印象。
性别偏见没有统一的定义,也没有用于衡量它的统一标准。但研究者们普遍认为,性别偏见是对一种性别的偏好或偏见[1],它存在于NLP 模型或系统的多个方面,比如训练数据、预训练模型和训练算法等。以下通过例子来说明不同任务中存在的性别偏见。
例句1. 机器翻译系统[2]。英语: The doctor asked the nurse to help her in the procedure. 西班牙语: El doctor le pidio a la enfermera que le ayudara con el procedimiento.
在英语源句中,护士的性别是未知的,但与her的共指表明“医生”是女性。西班牙语的目标句使用形态特征来表示性别:el doctor表示男性,而la enfermera表示女性。
例句2.词嵌入[3]。有偏见的词嵌入模型自动生成诸如“男人:女人”,“计算机程序员:家庭主妇”之类的类推。
例句3. 共指解析[4]。一个男人和他的儿子发生了一场可怕的车祸。父亲死了,男孩受了重伤。医院里,外科医生看着病人惊呼,我不能给这个男孩做手术,他是我儿子!……
