基于神经网络方法的脏话识别研究综述
2021-11-22臧义
现代计算机 2021年7期
臧义
(四川大学计算机学院,成都610065)
0 引言
网络社区是指网上论坛、贴吧、微博、博客、网络游戏聊天区等公共平台,在这些平台上用户可以随意通过发布帖子或者评论帖子来发表自己的言论。脏话作为人们的一种非正式语言,在现实生活中经常出现。互联网的便利和虚拟性质更加助长了脏话的泛滥,尤其是在娱乐性质比较强的平台如网络游戏聊天区是脏话言论的高发地,在缺乏完善的监管之前,人们几乎不会为自己所发表的脏话言论承担责任,这为维护健康的网络公共环境、净化网络风气造成了风险。因此,研究针对一段文本来自动识别其是否为脏话的系统具有十分重要的现实意义。
脏话言论是指针对某个人或者某个群体的辱骂或者发表攻击性言论的行为,根据辱骂内容的不同又可以细分为:性别歧视、种族歧视、仇恨言论、个人人身共计、讽刺、欺凌、亵渎等方面,我们这里研究的脏话是指广义方面的脏话。网络社区的脏话言论一般具有以下特点:①脏话的书写往往不规范,辱骂者一般为了规避敏感词检测系统,会采用缩写、更换为其他语言等方式来表达同样意思的脏话言论;②脏话的语言更新发展速度较快;③为了表达情绪,脏话相比于正式书面文本往往会伴随一些表情符号或者不规范用法的标点符号;④部分脏话词存在非脏话词的意思,通过关键字匹配来屏蔽脏话词并不一定能够有效屏蔽脏话。
脏话识别可以看作一个文本二分类的任务,即针对一段聊天或评论文本判断它是否是脏话言论。……
登录APP查看全文
