基于注意力机制的文本作者识别
2021-07-30江铭虎
计算机应用 2021年7期
张 洋,江铭虎
(清华大学人文学院,北京 100084)
0 引言
互联网时代,海量数据涌现,人们在享受信息服务的同时也饱受信息泛滥的困扰。作者识别技术可以准确而及时地识别不良信息,追踪垃圾信息的源头并阻止其传播,对于维护互联网生态健康具有重要的意义。作者识别,又称为作者身份识别(authorship identification)或者作者身份归属(authorship attribution),是自然语言处理(Natural Language Processing,NLP)领域里的一个重要分支。顾名思义,作者识别是识别文本作者的一类研究,它最初源自人们深入阅读的传统。作者识别的主要思路是将文本中隐含的作者无意识的写作习惯通过某些可以量化的特征表现出来,进而凸显作品的文体学特征或写作风格,以此确定匿名文本的作者[1]。从其发展历程来看,最初的研究是确定散轶文献的来源或作者,后面又逐渐发展至确定某一文学作品、法律文档或者电子文本的作者。根据是否使用数学方法量化文本风格,可以将作者识别分为传统作者识别和现代作者识别[2]。传统作者识别多基于文学和语言学的相关知识,依靠专家的经验进行判断;而现代作者识别则基于数学建模,依靠模型的结果确定作者归属。
本文主要研究基于中文文本的现代作者识别,通常可以分为提取文本特征和建立预测作者的数学模型两个步骤。这两个步骤分别被研究者称为作者风格分析(authorship style analysis)和作者身份建模(authorship modeling)。具体来说,作者风格分析是提取能够量化作者写作风格的文本特征的过程,比如字符特征、词汇特征、句法特征、语义特征等。……
登录APP查看全文
