基于BERT 的突发事件文本自动标注方法
2021-12-17杨芷婷马汉杰
杨芷婷,马汉杰
(浙江理工大学 信息学院,杭州 310018)
0 引言
自然语言处理技术(Natural Language Processing,NLP)是计算机科学、人工智能和语言学交叉的领域,主要研究用计算机来处理、理解和应用人类语言,达到人与计算机之间的有效通信。信息抽取为自然语言处理领域的一个重要研究方向。其中,命名实体识别(Named Entity Recognition,NER)是信息抽取的基础任务,其任务是从文本中识别出诸如人名、组织名、日期、时间、地点、特定的数字形式等内容,并为之添加相应的标注信息,为信息抽取后续工作提供便利[1]。在实际自然语言处理任务中,如社交媒体文本处理等,NER 作为上游任务在整个系统中起着举足轻重的作用。
随着网络信息的爆发式增长,传统的文本分析手段已不适合处理海量突发事件信息,机器学习和数据挖掘技术才是目前信息抽取任务处理过程中备受青睐的处理技术。随着评测会议,如:MUC(Message Understanding Conference)[2]、自动内容抽取(Automatic Content Extraction,ACE)[3]的举办,事件抽取技术取得了长足进展。2016 年Peng等人将Chen等人发表的SOTA 中文分词系统[4]与中文媒体ER 模型结合[5],在实体识别训练过程中利用分词训练提供的输出参数训练,使识别效果提高了5%[6];Lample 在堆叠LSTM 模型(S-LSTM)基础上,结合基于字符的表示模型[7]和词嵌入模型,在多种语言上得到了较好的训练结果[8];伟峰等人在2019 年首先提出利用基于注意力机制[9]的序列标注模型,联合抽取句子级事件的触发词和实体,与独立进行实体抽取和事件识别相比,联合标注的方法在F值上提升了1 个百分点;武惠[10]提出基于迁移学习和深度学习的TrBiLSTM-CRF 模型,采用实例迁移学习算法将源域知识迁移到目标域,在小规模数据集上取得了较好的效果。……
