基于中文预训练的安全事件实体识别研究
2021-07-10董林靖黑新宏王一川刘雁孝
信息安全研究 2021年7期
关键词:模型
朱 磊 董林靖 黑新宏 王一川 彭 伟 刘雁孝 盘 隆
1(西安理工大学 西安 710048) 2(陕西省网络计算与安全技术重点实验室(西安理工大学) 西安 710048)3(深圳市腾讯计算机系统有限公司 广东深圳 518054)
随着我国城市中各种各样的安全突发事件不断增多,形成了大量的案例文本信息.现阶段公共安全事件舆情中的知识与信息不能有效地抽取和复用,无法为公共安全事件管理提供充分的协助和预警.在现有的自然语言处理研究领域,对中文公共安全事件领域的语料分析研究[1]较少.命名实体识别是领域工作中的基础,直接影响自然语言处理任务中语法分析、语义分析和关系抽取任务的性能,其主要的目的是从非结构化文本中识别预定义实体[2].
基于规则和词典的命名实体识别方法[3]主要是人工构建有限规则,结合专家构建的实体词汇表,对每条规则设置权重,然后通过实体与规则的匹配程度来进行实体类型分类.但是人工制定这些规则的成本较大,构建词汇表与数据量相差悬殊,经过制订固定的规则模板来识别出结构复杂的命名实体;这样的方法虽然准确率相对较高,然而工作量巨大,可行性较低;其次,人为制订的规则模板复用性太低,不同领域数据结构可能不同,将此规则模板迁移至其他领域不适用.
基于统计机器学习的方法可以将命名实体识别任务当作词组级别的多分类任务,先使用模型识别出实体的边界,再使用分类器对文本中的命名实体进行分类[4];……
登录APP查看全文
