融合BERT的网络空间安全实体识别方法
2021-06-04廉龙颖郭京伟
黑龙江科技大学学报 2021年3期
关键词:模型
廉龙颖,孔 萨,郭京伟
(黑龙江科技大学 计算机与信息工程学院, 哈尔滨 150022)
0 引 言
随着互联网技术的快速发展,网络空间安全形势日益严峻,网络攻防信息越来越丰富,呈现海量、异构、领域交叉等特点。从海量数据中挖掘网络空间安全知识,采用知识图谱模型进行存储,可实现知识管理、情报分析、攻击预测与溯源等智能应用。如何快速准确地从非结构化的文本中抽取出有效实体是构建网络空间安全知识图谱的核心任务。
在实体识别研究的早期阶段主要基于规则的方法,第六届消息理解系列会议所有研究都基于词性规则[1]和短语规则[2]的方法。在基于规则的方法中,最具代表性的是基于词典的方法[3],主要采用字符串匹配的方式,从文本中找出与词典中最相似的字符串进行实体识别,其主要优势在于简单,但识别效果一般。因此,研究者们开始分析上下文语义信息,研究基于规则匹配实体识别方法。Fukuda等[4]基于生物领域词典利用字符串规则来抽取实体。郑家恒等[5]根据中文构词法建立规则库,通过构词和过滤规则识别网络新词语实体。基于规则的实体识别方法优点是比较接近人类的思维方式,表述直观,易于推理,准确率较高;缺点是规则的制定依赖于领域专家,仅适用于某个特定领域小规模语料,通用性和可移植性较差,并且规则之间可能会发生冲突,此时,机器学习在自然语言处理领域开始兴起。基于机器学习的方法分为基于特征和神经网络的方法,包括语言模型[6]、隐马尔可夫模型[7]、二阶隐马尔可夫模型[8]、决策数[9]、最大熵模型[10]、支持向量机[11]、条件随机场[12]、长短时记忆网络[13]等。……
登录APP查看全文
