基于BERT信息抽取的电力客服知识图谱构建方法
2021-12-31国网河南信通公司张向聪王冰洁何军霞
国网河南信通公司 张向聪 王 浩 王 磊 王冰洁 何军霞
随着智能电网的快速发展,在电力行业,人工智能正快速地与电网领域相结合,信息通信技术迅速集成到电网的生产和企业管理中。信息通信系统是支持生产和管理开发的智能网格的“中心神经”。在信息通信方面,电力管理客服中存在着很多系统,对每个系统问答知识匹配时,需要收集足够多的问题以及对知识内容的存储,传统的关系型数据库可以支撑问答系统,但是在存储复杂的关系网络时,关系型数据库就表现得不如知识图谱有效。之所以选择知识图谱,是因为人们在逻辑上通常很自然使用类似图的结构来模拟或描述它们的特定问题域。知识图谱最有效、最直观地表达出实体间、问答间的关系。本次研究将提供一种基于BERT+BiLSTM+CRF[1]模型,从原始的操作手册中抽取实体、实体关系以及问答对,构建电力客服知识图谱[2]。
1 相关理论技术与研究
Bert(Bidirectional Encoder Representation from Transformers)[3]是一个预训练模型。传统的语言模型是把单向语言模型或者是把两个独立的语言模型在浅层进行一个拼接的方法进行预训练,他强调的并不是这种传统的语言,而是采用新的masked language model(MLM),以致能生成深度的双向语言表征。Bert 论文发表时提及在11个自然语言处理任务中获得到的新结果,比以往的模型表现的都要好,令人惊讶。
模型的介绍以及优点如下:采用MLM 对双向的Transformers 进行预训练,以生成深层的双向语言表征;进行完预训练之后,再叠加一个输出层,进行fine-tune 操作,这样就可以在不同的下游任务当中提取到它的state-of-the-art 表现。……
