基于预训练语言模型的中文知识图谱问答系统
2021-01-09王鑫雷李帅驰杨志豪林鸿飞王健
王鑫雷,李帅驰,杨志豪,林鸿飞,王健
(大连理工大学 计算机科学与技术学院,辽宁 大连 116024)
0 引言
问答系统是自然语言处理(NLP)领域中的一个研究热点,并且具有非常广泛的发展前景[1]。根据答案来源的不同,可以分为基于常问问题(Frequently Asked Questions,FAQ)的问答系统[2]、基于社区问答对的问答系统(Community Question Answering,CQA)[3]、基于知识图谱的问答系统(Knowledge Based Question Answering, KBQA)。其中基于知识图谱的问答系统以知识图谱为数据源。知识图谱可以看作是知识的结构化表示,由三元组(主语, 谓词, 宾语)构成,表示实体和实体间存在的语义关系。知名的英文知识图谱有Freebase[4]、YAGO[5]、DBpedia[6]等,中文知识图谱有百度知识图谱、搜狗知立方、北大的PKUBase等。而基于知识图谱问答的主要任务是给定自然语言问题,识别问题中的实体、语义关系,到知识图谱中检索并返回答案[7]。目前基于知识图谱的问答研究方法主要分为两类。
第一类是基于语义解析的方法。早期该类方法使用字典、规则和机器学习,直接从问题中解析出实体、关系和逻辑组合。但此类方法需要研究人员了解语言学相关知识还需要大量的标注数据,不易扩展到大规模开放领域的知识图谱问答任务中,泛化能力不强。随着深度学习在NLP领域的应用,目前将各种神经网络模型与语义解析策略相结合成为语义解析方法的主流。Yih等人[8]引进图谱信息进行语义解析,提出阶段查询图生成方法,该思想也被广泛应用到其他语义解析生成过程中。还有基于编码器-解码器的语义解析方法,例如Wang等人[9]使用序列到序列模型将问题翻译成多个关系的序列。……