融合预训练模型的中文知识图谱问题生成方法
2021-03-13陈小平欧阳昱刘辉舟
小型微型计算机系统 2021年2期
叶 子,陈小平,张 波,欧阳昱,刘辉舟
1(中国科学技术大学 计算机科学与技术学院,合肥 230027)
2(国网安徽省电力有限公司,合肥 230022)
1 引 言
近年来,智能问答技术在诸多领域得到了广泛应用,例如教育、医疗和电力等[1].传统问答系统由于缺乏知识和推理能力始终存在提升瓶颈,因此,基于知识库的问答方法成为了研究问答技术的主流方向.
知识图谱具有高效表达海量知识、深度知识推理、与领域知识高度关联等优势[2],是知识问答的优质知识来源.然而,基于知识图谱的问答技术目前尚处于起步阶段,现有中文知识图谱问答语料库大多存在规模较小,质量较差的问题,这严重制约了中文知识图谱问答技术的发展.
问题生成是利用文本数据生成自然语言形式问题的一种技术[3].文本数据可以是结构化的知识库、句法树等,也可以是篇章级文本或完整的问答语料.简单来说,问题生成是人工智能“主动提问”的技术,它的目标是生成正确且多样的问题.有了问题生成技术,以中文知识图谱三元组作为输入生成对应问题,可以生成中文知识图谱问答训练语料.不仅如此,问题生成技术对自动合成FAQ文档,自动辅导系统等应用场景也具有重要意义.
现有的问题生成方法大多是基于规则的方法,这些方法对模板的质量和数量要求较高,较为耗费人力资源,泛化能力较弱,对大规模数据的处理能力有限.要弥补这些不足,需要问题生成模型充分获取……
登录APP查看全文
