基于Word2vec和句法规则的自动问答系统问句相似度研究
2021-03-16白尚旺陆望东党伟超潘理虎
计算机应用与软件 2021年3期
刘 杰 白尚旺 陆望东 党伟超 潘理虎,3
1(太原科技大学计算机科学与技术学院 山西 太原 030024)
2(太原政通云科技有限公司 山西 太原 030000)
3(中国科学院地理科学与资源研究所 北京 100101)
0 引 言
自动问答系统的一般处理流程是对用户提出的问题查询FAQ (Frequently Asked Questions)问题库并返回最为相似问题的答案。早期的自动问答系统主要依靠专家系统,如文献[1]提到的LUNAR和文献[2]提到的STUDENT专家系统,但是专家系统往往有局限性,其数据结构通常是结构化数据,问句之间相似度匹配往往是句中词语的机械式匹配。张子宪等[3]从句子的关键词相似度、关键词距离以及相同关键词在问题库所占比例等方面进行了相似度计算分析,并提出一种基于句子规则的问句相似度计算方法。该方法虽然提高了句子相似度匹配精度,但是忽略了句子结构层面的分析。文献[4]提出了一种基于改进后的TF-IDF的句子相似度计算方法,通过同义词典统计关键词词频信息,然后计算向量之间余弦相似度。虽然该方法虑到了关键词的物理特征,但忽略了词语在问句环境中的依存关系以及语义关系。
近年来,随着大数据时代到来和云计算能力不断地提高,深度学习得到了非常快速的发展,其具有很好的特征学习能力,尤其是在图像和语音领域,这也激励着大批学者将其具有应用自然语言处理的研究中[5-7]。2013年,Google公开获取词向量工具Word2vec[8-9],立即引起了学术界和工业界的关注,其获取词向量方法与One-hot[10]方法相比能够更好地表达词与词之间的相似特征。……
登录APP查看全文
