基于公共词块及N-gram模型的问句相似度算法
2017-11-04黄贤英龙姝言
重庆理工大学学报(自然科学) 2017年10期
黄贤英,谢 晋,龙姝言
(重庆理工大学 计算机科学与工程学院, 重庆 400054)
基于公共词块及N-gram模型的问句相似度算法
黄贤英,谢 晋,龙姝言
(重庆理工大学 计算机科学与工程学院, 重庆 400054)
问句相似度算法是问答系统的核心问题,直接影响着问答系统的准确性。针对公共词块算法(CCS)对于中文文本的不适用性,提出一种改进的问句相似度算法(CNS)。该方法结合N-gram模型及公共词块来计算问句向量的相似度,其主要思路是把问句分解成一元模型和二元模型,然后再分析问句之间的公共词块并考虑其顺序结构。实验结果表明:新算法在Top-N条数据集的平均相似度和不同相似度阈值下的准确率均优于常用的问句相似度算法。
问句相似度;N-gram模型;一元模型;公共词块
近年来,随着信息技术的飞速发展,智能问答(QA)领域吸引了大量的用户[1],问句相似度计算则成为了QA中最为关键的环节[2]。QA通过问句相似度计算来获取用户所要查询的内容与知识库中现有问题之间的关系,再通过合理的筛选答案候选集[3]自动给出用户满意答案[4-5]。
目前,问句相似度算法主要使用的是针对所有句子的相似度算法[6]。这种方法忽略问句的特殊句型结构,将问句视为短文本,利用常用的短文本处理方法来分析问句。首先对问句进行分词、词性标注、去停用词处理,为处理后的问句赋值权重,将其转换成向量化的形式,再使用相似度算法进行计算。文献[7]提出一种基于平均信息熵的中文问句关键词提取方法,其中心思想是通过计算问句中每个词的平均信息熵以更好地体现该词在问句中的重要性。……
登录APP查看全文
