藏语句子相似度算法的研究
2011-06-28安见才让
中文信息学报 2011年4期
安见才让
(青海民族大学 计算机学院,青海 西宁 810007)
0 引言
在自然语言处理领域,尤其在中文信息处理中,句子相似度的计算是一项基础而核心的研究课题。长期以来一直是人们研究的一个热点和难点,在自然语言处理的各个领域都有着非常重要的作用。如在基于实例的机器翻译、基于语料库的汉语教学系统、文档自动文摘系统[1]、基于常见问题集(FAQ)的机器问答系统[2]、语言的对比和信息检索、信息过滤等研究中,句子相似度的计算都是其中关键的技术之一。
随着语料库语言学的兴起,基于双语语料库的汉语教学得到越来越多学者的研究。基于汉藏语料库的汉语教学系统以汉藏双语对照的实例库为主要的知识源,其基本原理是: 当输入一个待查询的藏语句子时,系统便从双语实例库中搜索得到最相似的句子,再以该句子为查询对象,找出与之相对应的汉语句子。在基于汉藏语料库的汉语教学系统和基于实例机器翻译(EBMT)中,句子相似度的衡量是一个非常关键的步骤[3],其直接影响检索的质量,最终影响检索和翻译的正确性。
如何快速从双语实例库中找出与输入句子最相似的句子,是基于汉藏语料库的汉语教学系统需解决的关键问题之一。
1 相关研究工作
按照对语句分析的深度,相似度计算方法主要有两种: 基于向量空间模型的方法和基于语义的方法。基于向量空间模型的方法把句子看成词的线性序列,计算句子相似度只利用组成句子的词的词频、词性等信息[4]。……
登录APP查看全文
