APP下载

哈萨克语句子相似度的计算方法研究与实现∗

2016-05-16沙力木别克毕山汗古丽拉阿东别克

新疆大学学报(自然科学版)(中英文) 2016年2期
关键词:单词模型

沙力木别克毕山汗,古丽拉阿东别克

(新疆大学信息科学与工程学院,新疆乌鲁木齐830046)

0 引言

句子相似度计算在自然语言处理方面的各个领域都有着广泛的应用,例如在自动问答系统中问题库的检索.根据用户的提问在知识库中查找对应的答案是通过计算提问的句子和知识库中对应的句子之间相似度来解决的.在信息过滤技术中,通过句子相似度计算可自动过滤掉用户可能并不想看到的信息.同样,在机器翻译、自动文摘中均用到该技术获取必要的信息.

句子相似度计算也是基于实例的机器翻译方法(Example Based Machine Translation)中的一个关键技术,其作用是在实例库中查找跟输入句子相似的句子,然后用相似句子的对齐目标句子作为翻译模板进行片段对齐、重组等操作最终完成翻译.因此,句子相似度计算结果的准确性会影响到翻译质量.

1 国内外现状分析

国外对于文本相似度计算的研究起步较早,Gerard Salton于1969年提出的基于向量空间模型(Vector Space Model,VSM)的文本相似度计算模型是目前最成熟和应用最广泛的文本相似度计算模型.它最初被引用到文章中相似度的计算中,后来被引入到句子相似度的计算中.其基本思想是将文本分为若干个特征项,计算出每个特征项的权重,特征项权重用分量的向量来表示,对向量计算来表示文档相似度.在此基础上,很多改进的算法应运而生.

国内在汉语句子的相似度计算方面取得了较好的成果,例如张民等设……

登录APP查看全文

猜你喜欢

单词模型
Exercise 1
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
看图填单词
看完这些单词的翻译,整个人都不好了
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用
单词拾趣