采用相关反馈和文档相似度的维吾尔语检索词加权方法
2017-06-05于丽亚森艾则孜
华侨大学学报(自然科学版) 2017年3期
于丽, 亚森·艾则孜
(新疆警察学院 信息安全工程系, 新疆 乌鲁木齐 830011)

采用相关反馈和文档相似度的维吾尔语检索词加权方法
于丽, 亚森·艾则孜
(新疆警察学院 信息安全工程系, 新疆 乌鲁木齐 830011)
针对维吾尔语Web文档的有效检索问题,提出一种基于相关反馈和文档相似度的检索词加权方法.首先,对维吾尔语文档进行预处理,获得相应的词干集.然后,当用户输入多个检索词时,执行初始检索,并基于局部相关反馈思想提取出排名靠前的N个文档.接着,利用TF-IDF算法计算检索词与反馈文档之间的词频相似度,通过余弦距离计算文档之间的相似度,并以此对检索词进行两次加权.最后,根据加权后的检索词进行文档检索.实验结果表明:该方法能够准确地检索出用户所需的文档,并将其靠前排序.
维吾尔语; 文档检索; 检索词加权; 相关反馈; 文档相似度
随着国家对新疆地区投入的增加,大量维吾尔语等少数民族语种的文字信息开始以数字化形式呈现[1].若能迅速准确地从维吾尔语书写的Web文档数据中获得所需文档,将会为新疆地区的文化发展作出一定的贡献.在文档检索中,用户经常会输入多个检索词.在传统检索中,各检索词的权重一致.但由于用户初始查询时,其信息需求通常比较模糊,从而无法准确地反馈实际需求的文档[2].目前,提高检索系统性能的方法主要包括概率和语言模型方法[3]、检索分类方法[4]及检索修正方法[5].其中,检……
登录APP查看全文