结合邻近度的语义位置语言检索模型
2015-04-21龚小龙王明文万剑怡王晓庆
中文信息学报 2015年4期
龚小龙,王明文,万剑怡,王晓庆
(江西师范大学 计算机信息工程学院,江西 南昌 330022)
结合邻近度的语义位置语言检索模型
龚小龙,王明文,万剑怡,王晓庆
(江西师范大学 计算机信息工程学院,江西 南昌 330022)
在传统的检索模型中,文档与查询的匹配计算主要考虑词项的统计特征,如词频、逆文档频率和文档长度,近年来的研究表明应用查询词项匹配在文档中的位置信息可以提高查询结果的准确性。如何更好地刻画查询词在文档中的位置信息并建模,是研究提高检索效果的问题之一。该文在结合语义的位置语言模型(SPLM)的基础上进一步考虑了词的邻近信息,并给出了用狄利克雷先验分布来计算邻近度的平滑策略,提出了结合邻近度的位置语言检索模型。在标准数据上的实验结果表明,提出的检索模型在性能上要优于结合语义的位置语言模型。
语义位置语言模型;Dirichlet平滑;邻近度信息;检索模型
1 引言
在过去的几十年间,信息检索领域出现了很多经典的模型,诸如布尔模型、向量空间模型以及概率模型等。1998年,Ponte和Croft[1]首次将统计语言模型应用于信息检索,提出了查询似然语言模型,之后研究者又陆续提出了隐马尔科夫模型、统计翻译模型和风险最小化模型等,但是大多数检索模型都是仅使用了词在文档中的频率这一特征,而未考虑词在文档中的位置关系,对那些相同词在不同文章中的位置和顺序的不同,大多数检索模型对这样的文档的检索得分是一样的,而考虑了位置关系的检索模型的检索效果就会有所区分。……
登录APP查看全文
