基于扩展查询表达式的XML关键字查询
2014-06-07朱菁华王晓玲
计算机工程 2014年10期
朱菁华,王晓玲
(复旦大学计算机科学技术学院,上海200433)
基于扩展查询表达式的XML关键字查询
朱菁华,王晓玲
(复旦大学计算机科学技术学院,上海200433)
目前可扩展标示语言(XML)关键字查询大多是基于最小公共祖先(LCA)语义子树产生查询结果,而未能加入除LCA语义子树之外与用户查询意图相关的结果。为解决该问题,提出一种基于扩展查询表达式的XML关键字查询方法。将用户查询日志作为查询扩展统计模型,对其进行统计分析,并结合最佳检索概念判断是否需要扩展查询表达式。使用XML TF-IDF方法计算候选属性的权重,根据初检结果的上下文信息,利用聚类方法获得与查询意图最相关的扩展查询关键字,从而扩展查询表达式。实验结果表明,与XSeek和基于语义词典的查询扩展方法相比,该方法的平均F度量值分别提高了7%和17%,具有较高的查询质量。
信息检索;可扩展标示语言;最小公共祖先语义;关键字查询;查询扩展;上下文信息
1 概述
信息检索中的一个主要挑战就是如何精确判断用户的查询意图,而关键字查询方式由于缺乏足够的结构和语义信息,使得其查询结果往往无法令用户满意。如今,可扩展标示语言(eXtensible Markup Language,XML)由于其灵活性等优点,被广泛应用于Web上。所以,如何帮助用户产生精确的查询表达式对于XML关键字查询是很有必要的。
目前,XML关键字查询的研究大多都是基于最小公共祖先(Lowest Common Ancestor,LCA)概念来确定相关语义片段子树[1]。针对LCA存在嵌套的问题,文献[2]提出了最近最小公共祖先(Smallest LCA,SLCA)。……
登录APP查看全文
