基于翻译模型的查询会话检测方法研究
2015-04-21张振中韩先培
中文信息学报 2015年4期
张振中,孙 乐,韩先培
(中国科学院软件研究所 基础软件中心,北京 100190)
基于翻译模型的查询会话检测方法研究
张振中,孙 乐,韩先培
(中国科学院软件研究所 基础软件中心,北京 100190)
查询会话检测的目的是确定用户为了满足某个特定需求而连续提交的相关查询。查询会话检测对于查询日志分析以及用户行为分析来说是非常有用的。传统的查询会话检测方法大都基于查询词的比较,无法解决词语不匹配问题(vocabulary-mismatch problem)——有些主题相关的查询之间并没有相同的词语。为了解决词语不匹配问题,我们在该文提出了一种基于翻译模型的查询会话检测方法,该方法将词与词之间的关系刻画为词与词之间的翻译概率,这样即使词与词之间没有相同的词语,我们也可以捕捉到它们之间的语义关系。同时,我们也提出了两种从查询日志中估计词翻译概率的方法,第一种方法基于查询的时间间隔,第二种方法基于查询的点击URLs。实验结果证明了该方法的有效性。
查询会话检测;词语不匹配问题;查询日志
1 引言
近年来,大规模网络查询日志的可用为查询日志分析以及用户行为分析提供了新的机会,许多与搜索相关的应用(如查询推荐、查询扩展以及查询理解等)在很大程度上依赖于查询日志挖掘[1-2]。查询会话检测是查询日志挖掘中的一个重要问题,其主要目的是确定用户为了满足某个特定信息需求而连续提交的相关查询[3]。由于其重要性,查询会话检测已经得到学术与工业界的普遍关注[1,4-10]。……
登录APP查看全文
