基于用户浏览时间的点击模型*
2011-01-24何靖袁文清闫宏飞
华南理工大学学报(自然科学版) 2011年4期
何靖 袁文清 闫宏飞
(北京大学计算机科学与技术系,北京100871)
搜索引擎日志记录了用户的相应搜索行为,包括提交的查询串、对某个文档的点击、翻页等.这些日志反映了用户在搜索时的行为过程,而直观上,用户总是倾向于点击可能满足他的信息需求的文档,所以用户的行为过程表明了用户对结果列表中文档相关性的判断.基于这样的假设,可以从日志中抽取查询和文档之间的点击关系用来替代它们之间的相关性关系.但是,在实际中,用户的点击行为会受到很多因素的影响(如各个文档排序的高低、文档和周围文档的相关性关系、用户的个人喜好、产生的展示信息的质量等),并不完全依赖于客观上当前文档与用户信息需求的绝对相关性.因此,日志中用户的点击行为包含了大量的噪音,研究过程中不能简单地认为“点击”=“相关”或者“不点击”=“不相关”,即直接使用从日志中提取的有关文档相关性的特征并不可靠.
针对这一问题,处理办法之一就是对文档相关性和用户浏览行为、点击行为共同建模,这样就可以预测文档的绝对相关性的分布,这些模型被称为点击模型[1-6].点击模型通常通过假设用户搜索中各种行为之间以及用户行为和搜索结果特征之间的依赖关系,对用户的搜索过程进行建模.在这个模型中,搜索用户的行为和搜索结果的特征属性被建模为变量;而各种行为之间的影响,以及搜索结果特征属性……
登录APP查看全文