一种支持混合语言的并行查询纠错方法
2016-05-04熊锦华马宏远程舒杨程学旗
中文信息学报 2016年2期
颛 悦,熊锦华,马宏远,程舒杨,程学旗
(1. 中国科学院 计算技术研究所,北京 100190 2. 中国科学院大学,北京 100190 3. 国家计算机网络应急技术处理协调中心,北京 100029)
一种支持混合语言的并行查询纠错方法
颛 悦1,2,熊锦华1,马宏远3,程舒杨1,程学旗1
(1. 中国科学院 计算技术研究所,北京 100190 2. 中国科学院大学,北京 100190 3. 国家计算机网络应急技术处理协调中心,北京 100029)
中文信息检索系统中的查询语句包含中文字、拼音、英文等多种形式,而有些查询语句过长,不利于纠错处理。现有的查询纠错方法不能很好的解决中文检索系统中的混合语言与中文长查询的问题。为了解决上述两个问题,该文提出了一种支持混合语言的并行纠错方法。该方法通过对混合语言统一编码,建立统一编码语言模型和异构字符词典树,并根据语言特点制定相应的编辑规则对查询词语进行统一处理,其中,针对中文长查询,提出双向并行的纠错模型。为了并行处理查询语句,我们在字符词典树和语言模型的基础上提出了逆向字符词典树和逆向语言模型的概念。模型中使用的训练语料库是从用户查询日志、网页点击日志、网页链接信息等文件中提取的高质量文本。实验表明,与单向查询纠错相比,支持混合语言的并行纠错方法在准确率上提升了9%,召回率降低了3%,在速度上提升了40%左右。
查询纠错;词典树;语言模型;并行纠错
1 引言
查询纠错是针对信息检索系统中查询语句的拼写纠错。据统……
登录APP查看全文
