基于词映射构建伪查询改善低资源跨语言信息检索研究
2022-06-07李岩郭军军余正涛高盛祥
山西大学学报(自然科学版) 2022年2期
李岩 ,郭军军 *,余正涛,高盛祥
(1.昆明理工大学 信息工程与自动化学院,云南 昆明 650504;2.昆明理工大学 云南省人工智能重点实验室,云南 昆明 650504)
0 引言
跨语言信息检索(Cross-language information retrieval,CLIR),即用一种语言的查询检索出用另一种语言的相关文档信息[1-4]。跨语言检索可以有效地实现区域内国家之间的信息沟通和交互,因此具有非常重要的研究意义。目前,CLIR已经成为信息检索(Information Retrieval,IR)领域中最重要的研究课题之一。然而,由于查询和文档属于不同的语言,存在巨大的语义鸿沟,因此,如何匹配用户的查询和其他语言编写的文档成了巨大的挑战。
如何构建统一的语义空间并实现跨语言在统一语义空间中的表征,然后在公共语义空间中实现跨语言检索,是CLIR要解决的首要问题。在已有成果中,解决语言差异性最常用的方法还是查询翻译[5-6]、文档翻译[7-8]或同时使用查询文档翻译[9],然后执行单语 IR[10-15]。文献[16]基于双语词典解决歧义和多重匹配问题,实现了跨语言相似内容的检索。然而,上述基于机器翻译CLIR方法严重依赖机器翻译的质量,对于低资源语言来说,低质量机器翻译误差的累积,会对后续的检索任务产生极大的影响,甚至导致检索的失败。
为了解决低资源语言跨语言信息检索中的语义对齐问题,受文献[17]的启发,拟基于更容易获得且准确率较高的词对齐信息对跨语言语义对齐任务进行指导,我们使用预先构建的双语映射词典基于词映射生成伪查询,并且利用伪查询句来指导跨语言信息检索。……
登录APP查看全文