融合主题模型及双语词向量的汉缅双语可比文档获取方法
2021-03-18李训宇毛存礼余正涛高盛祥王振晗张亚飞
中文信息学报 2021年1期
李训宇, 毛存礼, 余正涛, 高盛祥, 王振晗, 张亚飞
(1. 昆明理工大学 信息工程与自动化学院,云南 昆明 650500;2. 昆明理工大学 云南省人工智能重点实验室,云南 昆明 650500)
0 引言
缅甸语属于资源稀缺型语言,故汉缅平行语料比较少。但互联网上存在一些主题相关,内容相似的汉缅双语可比新闻文档,这些双语新闻是抽取双语平行词汇、双语平行句对的重要数据资源。
获取双语可比文档的核心思想是计算双语文档的相似度,目前针对双语文档相似度的计算问题,主要有以下四类方法: ①基于词典匹配的方法,这类方法的思想是利用词典把跨语言文本转换为中间层语言计算文档相似度,例如,Steinberger等人[1]提出一种中间层语言思想,使用多语言词典EUROVOC计算英文和西班牙文的文本相似度;石杰等人[2]利用语义词典WordNet将中文和泰文文本转换为中间层语言,计算中泰文本相似度,从而得到中泰可比语料。②基于机器翻译模型方法,这类方法的思想是将源语言翻译成目标语言,计算跨语言文档的相似度,如王洪俊等人[3]提出基于统计翻译模型,计算文档互译词对数,改进Dice相似度计算方法进行双语文档相似度计算;Barrón-Cedeo等人[4]基于统计翻译模型提出CLiPA(cross-lingual plagiarism analysis)方法,根据贝叶斯原理估算两种语言文档互译的概率; Maike等人[5]将源语言文本翻译成目标语言文本,然后在目标语言空间中计算相似度,从而获取可比文档,Otero等人[6]通过维基百科中跨语言链接获得翻译等价对,从而获取双语可比文档。……
登录APP查看全文
