融合上下文语义信息的汉越平行短语对抽取方法
2021-06-24高盛祥余正涛朱浩东文永华
云南民族大学学报(自然科学版) 2021年3期
杨 舰,高盛祥,余正涛,朱浩东,文永华
(1.昆明理工大学 信息工程与自动化学院,云南 昆明 650500; 2.昆明理工大学 云南省人工智能重点实验室,云南 昆明 650500)
自然处理应用依赖于大规模的平行语料库,而这种平行语料仅可用于少数几种语言,比如英语、中文、少数欧洲语言等,对于大多数其他语言,并行数据实际上是稀缺的.可比语料作为一种丰富型资源,为数据稀疏性问题提供了一种可能的解决方案.虽然在2个可比较的文档之间很少有句子级平行的情况,但是在可比较的语料库中仍然存在潜在的大量并行短语,从可比语料中抽取平行短语对能缓解资源匮乏的语言数据稀疏性问题.
随着互联网的快速发展,网络上存在大量的汉越可比语料资源,如维基百科的汉越对照页面,双语新闻网站等,这些新闻都是对同一事件进行描述,但并不是完全对齐的双语文本.从这些双语文本能很好的提取双语知识,主要的提取任务有双语词典抽取,其主要是基于WordNet的语义相似性度量的使用,它可以消除翻译后的上下文向量的歧义,然后通过种子字典构建2种语言之间的双语词典,这个方法的关键是种子字典,它在影响精度方面起着重要作用[1].如双语短语对抽取,Zhang等使用SVM来从可比语料中抽取平行短语对,但是该方法需要人工设计短语特征,如:短语长度差、短语单词数目等等,非常耗费人力和资源[2].近年来,随着将词使用分布式表示方法得到低……
登录APP查看全文