APP下载

基于跨语言语料的汉泰词分布表示*

2016-01-26张金鹏,周兰江,线岩团等

计算机工程与科学 2015年12期



基于跨语言语料的汉泰词分布表示*

通信地址:650500 云南省昆明市昆明理工大学信息工程与自动化学院Address:School of Information Engineering and Automation,Kunming University of Science and Technology,Kunming 650500,Yunnan,P.R.China

张金鹏1,2,周兰江1,2,线岩团1,2,余正涛1,2,何思兰3

(1.昆明理工大学信息工程与自动化学院,云南 昆明 650500;

2.昆明理工大学智能信息处理重点实验室,云南 昆明 650500;3.昆明理工大学理学院,云南 昆明 650500)

摘要:词汇的表示问题是自然语言处理的基础研究内容。目前单语词汇分布表示已经在一些自然语言处理问题上取得很好的应用效果,然而在跨语言词汇的分布表示上国内外研究很少,针对这个问题,利用两种语言名词、动词分布的相似性,通过弱监督学习扩展等方式在中文语料中嵌入泰语的互译词、同类词、上义词等,学习出泰语词在汉泰跨语言环境下的分布。实验基于学习到的跨语言词汇分布表示应用于双语文本相似度计算和汉泰混合语料集文本分类,均取得较好效果。

关键词:弱监督学习扩展;跨语言语料;跨语言词汇分布表示;神经概率语言模型

1引言

词汇表征问题是自然语言处理的重要内容,是信息检索、数据挖掘、知识图谱构建等研究方向的重要技术支持。基于统计机器学习的词汇表征方法的目标是从自然语言文本中学习出词序列的概率表示函数,其面临的一个困难在于词向量的维度灾难与数据稀疏问题[1],在训练的过程中每一个词序列与其它训练语料中的词序列在离散空间表示时有很大的不同。在单语词汇的空间表示过程中,一个传统但有效的方法是n元语法模型,它通过学习目标词汇一个短的窗口信息来预测目标词汇出现的概率。……

登录APP查看全文