APP下载

一种基于Hownet的词向量表示方法

2019-01-29陈洋罗智勇

北京大学学报(自然科学版) 2019年1期
关键词:模型

陈洋 罗智勇

1.北京语言大学信息科学学院, 北京 100083; 2.北京语言大学语言信息处理研究所, 北京 100083;† 通信作者, E-mail: luo_zy@blcu.edu.cn

近年来, 基于深度学习的神经网络模型在自然语言处理领域取得突破性进展, 而词向量通常作为模型输入的标准配置。词向量的思想基于分布假说[1],其形式是一个稠密而连续的实数向量。目前训练词向量最常用的方法有 Mikolov 等[2-3]提出的 word2vec以及 Pennington 等[4]提出的 Glove 等, 这些方法在大规模语料中通过目标词和上下文词语的共现训练而得到词向量, 但这种纯粹基于数据驱动进行训练来获取词向量的方法存在性能不稳定[5]、低频词词向量的质量不高[6]等不足。如何将已有的人工知识库结合到词向量的训练中, 以便提升词语向量的表示质量, 成为值得关注的问题。

Hownet[7]等人工知识库是基于离散符号表示,词向量是连续而稠密的。本文提出一种以 Hownet义原向量为基础的词向量表示方法, 将离散形式的人工知识恰当地转化为连续向量表示形式。Hownet 中义原定义为一个最基本的、不易再分割的意义最小的单位, 每个词都可以由若干个义原来组合表示。假定目前Hownet中所有义原之间相互独立且完备, 则每个词语都可视为由其构成的义原向量所张成的子空间内的一个投影, 每个词语的向量表示可以转化为这个词语管辖的所有义原向量的加权平均。通过这种方式, 我们就可以将义原这种离散符号形式表示转换为连续而稠密的数学向量, 这种指定义原向量、通过计算得到词向量的方法更符合语言学定义且高效, 不需要进行训练的初始词向量就可以取得与现有训练方式的词向量相当的效果。……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用