融合多粒度特征的低资源语言词性标注和依存分析联合模型
2023-10-24毛存礼余正涛高盛祥黄于欣王振晗
中文信息学报 2023年7期
陆 杉,毛存礼,余正涛,高盛祥,黄于欣,王振晗
(1. 昆明理工大学 信息工程与自动化学院,云南 昆明 650500;2. 昆明理工大学 云南省人工智能重点实验室,云南 昆明 650500)
0 引言
泰语、越南语皆属于资源稀缺型语言,其相关依存分析研究较少并且效果不佳。大多数传统的依存分析模型都靠人工定义核心的特征工程[1-2],但是这种方法受特征选取的影响较大,随着深度神经网络技术为自然语言处理研究带来崭新建模方式和性能上的巨大提升,基于神经网络的依存分析方法成为研究热点[3-5]。
目前,基于神经网络的依存分析主流的方法为基于转移的依存分析[4]和基于图的依存分析[5]。基于图的依存分析方法的目的是寻找一棵最大生成树,得到句子的整体的依存结构全局最优解,该方法对长距离依存分析准确率较高,可处理非投射现象,但模型解码时需进行全局搜索,算法复杂度较高,耗时较长。而基于转移的依存分析将句子的解码过程建模为一个有限自动机问题,使模型可以达到线性时间复杂度,但其采用的是局部搜索策略,容易出现错误传递现象,且准确率要低于基于图的依存分析方法。
无论是基于图的方法还是基于转移的方法,编码层都只使用了简单的词向量表示,如图1所示。泰语句子在进行依存分析的过程中仅仅利用了词语的语义,然而,泰语由字符、子词以及词语三种粒度组成,将三种不同粒度的表征结合能从各个层面更好地表征其语义信息。……
登录APP查看全文
