融合中文字形和字义的字向量表示方法
2021-11-23唐善成张镤月王瀚博
唐善成, 张 雪, 张镤月, 王瀚博, 陈 明
(西安科技大学通信与信息工程学院, 西安 710054)
字词向量表示是自然语言处理[1]的基础,在表音文字领域,如英文,需用词向量表示文本;在表义文字领域,如中文,由于每个字具有特定语义(与英文中的字母不同)[2-3],可以用字向量、词向量表示文本[4-6]。Mikolov等[7]提出了Word2Vec;Pennington等[8]提出了GloVe在词向量表示方面取得了较大的进展。Word2Vec 的原理是用一个词预测前后词,或者用前后词预测当前词,然后利用语言模型来判断输入的样本是否符合自然语言规则。GloVe结合了潜在语义分析(latent semantic analysis,LSA)和Word2Vec的思想,使用语料库的全局统计特征和局部的上下文特征。
以上方法适用于英文,而中文较英文有独特特性。汉字起源于象形文字,字形蕴含着丰富的语义信息[9-10]。中文字向量表示方法相关研究有:Su等[11]利用字形学习汉字的表现形式,验证了字形特征能够增强汉字的表示;谢海闻等[12]提出了一种基于胶囊神经网络的汉字字形表征模型,将汉字拆分为部件并进行识别并生成表征向量,选出部分部件组成向量用于字形的表征;Meng等[13]将汉字作为图像,利用Tianzige-卷积神经网络(convolutional neural networks,CNN) 模型提取汉字语义,性能得到提升;蔡子龙等[14]提出了汉字字形融合方法,用部分替代法和辅助学习法从字形位图中提取汉字的字形特征;Wang等[15]提取汉字局部结构特征,整合词根挖掘的隐式信息,增强了嵌入语义。
以上方法借鉴了英文词向量表示方法,所需训练数据集较庞大,字向量质量稳定性差[16],没有考虑汉字整体字形结构所蕴含的语义信息,没有利用字典包含的稳定字义信息。……
