融合k均值聚类与LSTM网络的半监督词义消歧
2021-02-21张春祥周雪松高雪瑶
张春祥,周雪松,高雪瑶,刘 欢
(哈尔滨理工大学 计算机科学与技术学院,黑龙江 哈尔滨 150080)
提高词义消歧的准确率是自然语言处理中的一个重要课题。通常,使用图来描述词义消歧问题。利用图中的结点来表示词,使用图中的边来表示词之间的关联关系。此时,词义消歧过程将转化为图的求解问题。文献[1-4]使用图的思想,将词汇单元作为图中的结点,利用边来描述上下文语义距离及关系,达到词义消歧的目的。TRIPODI等[5]提出了一种基于进化博弈论的词义消歧模型。利用分布信息来衡量每个单词对其它单词的影响,利用语义相似性来度量不同选择之间的兼容性。ERK等[6]提出了两种新的注释方案,词义相似度(Word Sense SIMilarity,WSSIM)注释和使用相似度(Usage SIMilarity,USIM)注释,在上下文中以分级的方式来描述词义。LOPEZ等[7]描述了一种通过选择歧义词最佳词义来实现特定领域的词义消歧(Word Sense Disambiguation,WSD)方法。文献[8-9]利用Web搜索引擎来获取词典资源,通过计算语义相似度来完成词义消歧任务。目前,神经网络在自然语言处理相关领域有着广泛的应用[10-12]。PESARANGHADER等[13]利用深度学习算法来提取语料中的关键特征,从而确定歧义词汇的语义类别。CALVO等[14]提出了一种不限制固定语料集的深层神经网络词义消歧方法。RUAS等[15]根据歧义词的多种语义和歧义词所在上下文中的特定语义,建立多语义嵌入模型来进行消歧和标注。文献[16-17]利用WordNet和HowNet中的语义注释和语义关系,挖掘了义原之间的深度和密度对语义相似度的影响。唐善成等[18]提出了基于Seq2Seq模型的非受限词义消歧方法。……
