基于相码模型的汉字表征
2021-05-07范晓明王斌君
范晓明, 王斌君
(1.中国人民公安大学信息技术与网络安全学院, 北京 100038; 2.北京警察学院网络安全保卫系, 北京 102202)
汉字表征(characterization of Chinese characters),可理解为通过某些特定的字符或符号集表示汉字的过程,而表征技术则可看作一种变换函数,将汉字映射到某一特殊的向量空间,这一向量空间由一组给定的字符集表示。对汉字表征技术的研究,可追溯到中文信息技术发展初期,当时主要围绕如何高效实现汉字录入的问题进行研究,以五笔为代表的形码表征方式和以拼音为代表的音码表征方式分别借助汉字字形特征和汉语拼音方案实现了汉字集向小字符集(键盘对应的字符)映射,后期出现的手写汉字识别[1]、语音识别[2]等技术,则是将汉字视为笔画、音节的空域或时域序列信号,利用隐马尔可夫模型(hidden Markov model,HMM)[3]等统计模型进行汉字相关特征的识别。目前,利用越来越成熟的中文分词[4]以及词嵌入(word embedding)[5]技术,基本可将适用英文的自然语言处理(natural language processing,NLP)深度学习模型迁移到中文处理中,但在解决未登录词(out of vocabulary,OOV)和低频词(low frequency words)问题时,由于汉字的复杂性,中国学者无法直接将英文场景中的字符级(character-level)语言模型进行同级别迁移,需要借助笔画、部件、拼音等转码方式进行中文文本的细粒度表达,围绕这一需求,现尝试构建一种新的编码模型,期望能得到拉丁字母序列码与汉字的最佳映射关系,能以类似英文单词(word)的编码融合汉字的多种字符级特征,并用于NLP相关模型中。
1 相关研究
传统方法中,文本主要以独热(One-Hot)编码、词频-逆文件频率(TF-IDF)、词袋(BOW)等方式表示。……
