APP下载

基于相码模型的汉字表征

2021-05-07范晓明王斌君

科学技术与工程 2021年5期
关键词:文本模型

范晓明, 王斌君

(1.中国人民公安大学信息技术与网络安全学院, 北京 100038; 2.北京警察学院网络安全保卫系, 北京 102202)

汉字表征(characterization of Chinese characters),可理解为通过某些特定的字符或符号集表示汉字的过程,而表征技术则可看作一种变换函数,将汉字映射到某一特殊的向量空间,这一向量空间由一组给定的字符集表示。对汉字表征技术的研究,可追溯到中文信息技术发展初期,当时主要围绕如何高效实现汉字录入的问题进行研究,以五笔为代表的形码表征方式和以拼音为代表的音码表征方式分别借助汉字字形特征和汉语拼音方案实现了汉字集向小字符集(键盘对应的字符)映射,后期出现的手写汉字识别[1]、语音识别[2]等技术,则是将汉字视为笔画、音节的空域或时域序列信号,利用隐马尔可夫模型(hidden Markov model,HMM)[3]等统计模型进行汉字相关特征的识别。目前,利用越来越成熟的中文分词[4]以及词嵌入(word embedding)[5]技术,基本可将适用英文的自然语言处理(natural language processing,NLP)深度学习模型迁移到中文处理中,但在解决未登录词(out of vocabulary,OOV)和低频词(low frequency words)问题时,由于汉字的复杂性,中国学者无法直接将英文场景中的字符级(character-level)语言模型进行同级别迁移,需要借助笔画、部件、拼音等转码方式进行中文文本的细粒度表达,围绕这一需求,现尝试构建一种新的编码模型,期望能得到拉丁字母序列码与汉字的最佳映射关系,能以类似英文单词(word)的编码融合汉字的多种字符级特征,并用于NLP相关模型中。

1 相关研究

传统方法中,文本主要以独热(One-Hot)编码、词频-逆文件频率(TF-IDF)、词袋(BOW)等方式表示。……

登录APP查看全文

猜你喜欢

文本模型
一半模型
初中群文阅读的文本选择及组织
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
FLUKA几何模型到CAD几何模型转换方法初步研究
如何快速走进文本